ตัวทำ Normalization Unicode
แปลงข้อความเป็น Unicode normalization form ทั้ง 4 แบบ (NFC, NFD, NFKC, NFKD) ออนไลน์ พร้อมตรวจสอบ code point (U+XXXX) ของทุกตัวอักษร เพื่อหา combining marks, zero-width spaces และตัวอักษรหน้าตาคล้ายที่มองไม่เห็น
Loading tool...
ตัวทำ Normalization Unicode คืออะไร?
Unicode Normalizer เป็นเครื่องมือออนไลน์ฟรีที่แปลงข้อความระหว่าง Unicode normalization form ทั้ง 4 แบบ — NFC, NFD, NFKC และ NFKD พร้อมแสดง code point (U+XXXX) ที่แน่นอนของทุกตัวอักษรและมุมมอง escape ของข้อความต้นทาง เพื่อให้คุณเห็น combining marks, zero-width spaces และตัวอักษรหน้าตาคล้ายที่มองไม่เห็น ซึ่งเป็นสาเหตุของปัญหาการเปรียบเทียบข้อความ การตรวจจับข้อมูลซ้ำ และการจับคู่ search index ที่ผิดพลาด
ประโยชน์หลัก
- จับอักขระที่มองไม่เห็นที่ทำให้ข้อความสองชุดที่ดูเหมือนกันเปรียบเทียบแล้วไม่เท่ากัน
- มาตรฐานการจัดเก็บด้วย NFC ซึ่งเป็นค่าเริ่มต้นที่ W3C แนะนำสำหรับเว็บ
- รวมอักขระ compatibility ที่หน้าตาคล้าย (ligatures, ตัวยกกำลัง, fullwidth) ด้วย NFKC/NFKD
- ดีบักข้อความที่วางจาก Word, PDF และ rich editor ที่มีการจัดรูปแบบซ่อนอยู่
- ตรวจสอบ code point U+XXXX ของข้อความใด ๆ โดยไม่ต้องออกจากเบราว์เซอร์
กรณีการใช้งาน
- •Normalize เนื้อหาที่ผู้ใช้สร้างก่อนจัดเก็บในฐานข้อมูลเพื่อการค้นหาที่สม่ำเสมอ
- •ตรวจจับการโจมตีด้วย homoglyph และ combining-character ใน username หรือ URL
- •เตรียมข้อความหลายภาษาสำหรับการเรียงลำดับ, indexing หรือ matching ที่ไม่สนใจเครื่องหมายเสริมสระ
- •ทำความสะอาดข้อความที่ export จาก PDF หรือเอกสาร office ก่อน import ใหม่
- •ตรวจสอบว่า email หรือตัวระบุสองตัวเท่ากันทุก byte
วิธีใช้ตัวทำ Normalization Unicode
- วางหรือพิมพ์ข้อความของคุณ: กรอกข้อความที่ต้องการ normalize ลงในกล่องข้อความต้นทาง สามารถมีเครื่องหมายเสริมสระ, ligature, emoji หรือข้อความที่วางจาก Word, PDF หรือแหล่ง rich text อื่น ๆ ได้
- เลือกรูปแบบ normalization: เลือก NFC (ค่าเริ่มต้นของเว็บ, รวมอักขระ), NFD (แยกเป็นฐาน + combining marks), NFKC (compatibility composition) หรือ NFKD (compatibility decomposition)
- อ่าน code points และสถิติ: ข้อความที่ normalize แล้วจะแสดงในกล่องผลลัพธ์ ด้านล่างจะแสดง code point แบบ U+XXXX และข้อความต้นทางแบบ escape เพื่อเปิดเผยอักขระที่ซ่อนอยู่ พร้อมเปรียบเทียบจำนวนตัวอักษรว่าเปลี่ยนแปลงหรือไม่
- คัดลอกผลลัพธ์: กด Copy เพื่อคัดลอกข้อความที่ normalize แล้ว หรือใช้ปุ่ม Copy ถัดจาก code points เพื่อคัดลอกลำดับ U+XXXX สำหรับการ debug
คุณสมบัติหลัก
- รองรับ Unicode normalization form ครบทั้ง 4 แบบ: NFC, NFD, NFKC และ NFKD
- แสดง code point (U+XXXX) ของผลลัพธ์แบบเรียลไทม์
- มุมมองข้อความต้นทางแบบ escape ที่เปิดเผยอักขระที่มองไม่เห็น (tab, บรรทัดใหม่, อักขระควบคุม)
- เปรียบเทียบจำนวนตัวอักษรว่าการ normalize เปลี่ยนความยาว grapheme หรือไม่
- คัดลอกได้ทั้งข้อความที่ normalize แล้วและลำดับ code point
- ทำงานทั้งหมดในเบราว์เซอร์ ไม่มีข้อมูลออกจากอุปกรณ์