빠른 사용법
세 단계로 확인합니다.
- 1원문과 정규화 형식을 정합니다
원문 유지 또는 NFC·NFD·NFKC·NFKD 중 비교할 Unicode 정규화를 선택합니다.
- 2Escape와 서러게이트를 만듭니다
비 ASCII 코드포인트와 제어문자를 \uXXXX 및 올바른 서러게이트 쌍으로 표현합니다.
- 3엄격 복원과 길이를 확인합니다
짝이 깨진 서러게이트를 거부하고 코드포인트 수와 UTF-16 코드유닛 수를 비교합니다.
결과 읽기
보이는 글자 수와 코드포인트·코드유닛 수는 다를 수 있습니다.
이모지는 두 UTF-16 코드유닛을 쓰고 결합 문자는 여러 코드포인트가 한 글자처럼 보일 수 있어 목적에 맞는 단위를 구분해야 합니다.NORM정규화
NFC는 조합형을 합치는 경향, NFD는 분해하는 경향이 있으며 NFK 계열은 호환 문자를 바꿀 수 있습니다.
PAIR서러게이트 쌍
U+10000 이상 문자는 상위·하위 UTF-16 서러게이트 두 개로 Escape합니다.
STRICT엄격 복원
짝이 없는 서러게이트와 알 수 없는 역슬래시 이스케이프는 오류로 닫습니다.
정규화는 원문 byte와 검색·서명 결과를 바꿀 수 있습니다. 암호 서명·식별자·원본 보존 업무에서는 적용 전후를 반드시 구분하세요.
이럴 때 유용합니다.
- JSON Escape 디버깅
- 이모지 서러게이트 확인
- NFC·NFD 문자열 차이 비교
함께 확인하세요.
- 정규화로 byte 변경 가능
- 코드포인트 수가 사용자 인지 글자 수는 아님
- 짝이 깨진 서러게이트 거부
자주 묻는 질문
사용 전 알아둘 점
이모지는 왜 \u가 두 번 나오나요?
U+10000 이상 코드포인트를 UTF-16에서 상위·하위 서러게이트 두 코드유닛으로 표현하기 때문입니다.
NFC와 NFD 중 무엇을 써야 하나요?
시스템 규격에 따라 다릅니다. 검색·파일명·서명처럼 byte가 중요한 곳에서는 상대 시스템 기준을 확인하세요.
문자열이 서버에 저장되나요?
아닙니다. 정규화와 변환은 현재 브라우저에서만 수행합니다.