유니코드 변환기
텍스트 ↔ \uXXXX 이스케이프 변환, 문자별 코드 포인트 검사기 포함
| 문자 | 코드 포인트 | UTF-8 바이트 |
|---|
유니코드 변환기란 무엇인가요?
화면에 보이는 모든 문자 뒤에는 숫자 코드포인트가 있습니다. 알파벳, 이모지, 한자 모두 저마다 고유한 코드포인트를 가지며, UTF-8이 그 코드포인트를 바이트로 인코딩합니다. 대부분의 경우 이 층위를 볼 일이 없지만, 이스케이프된 JSON 문자열, 깨진 글자, 인코딩 버그의 모습으로 불쑥 나타납니다. 이 도구는 텍스트를 \uXXXX 이스케이프 시퀀스로 바꾸거나 그 반대로 바꾸고, 각 문자의 코드포인트, 십진수 값, 원시 UTF-8 바이트까지 검사해 주며 입력과 동시에 갱신됩니다. 개발자, 번역가, 그리고 깨진 문자열 앞에서 머리를 싸맨 적이 있는 모든 사람을 위한 도구입니다.
디코딩·검사하는 내용
- 🔄 텍스트와 \uXXXX 이스케이프 시퀀스 상호 변환
- 🔍 문자별 검사기: 코드포인트 U+XXXX, 십진수 값, UTF-8 바이트
- 🔢 이모지처럼 기본 다국어 평면을 넘는 문자도 코드포인트 단위로 처리
- ⚡ 입력하는 즉시 결과 갱신
인코딩 층위가 중요해지는 때
- 이메일이나 데이터베이스에서 깨져 보이는 문자열 디버깅
- 비ASCII 텍스트로 JSON을 손으로 작성할 때 이스케이프 기재
- 이모지나 한자가 레거시 시스템을 망가뜨리는 이유 이해
- 특정 문자가 파일에 실제로 몇 바이트로 저장되는지 확인
모든 것이 브라우저 안에서 이루어지며 텍스트는 업로드되지 않습니다. 이스케이프는 비ASCII 문자와 제어 문자에만 적용되므로 순수 ASCII 출력은 그대로 읽을 수 있습니다.
마지막 업데이트 · 2026-09-01
코드포인트·서로게이트·UTF-8 폭
- U+1F600 은 문자 하나, UTF-16 두 유닛(서로게이트 페어), UTF-8 네 바이트 — 같은 이모지에 세 가지 길이.
- \uXXXX 는 UTF-16 을, \u{...} 는 온전한 코드포인트를 부호화 — 언어가 틀리면 이모지는 소리 없이 쪼개집니다.
- 아래 바이트 보기는 저장과 네트워크층이 볼 그 자체를 보여줍니다.
문자 하나는 바이트 하나가 아닙니다
양방향 이스케이프 변환
일반 텍스트는 대문자 4자리 16진수의 \uXXXX 시퀀스가 되고, 출력 가능한 ASCII는 그대로 유지됩니다. 이스케이프를 다시 붙여 넣으면 문자로 되돌아갑니다.
문자 하나하나 검사
문자열의 모든 코드 포인트가 U+XXXX 형식, 10진수 값, 원시 UTF-8 바이트와 함께 나열됩니다. 이모지, 한자, 제어 코드까지 포함되며 처음 200자까지 표시됩니다.
모지바케 해독용
JSON 페이로드에 텍스트 대신 \u4f60\u597d가 표시되면 여기에 붙여 넣어 실제 문자열을 읽어 보세요. 깨진 출력을 이스케이프로 바꾸면 정확히 어떤 바이트가 잘못됐는지도 확인할 수 있습니다.
자주 묻는 질문
코드 포인트와 UTF-16 코드 유닛의 차이는 무엇인가요?⌄
대부분의 문자는 16비트 코드 유닛 하나에 들어가지만, 기본 다국어 평면 밖에 있는 문자(예: 많은 이모지)는 두 개가 필요합니다 — 이를 "서로게이트 쌍"이라고 합니다. 이 검사기는 코드 포인트 단위로 읽으므로, 이런 문자도 두 줄이 아닌 한 줄로 올바르게 표시됩니다.
\uXXXX 이스케이프는 언제 필요한가요?⌄
JSON 문자열, JavaScript 문자열 리터럴, 그리고 원시 UTF-8 텍스트를 허용하지 않는 여러 설정/속성 파일 형식 안에서 비ASCII 문자를 표현하는 표준적인 방법입니다.
입력한 텍스트가 어딘가로 업로드되나요?⌄
아니요. 모든 처리는 일반 JavaScript로 브라우저 안에서 이루어집니다. 입력한 내용이 서버로 전송되는 일은 전혀 없습니다.
어떤 로그에서 이모지가 이상한 네모 두 개로 보이는 이유는?⌄
로거가 서로게이트 페어를 두 개의 독립 이스케이프(D83D DE00)로 출력했기 때문입니다. 따로 다루는 모든 처리가 쌍을 부숩니다; 합치거나 로거를 \u{1F600} 식 코드포인트 이스케이프로 바꾸면 얼굴이 온전히 돌아옵니다.