Конвертер Юникода
Текст ↔ escape-последовательности \uXXXX, плюс инспектор кодовых точек для каждого символа
| Символ | Кодовая точка | Байты UTF-8 |
|---|
Что такое конвертер Юникода?
За каждым символом на экране стоит числовой кодовый пункт — у буквы, эмодзи и китайского иероглифа он свой — а UTF-8 кодирует эти кодовые пункты в байты. Обычно этот слой невидим, но он всплывает в экранированных JSON-строках, «кракозябрах» и ошибках кодировки. Этот инструмент переводит текст в escape-последовательности \uXXXX и обратно, а также инспектирует каждый символ: кодовый пункт, десятичное значение и сырые байты UTF-8 — всё обновляется прямо при вводе. Он предназначен для разработчиков, переводчиков и всех, кто хоть раз смотрел на строку, превратившуюся в мусор.
Что он декодирует и проверяет
- 🔄 Текст в escape-последовательности \uXXXX и обратно
- 🔍 Инспектор по символам: кодовый пункт U+XXXX, десятичное значение и байты UTF-8
- 🔢 Корректно работает с символами вне основной плоскости, например эмодзи
- ⚡ Результаты обновляются в реальном времени при вводе
Когда слой кодировки важен
- Разобраться, почему строка в письме или базе данных выглядит как абракадабра
- Вручную писать JSON с escape-последовательностями для не-ASCII текста
- Понять, почему эмодзи или иероглиф ломает старую систему
- Узнать, какие байты файл реально хранит для конкретного символа
Всё выполняется локально в вашем браузере; никакой текст не загружается. Экранируются только не-ASCII и управляющие символы, поэтому чистый ASCII-вывод остаётся читаемым.
Обновлено · 2026-09-01
Кодовые точки, суррогаты и ширины UTF-8
- U+1F600 — это один символ, две единицы UTF-16 (суррогатная пара), четыре байта UTF-8 — три длины одного эмодзи.
- \uXXXX кодирует UTF-16; \u{...} — полные точки; не в том языке эмодзи молча раскалывается.
- Байтовый вид показывает ровно то, что увидят хранение и сеть.
Один символ — не один байт
Экранирование в обе стороны
Обычный текст превращается в последовательности \uXXXX с четырёхзначным шестнадцатеричным кодом в верхнем регистре, а печатаемые символы ASCII остаются нетронутыми; вставленные обратно экранирования снова становятся символами.
Инспектор по каждому символу
Каждая кодовая точка строки приводится в форме U+XXXX, с десятичным значением и сырыми байтами UTF-8 – включая эмодзи, китайские иероглифы и управляющие коды, до первых 200 символов.
Для расшифровки кракозябр
Когда в JSON-нагрузке вместо текста видно \u4f60\u597d, вставьте его сюда, чтобы прочитать настоящую строку, либо превратите повреждённый вывод в экранирования и увидите, какие байты неверны.
Частые вопросы
В чём разница между кодовой точкой и кодовой единицей UTF-16?⌄
Большинство символов помещаются в одну 16-битную кодовую единицу, но символы за пределами основной многоязычной плоскости (например, многие эмодзи) требуют двух — "суррогатной пары". Инспектор читает по кодовым точкам, поэтому такие символы корректно отображаются одной строкой, а не двумя.
Зачем нужны escape-последовательности \uXXXX?⌄
Это стандартный способ представления не-ASCII символов внутри строк JSON, строковых литералов JavaScript и многих форматов конфигурационных/property-файлов, которые не принимают необработанный текст UTF-8.
Загружается ли мой текст куда-либо?⌄
Нет — всё выполняется в вашем браузере на обычном JavaScript. Ничего из того, что вы вводите, никогда не отправляется на сервер.
Почему мой эмодзи в некоторых логах — два странных квадрата?⌄
Логгер напечатал суррогатную пару двумя отдельными эскейпами (D83D DE00). Всё, что обходит их порознь, ломает пару; склейте или переключите лог на точечные эскейпы вида \u{1F600} — лицо вернётся целым.
Похожие инструменты
Похожие инструменты
Счётчик текста
Подсчёт слов, символов, строк, абзацев и предложений в реальном времени, плюс время чтения
Инструменты для строк текста
Удаляйте дубликаты и пустые строки, обрезайте пробелы, сортируйте и меняйте порядок — всё за один раз
Конвертер регистра
ВЕРХНИЙ РЕГИСТР, нижний регистр, Title Case, camelCase, snake_case и другие