tomai
Войти
Бесплатно · Текстовые инструменты

Конвертер Юникода

Текст ↔ escape-последовательности \uXXXX, плюс инспектор кодовых точек для каждого символа

Текст
Escape-последовательности Юникода
Инспектор символов
Символ Кодовая точка Байты UTF-8

Что такое конвертер Юникода?

За каждым символом на экране стоит числовой кодовый пункт — у буквы, эмодзи и китайского иероглифа он свой — а UTF-8 кодирует эти кодовые пункты в байты. Обычно этот слой невидим, но он всплывает в экранированных JSON-строках, «кракозябрах» и ошибках кодировки. Этот инструмент переводит текст в escape-последовательности \uXXXX и обратно, а также инспектирует каждый символ: кодовый пункт, десятичное значение и сырые байты UTF-8 — всё обновляется прямо при вводе. Он предназначен для разработчиков, переводчиков и всех, кто хоть раз смотрел на строку, превратившуюся в мусор.

Что он декодирует и проверяет

  • 🔄 Текст в escape-последовательности \uXXXX и обратно
  • 🔍 Инспектор по символам: кодовый пункт U+XXXX, десятичное значение и байты UTF-8
  • 🔢 Корректно работает с символами вне основной плоскости, например эмодзи
  • ⚡ Результаты обновляются в реальном времени при вводе

Когда слой кодировки важен

  • Разобраться, почему строка в письме или базе данных выглядит как абракадабра
  • Вручную писать JSON с escape-последовательностями для не-ASCII текста
  • Понять, почему эмодзи или иероглиф ломает старую систему
  • Узнать, какие байты файл реально хранит для конкретного символа

Всё выполняется локально в вашем браузере; никакой текст не загружается. Экранируются только не-ASCII и управляющие символы, поэтому чистый ASCII-вывод остаётся читаемым.

Обновлено · 2026-09-01

Кодовые точки, суррогаты и ширины UTF-8

  • U+1F600 — это один символ, две единицы UTF-16 (суррогатная пара), четыре байта UTF-8 — три длины одного эмодзи.
  • \uXXXX кодирует UTF-16; \u{...} — полные точки; не в том языке эмодзи молча раскалывается.
  • Байтовый вид показывает ровно то, что увидят хранение и сеть.

Один символ — не один байт

Экранирование в обе стороны

Обычный текст превращается в последовательности \uXXXX с четырёхзначным шестнадцатеричным кодом в верхнем регистре, а печатаемые символы ASCII остаются нетронутыми; вставленные обратно экранирования снова становятся символами.

🔒

Инспектор по каждому символу

Каждая кодовая точка строки приводится в форме U+XXXX, с десятичным значением и сырыми байтами UTF-8 – включая эмодзи, китайские иероглифы и управляющие коды, до первых 200 символов.

🎯

Для расшифровки кракозябр

Когда в JSON-нагрузке вместо текста видно \u4f60\u597d, вставьте его сюда, чтобы прочитать настоящую строку, либо превратите повреждённый вывод в экранирования и увидите, какие байты неверны.

Частые вопросы

В чём разница между кодовой точкой и кодовой единицей UTF-16?

Большинство символов помещаются в одну 16-битную кодовую единицу, но символы за пределами основной многоязычной плоскости (например, многие эмодзи) требуют двух — "суррогатной пары". Инспектор читает по кодовым точкам, поэтому такие символы корректно отображаются одной строкой, а не двумя.

Зачем нужны escape-последовательности \uXXXX?

Это стандартный способ представления не-ASCII символов внутри строк JSON, строковых литералов JavaScript и многих форматов конфигурационных/property-файлов, которые не принимают необработанный текст UTF-8.

Загружается ли мой текст куда-либо?

Нет — всё выполняется в вашем браузере на обычном JavaScript. Ничего из того, что вы вводите, никогда не отправляется на сервер.

Почему мой эмодзи в некоторых логах — два странных квадрата?

Логгер напечатал суррогатную пару двумя отдельными эскейпами (D83D DE00). Всё, что обходит их порознь, ломает пару; склейте или переключите лог на точечные эскейпы вида \u{1F600} — лицо вернётся целым.

Похожие инструменты

Похожие инструменты