यूनिकोड कन्वर्टर
टेक्स्ट ↔ \uXXXX एस्केप, साथ ही प्रति-अक्षर कोड-पॉइंट इंस्पेक्टर
| अक्षर | कोड पॉइंट | UTF-8 बाइट्स |
|---|
यूनिकोड कन्वर्टर क्या है?
स्क्रीन पर हर अक्षर के पीछे एक संख्यात्मक कोड पॉइंट होता है — एक अक्षर, एक इमोजी, एक चीनी वर्ण, सबका अपना — और UTF-8 इन कोड पॉइंट्स को बाइट्स में बदलता है। ज़्यादातर समय यह परत दिखती नहीं, लेकिन यह एस्केप की गई JSON स्ट्रिंग्स, मोजिबेक और एन्कोडिंग बग्स में सामने आती है। यह टूल टेक्स्ट को \uXXXX एस्केप सीक्वेंस में बदलता है और वापस भी, और हर अक्षर का निरीक्षण करता है: कोड पॉइंट, दशमलव मान और कच्चे UTF-8 बाइट्स — सब टाइप करते ही। यह डेवलपर्स, अनुवादकों और उन सबके लिए है जिन्होंने कभी बेकार दिखने वाली स्ट्रिंग घूरकर देखी है।
यह क्या डिकोड और जाँचता है
- 🔄 टेक्स्ट से \uXXXX एस्केप सीक्वेंस, और एस्केप से टेक्स्ट
- 🔍 हर अक्षर की जाँच: कोड पॉइंट U+XXXX, दशमलव मान, UTF-8 बाइट्स
- 🔢 इमोजी जैसे बेसिक प्लेन से बाहर के अक्षरों को कोड पॉइंट से संभालता है
- ⚡ टाइप करते ही नतीजे अपडेट
एन्कोडिंग परत कब मायने रखती है
- ईमेल या डेटाबेस में गड़बड़ दिखने वाली स्ट्रिंग की समस्या जानना
- गैर-ASCII टेक्स्ट के लिए हाथ से JSON में एस्केप सीक्वेंस लिखना
- समझना कि इमोजी या CJK अक्षर पुराने सिस्टम को क्यों तोड़ते हैं
- यह देखना कि किसी अक्षर के लिए फ़ाइल में असल में कौन से बाइट्स स्टोर हैं
सब कुछ आपके ब्राउज़र में होता है; कोई टेक्स्ट अपलोड नहीं होता। एस्केप केवल गैर-ASCII और नियंत्रण अक्षरों पर लागू होता है, इसलिए शुद्ध ASCII आउटपुट पढ़ने लायक बना रहता है।
अंतिम अपडेट · 2026-09-01
code points, surrogates, UTF-8 widths
- U+1F600 = 1 character, UTF-16 में 2 units (surrogate pair), UTF-8 में 4 bytes — एक emoji, तीन lengths।
- \uXXXX UTF-16 encode करता है; \u{...} full code points — ग़लत भाषा में emoji चुपचाप टूट जाता है।
- byte view वही दिखाती है जो storage/network layers देखेंगी।
एक character एक byte नहीं होता
दोनों दिशाओं में एस्केप
सादा टेक्स्ट बड़े अक्षरों वाले चार-अंकीय हेक्स के साथ \uXXXX अनुक्रमों में बदलता है, जबकि प्रिंट करने योग्य ASCII अछूता रहता है; वापस चिपकाए गए एस्केप फिर से वर्णों में बदल जाते हैं।
हर वर्ण की जाँच
आपकी स्ट्रिंग का हर कोड पॉइंट उसके U+XXXX रूप, दशमलव मान और कच्चे UTF-8 बाइट्स के साथ सूचीबद्ध होता है – इमोजी, चीनी वर्ण और नियंत्रण कोड सहित, पहले 200 तक।
मोजीबेक समझने के लिए
जब JSON पेलोड में टेक्स्ट की जगह \u4f60\u597d दिखे, तो उसे यहाँ चिपकाकर असली स्ट्रिंग पढ़ें, या किसी भी गड़बड़ आउटपुट को एस्केप में बदलकर देखें कि कौन से बाइट गलत हैं।
अक्सर पूछे जाने वाले प्रश्न
कोड पॉइंट और UTF-16 कोड यूनिट में क्या अंतर है?⌄
अधिकांश अक्षर एक 16-बिट कोड यूनिट में समा जाते हैं, लेकिन बेसिक मल्टीलिंगुअल प्लेन के बाहर के अक्षरों (जैसे कई इमोजी) को दो की ज़रूरत होती है — एक "सरोगेट पेयर"। इंस्पेक्टर कोड पॉइंट के अनुसार पढ़ता है, इसलिए ऐसे मामले एक पंक्ति में सही ढंग से दिखते हैं, दो में नहीं।
मुझे \uXXXX एस्केप की ज़रूरत क्यों पड़ेगी?⌄
ये JSON स्ट्रिंग्स, JavaScript स्ट्रिंग लिटरल्स, और कई ऐसे कॉन्फ़िग/प्रॉपर्टी फ़ाइल फ़ॉर्मेट्स के अंदर गैर-ASCII अक्षरों को दर्शाने का मानक तरीका है जो कच्चा UTF-8 टेक्स्ट स्वीकार नहीं करते।
क्या मेरा टेक्स्ट कहीं अपलोड होता है?⌄
नहीं — सब कुछ आपके ब्राउज़र में सामान्य JavaScript से चलता है। आपके द्वारा टाइप किया गया कुछ भी कभी सर्वर पर नहीं भेजा जाता।
कुछ logs में emoji दो अजीब boxes क्यों दिखता है?⌄
logger ने surrogate pair को दो अलग escapes (D83D DE00) के रूप में छापा। इन्हें अलग treat करने वाला हर code pair तोड़ देता है; जोड़ें, या logger को \u{1F600} जैसे code-point escapes पर बदलें — face intact लौटेगा।
संबंधित टूल
संबंधित टूल
टेक्स्ट काउंटर
शब्द, अक्षर, पंक्ति, अनुच्छेद और वाक्य की लाइव गिनती, साथ ही पढ़ने का अनुमानित समय
टेक्स्ट लाइन टूल्स
डुप्लीकेट या खाली पंक्तियाँ हटाएँ, ट्रिम करें, सॉर्ट करें और उल्टा करें — सब एक ही बार में
केस कन्वर्टर
अपरकेस, लोअरकेस, Title Case, camelCase, snake_case और अधिक