Unicode-Blöcke
Unicode teilt seinen Code-Raum in benannte Blöcke auf, jeweils ein zusammenhängender Bereich, der für eine Schrift oder eine Familie von Symbolen reserviert ist. Zu wissen, in welchem Block ein Zeichen lebt, verwandelt ein Mysterium – warum hat dieses Paste gebrochen, warum vermisst dieses Regex es – in eine beantwortbare Frage.
Die Block-Namen sind Bezeichner, keine Beschreibungen: Sie werden wörtlich in einem Regex als \p{Block=Cyrillic} und in jeder Unicode-Datendatei verwendet, also bleiben sie auf Englisch in jeder Sprache. Was übersetzt wird, ist der Satz neben ihnen.
Dies ist eine kuratierte Auswahl statt all der ungefähr 340 Blöcke – die, die entstehen, wenn du mit Text arbeitest. Die ASCII-Tabelle deckt den ersten Block vollständig ab; diese Seite beginnt, wo die endet.
Beispiel
5Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert.
| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | ASCII, unverändert: Lateinische Buchstaben, Ziffern, Interpunktion, Steuercodes | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Westeuropäische Akzente, plus £ § × ÷ und das geschützte Leerzeichen | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Zentral- und Osteuropäische Akzente — č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Zusätzliche Buchstaben für afrikanische und phonetische Rechtschreibungen | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamesisch und andere Multi-Akzent-Lateinische Buchstaben | ạ ế ṛ |
Kombinierende Zeichen und Modifizierer
4Diese hängen an dem Zeichen davor an und haben keine Breite für sich selbst.
| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Akzente angewendet auf das vorhergehende ZeichenDie zweite, zerlegte Weise, é zu schreiben. Normalisiere zu NFC, um sie zu brechen. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Hochgestellte Buchstaben und IPA-Stress und Tonmarken | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Unsichtbare Selektoren, die Text oder Emoji-Präsentation wählenVS16 ist, was ✔ in ein Emoji verwandelt. Unsichtbar, aber es zählt. | |
| U+FE20–U+FE2F | Combining Half Marks | Hälften von Zeichen, die sich über zwei Zeichen erstrecken |
Weitere Schriftsysteme
8| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Griechisch, und die Kopten-Buchstaben, die seinen Block teilen | α Ω π |
| U+0400–U+04FF | Cyrillic | Russisch, Ukrainisch, Serbisch, Bulgarisch und verwandte Alphabete | д Я ж |
| U+0590–U+05FF | Hebrew | Hebräische Buchstaben, Vokalzeichen und Gesangszeichen | א ש |
| U+0600–U+06FF | Arabic | Arabische Buchstaben, in ihren isolierten Formen | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, Sanskrit, Marathi und verwandte Sprachen | क ह |
| U+0E00–U+0E7F | Thai | Thailändische Konsonanten, Vokale und Tonmarken | ก ท |
| U+10A0–U+10FF | Georgian | Georgisch Mkhedruli | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Polytonisch Griechisch – die Akzente klassischer Texte | ᾰ ῶ |
Andere Schriften
5Die Quelle der meisten unsichtbaren Zeichen, die eine Copy-Paste überleben.
| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Bindestriche, lockige Anführungszeichen, Ellipsis – und die meisten unsichtbaren LeerzeichenU+200B Zero-Width-Raum und U+2060 Word-Joiner leben hier. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | Hochgestellt und tiefgestellt Ziffern und Buchstaben | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Währungssymbole, die Latin-1 keinen Platz für hat – €, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Symbole aus Buchstaben gebaut – ™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Vulgäre Brüche und Römische Ziffern als einzelne Zeichen | ⅓ ⅕ Ⅷ |
Interpunktion und Zahlen
9| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Pfeile in jede Richtung, einzeln und doppelt | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Mathematische Operatoren – ∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Tastatur und technische Symbole – ⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Linien und Ecken für Terminal-Boxen und Tabellen | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Vollständig und schattierte Blöcke, verwendet für Terminal-Balkendiagramme | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Quadrate, Kreise, Dreiecke und Diamanten | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Wetter, Astrologie, Schach, Karten und die Kartenschachteln | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Drucker-Verzierungen – Häkchen, Schere, Sterne | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Alle 256 Braille-Punkt-Muster, verwendet für Terminal-Grafiken auch | ⠁ ⣿ |
Vollbreite-Formen sind separate Zeichen von ihren ASCII-Zwillingen, nicht eine Schriftart.
6Die Quelle der meisten unsichtbaren Zeichen, die eine Copy-Paste überleben.
| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Ideografisches Leerzeichen und CJK-InterpunktionU+3000 ist ein Vollbreite-Raum und wird nicht von den meisten Whitespace-Regeln getrimmt. | 、 。 |
| U+3040–U+309F | Hiragana | Das japanische Silbenzeichen für native Wörter und Grammatik | あ ん |
| U+30A0–U+30FF | Katakana | Das japanische Silbenzeichen für Lehnwörter und Betonung | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | Der Haupt-Han-Block – fast 21.000 Zeichen geteilt durch Chinesisch, Japanisch und Koreanisch | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Alle 11.172 vorgehängten koreanischen SilbenJede kann auch als separate Jamo geschrieben werden, die Normalisierung versöhnt. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Vollbreite Kopien von ASCII und Halbbreite KatakanaA ist nicht A. Text aus CJK-Formen eingeklebt braucht oft Falten zu ASCII. | A ! ア |
Über U+FFFF, und die besonderen Fälle
10Alles hier nimmt zwei UTF-16-Einheiten, die ist, wo String-Längen-Bugs herkommen.
| Range | Block | Was ist drin | Latein ist über mehrere Blöcke verteilt, weshalb die Zuordnung nach Block nie ganz funktioniert. |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Erste Hälfte eines UTF-16-Paares – niemals allein gültigEin einsamer Surrogate ist, was ein String, der durch ein Emoji geschnitten wird, zurücklässt. | |
| U+DC00–U+DFFF | Low Surrogates | Zweite Hälfte eines UTF-16-Paares – niemals allein gültig | |
| U+E000–U+F8FF | Private Use Area | Absichtlich Unzugeordnet, für private VereinbarungenWo Icon-Schriftarten ihre Glyphen setzen. Bedeutungslos ohne die passende Schriftart. | |
| U+FFF0–U+FFFF | Specials | Das Ersatz-Zeichen und die Byte-Ordnungszeichen-VerwandtenU+FFFD ist, was du siehst, wenn ein Decoder aufgab an einem Byte. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | Fettgedruckt, kursiv, Schrift und Double-Struck-Alphabete als ZeichenDie Quelle von 𝐟𝐚𝐤𝐞 𝐛𝐨𝐥𝐝 in sozialen Medien Namen. Nicht durchsuchbar. | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | Die meisten Nicht-Gesichts-Emoji – Wetter, Objekte, Orte, Symbole | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | Das Gesichts-Emoji | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | Fahrzeuge, Verkehr und Karten-Symbole | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Spätere Emoji-Ergänzungen – spätere Gesichter, Gesten, Objekte | 🤖 🧠 |
| U+E0000–U+E007F | Tags | Unsichtbare Tag-Zeichen, verwendet in Flag-SequenzenAuch der Vektor für unsichtbaren Text, der in einen normalaussehenden String kontrebanders wird. |