Blocuri Unicode
Unicode împarte spațiul său de cod în blocuri numite, fiecare un interval contiguu rezervat pentru o scriptură sau o familie de simboluri. Știind în ce bloc locuiește un caracter este ceea ce transformă o mister — de ce a rupt această lipire, de ce această regex nu o ratează — într-o întrebare cu răspuns.
Numele de bloc sunt identificatori, nu descrieri: sunt folosite literal într-o regex ca \p{Block=Cyrillic} și în fiecare fișier de date Unicode, deci rămân în engleză în fiecare limbă. Ceea ce este tradus este propoziția lângă ele.
Aceasta este o selecție curată mai degrabă decât toate din aproximativ 340 de blocuri — cele care ies la iveală atunci când lucrezi cu text. Tabelul ASCII acoperă blocul primul în detaliu complet; această pagină începe de unde se oprește acela.
Latin
5Latin este răspândită peste mai multe blocuri, care este de ce potrivirea ei după bloc nu funcționează niciodată cu exactitate.
| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+0000–U+007F | Basic Latin | Accente din Europa Occidentală, plus £ § × ÷ și spațiu care nu se rupe | A z 0 ? |
| U+0080–U+00FF | Latin-1 Supplement | Accente din Europa Occidentală, plus £ § × ÷ și spațiu care nu se rupe | é ñ ü × |
| U+0100–U+017F | Latin Extended-A | Accente din Europa Centrală și de Est — č, ł, ő, ș | č ł ő š |
| U+0180–U+024F | Latin Extended-B | Accente din Europa Centrală și Orientală — č, ł, ő, ș | ƒ ǎ ȳ |
| U+1E00–U+1EFF | Latin Extended Additional | Vietnamez și alte litere latine cu mai mulți accenți | ạ ế ṛ |
Combinarea mărcilor și modificatorilor
4Acestea se atașează caracterului din fața lor și nu au lățime proprie.
| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+0300–U+036F | Combining Diacritical Marks | Accente aplicate caracterului anteriorAl doilea, fel descompus de a scrie é. Normalizează la NFC pentru a o prăbuși. | ◌́ ◌̈ ◌̌ |
| U+02B0–U+02FF | Spacing Modifier Letters | Litere supraindice și IPA stres și tonuri | ʰ ˈ ˚ |
| U+FE00–U+FE0F | Variation Selectors | Litere supraindice și IPA stres și tonuriVS16 este ceea ce transformă ✔ într-un emoji. Invizibil, dar contează. | |
| U+FE20–U+FE2F | Combining Half Marks | Jumătăți de mărci care se întind pe două caractere |
Alte scripturi
8| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+0370–U+03FF | Greek and Coptic | Grec, și literele copte care-și împărtășesc blocul | α Ω π |
| U+0400–U+04FF | Cyrillic | Rus, ucrainean, sârb, bulgăresc și alfabete conexe | д Я ж |
| U+0590–U+05FF | Hebrew | Litere ebraice, vocalele puncte și semne cantillation | א ש |
| U+0600–U+06FF | Arabic | Litere arabe, în formele lor izolate | ا ب ي |
| U+0900–U+097F | Devanagari | Hindi, Sanscrit, Marathi și limbi conexe | क ह |
| U+0E00–U+0E7F | Thai | Consoane thai, vocale și semne de ton | ก ท |
| U+10A0–U+10FF | Georgian | Georgian Mkhedruli | ა ბ |
| U+1F00–U+1FFF | Greek Extended | Grec politonic — accentele textelor clasice | ᾰ ῶ |
Punctuație și numere
5Sursa majorității caracterelor invizibile care supraviețuiesc unui copy-paste.
| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+2000–U+206F | General Punctuation | Cratimă, ghilimele curly, elipsis — și mai mari invizibile spațiiU+200B spațiu lățime zero și U+2060 îmbinator de cuvinte trăiesc aici. | – — “ ” … |
| U+2070–U+209F | Superscripts and Subscripts | U+200B spațiu lățime zero și U+2060 îmbinator de cuvinte trăiesc aici. | ⁰ ⁴ ₂ |
| U+20A0–U+20CF | Currency Symbols | Semne de valută Latin-1 nu are loc pentru — €, ₴, ₹, ₺ | € ₴ ₺ |
| U+2100–U+214F | Letterlike Symbols | Simboluri construite din litere — ™, №, ℃, ℓ | ™ ℃ № |
| U+2150–U+218F | Number Forms | Fracții obsce și numere romane ca caractere unice | ⅓ ⅕ Ⅷ |
Simboluri și desen
9| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+2190–U+21FF | Arrows | Săgeți în fiecare direcție, singular și dublu | ← ↔ ⇒ |
| U+2200–U+22FF | Mathematical Operators | Operatori matematici — ∀, ∑, ≠, ∞ | ∀ ∑ ≠ |
| U+2300–U+23FF | Miscellaneous Technical | Tastă și simboluri tehnice — ⌘, ⌥, ⌫, ⏎ | ⌘ ⌥ ⏎ |
| U+2500–U+257F | Box Drawing | Linii și colțuri pentru casete terminale și tabele | ─ ┌ ╬ |
| U+2580–U+259F | Block Elements | Blocuri solide și umbrite, folosite pentru grafice cu bare terminale | █ ▓ ░ |
| U+25A0–U+25FF | Geometric Shapes | Pătrate, cercuri, triunghiuri și diamante | ■ ● ▲ |
| U+2600–U+26FF | Miscellaneous Symbols | Vreme, astrologie, șah, cărți și costumele cărților | ☀ ★ ♥ |
| U+2700–U+27BF | Dingbats | Ornamente tipografului — semne de control, foarfeci, stele | ✂ ✓ ➜ |
| U+2800–U+28FF | Braille Patterns | Toți 256 de modele de puncte Braille, folosite și pentru grafică terminală | ⠁ ⣿ |
CJK și plin lățime
6Deasupra U+FFFF, și cazurile speciale
| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+3000–U+303F | CJK Symbols and Punctuation | Spațiu ideographic și CJK punctuațieU+3000 este un spațiu plin lățime și nu este tăiat de majoritatea regulilor spațiu alb. | 、 。 |
| U+3040–U+309F | Hiragana | U+3000 este un spațiu plin lățime și nu este tăiat de majoritatea regulilor spațiu alb. | あ ん |
| U+30A0–U+30FF | Katakana | Silabari japonez pentru cuvinte împrumutate și enfază | ア ン |
| U+4E00–U+9FFF | CJK Unified Ideographs | Blocul principal Han — aproape 21.000 de caractere partajate de chinez, japonez și coreean | 日 本 語 |
| U+AC00–U+D7AF | Hangul Syllables | Toți 11.172 de silabare coreene precombinateFiecare poate fi și scris ca Jamo separat, pe care normalizarea o reconciliază. | 한 글 |
| U+FF00–U+FFEF | Halfwidth and Fullwidth Forms | Fiecare poate fi și scris ca Jamo separat, pe care normalizarea o reconciliază.A nu este A. Textul lipit din forme CJK adesea trebuie pliat la ASCII. | A ! ア |
Deasupra U+FFFF, și cazurile speciale
10Orice de aici durează două unități UTF-16, care este de unde vin bug-urile de lungime șir.
| Versiunea HTTP din cerere nu este acceptată. | Rază | Ce este în ea | Exemplu |
|---|---|---|---|
| U+D800–U+DB7F | High Surrogates | Prima jumătate a unei perechi UTF-16 — niciodată valabil pe cont propriuPrima jumătate a unei perechi UTF-16 — niciodată valabil pe cont propriu | |
| U+DC00–U+DFFF | Low Surrogates | A doua jumătate a unei perechi UTF-16 — niciodată valabil pe cont propriu | |
| U+E000–U+F8FF | Private Use Area | A doua jumătate a unei perechi UTF-16 — niciodată valabil pe cont propriuUnde iconite fonturile-și plasează glifele. Fără sens fără fontul potrivit. | |
| U+FFF0–U+FFFF | Specials | Caracterul de înlocuire și rudele mărcii ordinii octetU+FFFD este ceea ce vezi când un decodificator a renunțat la un octet. | � |
| U+1D400–U+1D7FF | Mathematical Alphanumeric Symbols | U+FFFD este ceea ce vezi când un decodificator a renunțat la un octet.Majoritate non-față emoji — vreme, obiecte, locuri, simboluri | 𝐀 𝓪 𝟙 |
| U+1F300–U+1F5FF | Miscellaneous Symbols and Pictographs | Majoritate non-față emoji — vreme, obiecte, locuri, simboluri | 🌍 🔥 📄 |
| U+1F600–U+1F64F | Emoticons | Fața emoji | 😀 🙂 |
| U+1F680–U+1F6FF | Transport and Map Symbols | Adăugări emoji mai târziu — fețe mai târziu, gesturi, obiecte | 🚀 🛑 |
| U+1F900–U+1F9FF | Supplemental Symbols and Pictographs | Caractere de etichetă invizibilă, folosite în secvențe de steag | 🤖 🧠 |
| U+E0000–U+E007F | Tags | De asemenea, vectorul pentru text invizibil contrabandată în interiorul unui șir care arată normal.De asemenea, vectorul pentru text invizibil contrabandată în interiorul unui șir care arată normal. |