Extraktor vlastných mien
Vyťahujte pravdepodobné mená, miesta a značky z textu.
Extraktor vlastných mien
Vložte článok, prepis alebo poznámky a tento nástroj vyťahuje slová, ktoré sú najpravdepodobnejšie menami, miestami alebo zmienkami značiek: kapitalizované slová, ktoré sa nenachádzajú jednoducho na začiatku vety. Je to rýchly spôsob, ako zistiť, o kom a čom text v skutočnosti hovorí, bez čitania riadka po riadku.
V predvolenom nastavení sa kapitálka počíta iba v polovici vety, pretože slovo na začiatku vety je kapitalizované bez ohľadu na to, čo je. Zapnite možnosť "Zahrnúť slová na začiatku vety", aby ste rozšírili ponuku, ak by ste radšej zbierali viac ako zmeškaní niečo. Možnosť "Zlúčiť susedné kapitalizované slová" spája postupnosti ako "New York" alebo "Golden Gate Bridge" do jednej entity namiesto ich rozdelenia na jednotlivé slová. Možnosť "Ignorovať bežné slová" vylučuje často kapitalizované položky — zámená, pozdravu, názvy dní v týždni a mesiacov — ktoré sú zriedka menom, ktoré skutočne hľadáte. Výsledky trieďte podľa frekvencia, aby ste videli, čo je spomínané najčastejšie, alebo abecedne, aby ste si prezreli čistý referenčný zoznam. Vyberte si formát výstupu — zoznam alebo CSV — podľa toho, ako budete výsledok ďalej používať.
Nástroj rozpoznáva bežné skratky ako "Dr.", "Mr." a "St.", takže slovo hneď za nimi sa nespomína ako začiatok novej vety a neskočí sa. Spracováva zalomenie riadkov Windows aj Unix rovnakým spôsobom, bez problémov zvláda veľmi dlhý vstup a počítadlo pod výstupom ukazuje, koľko jedinečných entít bolo nájdených a koľkokrát sa v celkovej sume vyskytli.
Všetko beží lokálne vo vašom prehliadači — text, ktorý vložíte, sa nikdy neuploaduje ani nikam neposiela. Keď skončíte, skopírujte výsledok, stiahnite si ho ako súbor .txt alebo pošlite výstup priamo späť na vstup, aby ste ho ďalej spresňovali.