Extraktor vlastních jmen
Vytahujte pravděpodobná jména, místa a značky z textu.
Extraktor vlastních jmen
Vložte článek, přepis nebo poznámky a tento nástroj vytahuje slova, která jsou nejpravděpodobněji jmény, místy nebo zmínkami značek: kapitalizovaná slova, která se jednoduše nenacházejí na začátku věty. Je to rychlý způsob, jak zjistit, o kom a čem text vlastně pojednává, aniž byste jej museli číst řádek po řádku.
V základním nastavení se velké písmeno počítá pouze uprostřed věty, protože slovo na začátku věty je vždy kapitalizováno bez ohledu na to, co je. Zapněte "Zahrnout slova na začátku věty", abyste rozšířili záběr, pokud byste raději sbírali více než cokoliv zmeškali. "Sloučit sousedící kapitalizovaná slova" spojuje posloupnosti jako "New York" nebo "Golden Gate Bridge" do jedné entity místo jejich rozdělení na jednotlivá slova. "Ignorovat běžná slova" odstraňuje často kapitalizované položky — zájmena, pozdravy a názvy dnů v týdnu nebo měsíců — které jsou zřídka jménem, které skutečně hledáte. Výsledky seřaďte podle frekvence, abyste viděli, co je zmíněno nejvíce, nebo abecedně, abyste si prohlédli čistý referenční seznam. Vyberte si formát výstupu — seznam nebo CSV — v závislosti na tom, jak jej budete dále používat.
Nástroj rozpoznává běžné zkratky jako "Dr.", "Mr." a "St.", takže slovo hned za nimi se neberou jako začátek nové věty a nejde se přeskočit. Stejně zpracovává zalomení řádků Windows a Unix, bez problémů zvládá velmi dlouhý vstup a tally pod výstupem hlásí, kolik jedinečných entit bylo nalezeno a kolikrát se vyskytly celkem.
Všechno běží lokálně ve vašem prohlížeči — text, který vložíte, se nikdy neodešle ani nikam nepošle. Až budete hotovi, zkopírujte výsledek, stáhněte si jej jako soubor .txt nebo odešlete výstup přímo zpět na vstup, abyste jej dále zpřesňovali.