sorodni izrazi in sinonimi v sodobni slovenščini, hrvaščini in srbščini
Podobnost besed in fraz med rezultati je odvisna od tega, kolikokrat se beseda
ali fraza pojavi v podobnem stavčnem kontekstu kot "tokenizacijo".
Podobni izrazi in sinonimi za
Kliknite za poizvedbo
Pogosto skupaj z
Primeri iz korpusa
Korpus Common Crawl
Common Crawl je korpus spletnih strani
Zaradi tega različna besedila potrebujejo različne pristope za tokenizacijo.
Za proces pretvorbe v žetone (tokenizacijo) so implementirali funkcijo, ki vsakemu znaku, ki je identificiran v naboru gesel, priredi številčno vrednost (žeton).
V poglavju najprej predstavimo podatkovno zbirko za učenje in uporabljeno tokenizacijo.
Tu bi lahko še izboljšali iskalni algoritem po bazi z optimizacijo funkcije rewrite_mpolynomial za tokenizacijo polinomov.
Tokenizacijo, s čimer ločimo besedilo na besede in ločila.
Tokenizacijo, lematizacijo in stavčno segmentacijo bomo opisali v nadaljevanju.
Ta faza zajema čiščenje podatkov, krnjenje in lematizacijo ter tokenizacijo.
S tokenizacijo niz s razbijemo na žetone x = (import, ␣, num).
S pomočjo upravitelja paketov micropip smo namestili paket "tokenizers", ki ga uporabimo za tokenizacijo besedila.
S funkcijo preprocess function pripravimo podatke za tokenizacijo, tako da združimo semena s pripadajočimi gesli.
Regulativni organi odobrijo medicinske naprave, ki so primerne za tokenizacijo, prenos lastništva pa se beleži na bločno-verižnem omrežju.
Proces se začne s tokenizacijo podatkov, kjer so zbrane informacije razdeljene v več vnosov, sestavljenih iz več polj.
Pristopi za tokenizacijo razdelijo besedilo na manjše enote (člene), kot so besede, deli besed ali znaki.
Priprava besedila je vključevala zapis besed z malo začetnico, odstranitev stop besed ter tokenizacijo, lematizacijo in oblikoskladenjsko označevanje.
Primerjajmo tokenizacijo niza s = def foo():\n␣␣␣␣pass z dvema besednjakoma, kjer ␣ označuje presledek.
Preprosta izbira za tokenizacijo je razbitje niza na nivoju znakov oziroma na nivoju bajtov.
Pravila, s katerimi je vhodni tekst ločen na posamezne žetone, so določena v komponenti za tokenizacijo.
Postopek segmentacije, ki je povezan s tokenizacijo, pomeni členjenje besedil na večje segmente - povedi.
Postopek predobdelave je zajemal standardizacijo podatkov, čiščenje besedil, odstranjevanje nepomembnih besed, lematizacijo, tokenizacijo in oblikovanje vsebinsko ločenih korpusov.
Orodje združuje skupek orodij za jezikovno označevanje, in sicer tokenizacijo, oblikoskladenjsko označevanje ter lematizacijo.