Předmět: Zpracování přirozeného jazyka

« Zpět
Název předmětu Zpracování přirozeného jazyka
Kód předmětu KOL/ZPJ
Organizační forma výuky Přednáška + Seminář
Úroveň předmětu Bakalářský
Rok studia 2
Semestr Zimní a letní
Počet ECTS kreditů 5
Vyučovací jazyk Čeština
Statut předmětu Povinně-volitelný
Způsob výuky Kontaktní
Studijní praxe Nejedná se o pracovní stáž
Doporučené volitelné součásti programu Není
Vyučující
  • Matlach Vladimír, Mgr. Ph.D.
Obsah předmětu
1) Předzpracování nestrukturovaných dat 2) Zpracování strukturovaných rozsáhlých dat (XML, JSON) od kB až po TB. 3) NLP frameworky: Spacy, Udpipe, FLAIR, SPARK a NLTK a základní úlohy NLP: - zpracování vět, - analýza vztahů aktérů na základě závislostních pravidel, - určování sentimentu, - extrakce jmenných entit. 4) Modelování a vektorizace textu pomocí Bag-of-Words: - výhody, nevýhody, klasické úpravy, použití, - redukce použitím TF-IDF, SVD, PCA, - způsoby implementace, - výpočty podobností textů. 5) Sémantika - odvození latentní sémantiky na základě rozkladů PCA, SVD, MDS, - sémantické embeddingy Word2Vec, FastText, GloVe a jejich použití, - využití při analýze textů. 6) Velké jazykové modely (LLM) - úvodní teorie, důvody existence, - konvoluce, rekurentní sítě, - obousměrné transformery (BERT ad.), - auto-regresivní generativní předtrénované transformery (GPT), - fine-tuning, - omezení LLM vyplývající z technologie a řešení (tokenizace, posuny sémantiky, kontextové okno ad.), - generativní LLM jako řešitelé (prompty, zero-shot, few-shot, výstupy), - aplikace generativních LLM (data ingestion, RAG, agenti a swarmy). 7) OCR - použití Tesseract, PyTesseract, EasyOCR a dalších nástrojů, - implementace OCR včetně preprocessingu a postprocessingu jazykovými modely. 8) Speech-to-Text, Text-to-Speech - aktuálně dostupné technologie a modely Whisper, Seamless a další, - implementace jednoduchých úloh.

Studijní aktivity a metody výuky
nespecifikováno
Výstupy z učení
V tomto kurzu se studenti seznámí s moderními metodami zpracování přirozeného jazyka: Od předzpracování a práce s rozsáhlými nestrukturovanými daty, přes klasické NLP úlohy, vektorizaci textu a sémantické embeddingy, až po současné velké jazykové modely (LLM). Prakticky si osvojí práci s vybranými NLP frameworky, principy modelů BERT a GPT od matematických základů až po promptování a různé aplikace. Stejně tak si osvojí technologie jako OCR, Speech-to-Text a Text-to-Speech. Důraz je kladen na pochopení principů, možností a omezení jednotlivých metod a jejich praktické využití při řešení reálných úloh.
1) Navýšení schopností v programování. 2) Osvojení si typických úloh v praxi a průmyslu. 3) Osvojení si úloh pro výzkum v jazykovědě.
Předpoklady
1) Dokončené alespoň programování 2 v Pythonu.
KOL/VMMT2 a zároveň KOL/JMT2 a zároveň KOL/DATA2

Hodnoticí metody a kritéria
nespecifikováno
1) Řešení zadaných úloh. 2) Aktivní účast.
Doporučená literatura


Studijní plány, ve kterých se předmět nachází
Fakulta Studijní plán (Verze) Kategorie studijního oboru/specializace Doporučený ročník Doporučený semestr
Fakulta: Filozofická fakulta Studijní plán (Verze): Lingvistika a Digital Humanities minor (2020) Kategorie: Filologické vědy 2 Doporučený ročník:2, Doporučený semestr: Zimní
Fakulta: Filozofická fakulta Studijní plán (Verze): Lingvistika a Digital Humanities maior pro Obecnou lingvistiku a teorii komunikace (2020) Kategorie: Filologické vědy 2 Doporučený ročník:2, Doporučený semestr: Zimní
Fakulta: Filozofická fakulta Studijní plán (Verze): Lingvistika a Digital Humanities maior (2020) Kategorie: Filologické vědy 2 Doporučený ročník:2, Doporučený semestr: Zimní
Fakulta: Filozofická fakulta Studijní plán (Verze): Lingvistika a Digital Humanities (2020) Kategorie: Filologické vědy 2 Doporučený ročník:2, Doporučený semestr: Zimní
Fakulta: Filozofická fakulta Studijní plán (Verze): Lingvistika a Digital Humanities minor pro Obecnou lingvistiku a teorii komunikace (2020) Kategorie: Filologické vědy 2 Doporučený ročník:2, Doporučený semestr: Zimní