Implicit information extraction from news stories
Získávání implicitních infomací ze zpravodajských textů
bachelor thesis (DEFENDED)

View/ Open
Permanent link
http://hdl.handle.net/20.500.11956/183054Identifiers
Study Information System: 252051
Collections
- Kvalifikační práce [11368]
Author
Advisor
Referee
Helcl, Jindřich
Faculty / Institute
Faculty of Mathematics and Physics
Discipline
Computer Science with specialisation in Artificial Intelligence
Department
Institute of Formal and Applied Linguistics
Date of defense
29. 6. 2023
Publisher
Univerzita Karlova, Matematicko-fyzikální fakultaLanguage
English
Grade
Excellent
Keywords (Czech)
Zpravodajství|Extrakce informací|Český zpravodajský klasifikační dataset|NLP|BERTKeywords (English)
News|Information Extraction|Czech News Classification Dataset|NLP|BERTTato práce se zabývá extrakcí informací z českých zpravodajských článků. Zaměřujeme se na čtyři úlohy: vydavatelský server, kategorie článku, tex- tový gender autora a den vydání článk. Vzhledem k absenci vhodné da- tové sady pro tyto úlohy představujeme datovou sadu CZEch NEws Clas- sification (CZE-NEC), jeden z největších českých klasifikačních datasetů, který je složen ze zpravodajských článků z různých zdrojů pokrývající ob- dobí dvaceti let. Úlohy jsou řešeny pomocí Lineární regrese a předtrénovaných Transformerů. Důraz je kladen na metody dotrénování Transformerů, které jsou podrobně vyhodnoceny. Modely jsou porovnány s lidskými hodnotiteli, kteří zaostávají za modely na všech úlohách. Dále jsou modely porovnány s komerčním velkým jazykovým modelem GPT-3, který je překonán na polov- ině úloh, přestože je GPT-3 výrazně větší. Naše práce představuje silný startovní výsledek na sadě CZE-NEC, který umožňuje další výzkum v této oblasti.
This work deals with information extraction from Czech News Stories. We focus on four tasks: Publishing server, Article category, Author's textual gender and Publication day of week. Due to the absence of a suitable dataset for the tasks, we present CZEch NEws Classification dataset (CZE-NEC), one of the most extensive Czech classification datasets, composed of news articles from various sources, spanning over twenty years. Tasks are solved using Logistic Regression and pre-trained Transformer encoders. Emphasis is put on fine-tuning methods of the Transformer models, which are evaluated in detail. The models are compared to human evaluators, revealing significant superiority over humans on all tasks. Furthermore, the models are pitted against the commercial large language model GPT-3, outperforming it on half of the tasks, despite GPT-3 being significantly larger. Our work sets strong baseline results on CZE-NEC allowing for further research in the field.