Creating high-quality monolingual datasets poses significant challenges due to cross-language contamination, metadata noise, and inconsistent quality control, especially for less-resourced languages. We present HQWiki, a pipeline for extracting and validating clean monolingual content from Wikipedia. The framework introduces universal approaches combining character set validation, context-aware filtering, and adaptive language detection. Evaluation across multiple language families demonstrated significant noise reduction while maintaining high accuracy in language identification. The modular architecture allows researchers to adapt filtering criteria for specific requirements, providing a foundation for systematic dataset creation across different language families.
Neapolis University Pafos, Cyprus - ORCID: 0009-0003-6843-0453
aglabx, Cyprus
Titolo del capitolo
HQWiki: A Universal Pipeline for High-Quality Monolingual Dataset Creation
Autori
Iaroslav Chelombitko, Aleksey Komissarov
Lingua
Inglese
DOI
10.36253/979-12-215-1010-2.44
Opera sottoposta a peer review
Anno di pubblicazione
2026
Copyright
© 2026 Author(s)
Licenza d'uso
Licenza dei metadati
Titolo del libro
Wikidata e la ricerca. Condividere esperienze / Wikidata and Research. Sharing Experiences
Sottotitolo del libro
Atti del Convegno, Firenze, 5-6 giugno 2025 / Conference proceedings, Florence, 5-6 June 2025
Curatori
Elena Marangoni, Camillo Carlo Pellizzari di San Girolamo
Opera sottoposta a peer review
Numero di pagine
378
Anno di pubblicazione
2026
Copyright
© 2026 Author(s)
Licenza d'uso
Licenza dei metadati
Editore
Firenze University Press
DOI
10.36253/979-12-215-1010-2
ISBN Print
979-12-215-1009-6
eISBN (pdf)
979-12-215-1010-2
Collana
Studi e saggi
ISSN della collana
2704-6478
e-ISSN della collana
2704-5919