Vers un corpus optimal pour la fouille de textes : strat\'egie de constitution de corpus sp\'ecialis\'es \`a partir d'ISTEX (Towards an optimal corpus for text mining: specialized corpus building strategy from ISTEX)
Pr{\'e}alable indispensable {\a} de nombreuses activit{\'e}s de TAL et de fouille de textes, l{'}{\'e}laboration d{'}un corpus peut n{\'e}cessiter plusieurs phases de traitement pour am{\'e}liorer sa qualit{\'e} et ainsi obtenir les meilleurs r{\'e}sultats d{'}analyse automatique. Les post-traitements appliqu{\'e}s {\a} un tel corpus, notamment pour garantir la pertinence de son contenu et l{'}homog{\'e}n{\'e}it{\'e} de son format, pourront s{'}av{\'e}rer d{'}autant plus co{\^u}teux et fastidieux que la construction du corpus de travail aura {\'e}t{\'e} impr{\'e}cise. Cette d{\'e}monstration se proposera de tirer parti de la plateforme ISTEX et de ses services associ{\'e}s pour constituer, au travers d{'}un cycle it{\'e}ratif, un corpus homog{\`e}ne de publications scientifiquement pertinentes pour une utilisation simplifi{\'e}e par des outils de fouille.
Code (0)
등록된 구현이 없습니다.
Similar Papers 제목 키워드 기반
D\'Efi Fouille de Textes 2019 : indexation par extraction et appariement textuel (DEFT 2019 : extraction-based document indexing and textual document similarity matching )
Cet article pr{\'e}sente la contribution de l{'}{\'e}quipe du Laboratoire de G{\'e}nie Informatique et d{'}Ing{\'e}nierie de Production (LGI2P) d{'}IMT Mines Al{\`e}s au D{\'E}fi Fouille de Textes (DEFT) 2019. Il d{\'e}t…
SENTERFouille de motifs et CRF pour la reconnaissance de sympt\^omes dans les textes biom\'edicaux (Pattern mining and CRF for symptoms recognition in biomedical texts)
Dans cet article, nous nous int{\'e}ressons {\`a} l{'}extraction d{'}entit{\'e}s m{\'e}dicales de type sympt{\^o}me dans les textes biom{\'e}dicaux. Cette t{\^a}che est peu explor{\'e}e dans la litt{\'e}rature et il n{'}…
NERFouille de graphes sous contraintes linguistiques pour l'exploration de grands textes (Graph Mining Under Linguistic Constraints to Explore Large Texts) [in French]
Actes de la 6e conf\'erence conjointe Journ\'ees d'\'Etudes sur la Parole (JEP, 33e \'edition), Traitement Automatique des Langues Naturelles (TALN, 27e \'edition), Rencontre des \'Etudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (R\'ECITAL, 22e \'edition). Atelier D\'Efi Fouille de Textes
COMFO : Corpus Multilingue pour la Fouille d’Opinions (COMFO: Multilingual Corpus for Opinion Mining)
L’utilisation d’algorithmes de Machine Learning (ML) en fouille d’opinions notamment ceux d’apprentissage supervisé nécessite un corpus annoté pour entrainer le modèle de classification afin de prédire des résultats proc…
Opinion Mining