Que rec\`elent les donn\'ees textuelles issues du web ? (What do text data from the Web have to hide ?)
La collecte et l{'}usage opportunistes de donn{\'e}es textuelles tir{\'e}es du web sont sujets {\a} une s{\'e}rie de probl{\e}mes {\'e}thiques, m{\'e}thodologiques et {\'e}pist{\'e}mologiques qui m{\'e}ritent l{'}attention de la communaut{\'e} scientifique. Nous pr{\'e}sentons des {\'e}tudes empiriques de leur impact en linguistique et TAL centr{\'e}es sur la forme (m{\'e}thodes d{'}extraction des donn{\'e}es) ainsi que sur le fond (contenu des corpus).
Code (0)
등록된 구현이 없습니다.
Similar Papers 제목 키워드 기반
Revue de la littérature : entrepôts de données biomédicales et traitement automatique de la langue (Literature review : biomedical data warehouse and natural language processing )
La quantité de données de santé informatisées ne cesse de croître et ouvre de nouvelles possibilités pour la recherche scientifique. L’accès à ces données passe très souvent par l’utilisation d’entrepôts de données biomé…
Détection d’anomalies textuelles à base de l’ingénierie d’invite (Prompt Engineering-Based Text Anomaly Detection )
La détection d’anomalies textuelles est une tâche importante de la fouille de textes. Plusieurs approches générales, visant l’identification de points de données aberrants, ont été appliqués dans ce domaine. Néanmoins, c…
Anomaly DetectionPrompt EngineeringRecommandation d'\^age pour des textes (Age recommendation for texts)
Cet article {\'e}tudie une premi{\`e}re tentative pour pr{\'e}dire une recommandation d{'}{\^a}ge estimant {\`a} partir de quand un enfant pourrait comprendre un texte donn{\'e}. {\`A} ce titre, nous pr{\'e}sentons d{'}a…
Reconnaissance d’entités nommées sur des sorties OCR bruitées : des pistes pour la désambiguïsation morphologique automatique (Resolution of entity linking issues on noisy OCR output : automatic disambiguation tracks)
La variation dans les données textuelles, en particulier le bruit, est un facteur limitant la performance des systèmes de Reconnaissance d’Entités Nommées (REN). Les systèmes de REN sont en effet généralement entraînés s…
Entity LinkingOptical Character Recognition (OCR)COMFO : Corpus Multilingue pour la Fouille d’Opinions (COMFO: Multilingual Corpus for Opinion Mining)
L’utilisation d’algorithmes de Machine Learning (ML) en fouille d’opinions notamment ceux d’apprentissage supervisé nécessite un corpus annoté pour entrainer le modèle de classification afin de prédire des résultats proc…
Opinion Mining