paper-with-me

홈 › Papers

Parsing des textes journalistiques en serbe \`a l'aide du logiciel Talismane (Parsing of newspaper texts in Serbian using Talismane)

2019-07-01 · JEPTALNRECITAL 2019 7 · Dusica Terzic

Cet article pr{\'e}sente la cr{\'e}ation d{'}un treebank journalistique serbe, ParCoJour. Il est compos{\'e} de 30K tokens et dot{\'e} de trois couches d{'}annotation : {\'e}tiquetage morphosyntaxique, lemmatisation et annotation syntaxique. Une fois construit, ParCoJour a {\'e}t{\'e} utilis{\'e} dans trois exp{\'e}riences afin d{'}{\'e}valuer l{'}impact du domaine textuel sur le parsing du serbe en comparant les performances de Talismane, un syst{\e}me par apprentissage automatique, sur deux types de corpus, journalistique et litt{\'e}raire : 1) parsing du corpus journalistique avec un mod{\e}le entra{\^\i}n{\'e} sur le corpus journalistique ; 2) parsing du corpus journalistique avec un mod{\e}le entra{\^\i}n{\'e} sur le corpus litt{\'e}raire ; 3) parsing du corpus litt{\'e}raire avec un mod{\e}le entra{\^\i}n{\'e} sur le corpus journalistique. Les r{\'e}sultats sont compar{\'e}s {\a} ceux o{\u} les deux corpus relevaient du domaine litt{\'e}raire. Le changement de domaine textuel dans la deuxi{\e}me et la troisi{\e}me exp{\'e}rience entra{\^\i}ne une baisse des performances, mais les r{\'e}sultats de parsing restent satisfaisants.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Ph\oebus : un Logiciel d'Extraction de R\'eutilisations dans des Textes Litt\'eraires

2015-06-01 · JEPTALNRECITAL 2015 6 · Mohamed Amine Boukhaled, Zied Sellami, Jean-Gabriel Ganascia

Ph{\oe}bus est un logiciel d{'}extraction de r{\'e}utilisations dans des textes litt{\'e}raires. Il a {\'e}t{\'e} d{\'e}velopp{\'e} comme un outil d{'}analyse litt{\'e}raire assist{\'e}e par ordinateur. Dans ce contexte,…

L'expression des \'emotions dans les textes pour enfants : constitution d'un corpus annot\'e (Expressing emotions in texts for children: constitution of an annotated corpus)

2020-06-01 · JEPTALNRECITAL 2020 6 · Aline {\'E}tienne, Delphine Battistelli, Gw{\'e}nol{\'e} Lecorv{\'e}

Cet article pr{\'e}sente une typologie de divers modes d{'}expression linguistique des {\'e}motions, le sch{\'e}ma d{'}annotation sous Glozz qui impl{\'e}mente cette typologie et un corpus de textes journalistiques pour …

MEDITE : logiciel d'alignement de textes pour l'\'etude de la g\'en\'etique textuelle

2015-06-01 · JEPTALNRECITAL 2015 6 · Zied Sellami, Jean-Gabriel Ganascia, Mohamed Amine Boukhaled

MEDITE est un logiciel d{'}alignement de textes permettant l{'}identification de transformations entre une version et une autre d{'}un m{\^e}me texte. Dans ce papier nous pr{\'e}sentons les aspects th{\'e}oriques et tech…

Etiquetage morpho-syntaxique de tweets avec des CRF

2015-06-01 · JEPTALNRECITAL 2015 6 · Tian Tian, Dinarelli Marco, Tellier Isabelle, Cardoso Pedro

Nous nous int{\'e}ressons dans cet article {\`a} l{'}apprentissage automatique d{'}un {\'e}tiqueteur mopho-syntaxique pour les tweets en anglais. Nous proposons tout d{'}abord un jeu d{'}{\'e}tiquettes r{\'e}duit avec 17…

Q-learning pour la r\'esolution des anaphores pronominales en langue arabe (Q-learning for pronominal anaphora resolution in Arabic texts)

2019-07-01 · JEPTALNRECITAL 2019 7 · Saoussen Mathlouthi Bouzid, Chiraz Ben Othmane Zribi

La r{\'e}solution d{'}anaphores est une t{\^a}che fondamentale pour la plupart des applications du TALN. Cette t{\^a}che reste un probl{\`e}me difficile qui n{\'e}cessite plusieurs sources de connaissances et des techniq…

Q-Learning