Découvrir de nouvelles classes dans des données tabulaires
In Novel Class Discovery (NCD), the goal is to find new classes in an unlabeled set given a labeled set of known but different classes. While NCD has recently gained attention from the community, no framework has yet been proposed for heterogeneous tabular data, despite being a very common representation of data. In this paper, we propose TabularNCD, a new method for discovering novel classes in tabular data. We show a way to extract knowledge from already known classes to guide the discovery process of novel classes in the context of tabular data which contains heterogeneous variables. A part of this process is done by a new method for defining pseudo labels, and we follow recent findings in Multi-Task Learning to optimize a joint objective function. Our method demonstrates that NCD is not only applicable to images but also to heterogeneous tabular data.
Code (1)
Tasks
Multi-Task LearningNovel Class DiscoverySimilar Papers 제목 키워드 기반
Adaptation de ressources en langue anglaise pour interroger des données tabulaires en français (Adaptation of resources in English to query French tabular data)
Les récents développements des approches d’apprentissage neuronal profond ont permis des avancées très significatives dans le domaine de l’interrogation des systèmes d’information en langage naturel. Cependant, pour le f…
OKM: une extension des k-moyennes pour la recherche de classes recouvrantes.
Dans cet article nous abordons le problème de la classification (ou clustering) dans le but de découvrir des classes avec recouvrements. Malgré quelques avancées récentes dans ce domaines, motivées par des besoins applic…
ClassificationD\'ecouverte de nouvelles entit\'es et relations spatiales \`a partir d'un corpus de SMS (Discovering of new Spatial Entities and Relations from SMS Within the context of the currently available data masses, many works related to the analysis of spatial information are based on the exploitation of textual data)
Dans le contexte des masses de donn{\'e}es aujourd{'}hui disponibles, de nombreux travaux li{\'e}s {\`a} l{'}analyse de l{'}information spatiale s{'}appuient sur l{'}exploitation des donn{\'e}es textuelles. La communicat…
Simulation d’erreurs d’OCR dans les systèmes de TAL pour le traitement de données anachroniques (Simulation of OCR errors in NLP systems for processing anachronistic data)
L’extraction d’information offre de nouvelles perspectives au sein des recherches historiques. Cependant, la majorité des recherches liées à ce domaine s’effectue sur des données contemporaines. Malgré l’évolution consta…
Optical Character Recognition (OCR)M\'ethode faiblement supervis\'ee pour l'extraction d'opinion cibl\'ee dans un domaine sp\'ecifique
La d{\'e}tection d{'}opinion cibl{\'e}e a pour but d{'}attribuer une opinion {\`a} une caract{\'e}ristique particuli{\`e}re d{'}un produit donn{\'e}. La plupart des m{\'e}thodes existantes envisagent pour cela une approc…