Évaluation des capacités de réponse de larges modèles de langage (LLM) pour des questions d'historiens
Large Language Models (LLMs) like ChatGPT or Bard have revolutionized information retrieval and captivated the audience with their ability to generate custom responses in record time, regardless of the topic. In this article, we assess the capabilities of various LLMs in producing reliable, comprehensive, and sufficiently relevant responses about historical facts in French. To achieve this, we constructed a testbed comprising numerous history-related questions of varying types, themes, and levels of difficulty. Our evaluation of responses from ten selected LLMs reveals numerous shortcomings in both substance and form. Beyond an overall insufficient accuracy rate, we highlight uneven treatment of the French language, as well as issues related to verbosity and inconsistency in the responses provided by LLMs.
Code (0)
등록된 구현이 없습니다.
Tasks
Information RetrievalRetrievalSimilar Papers 제목 키워드 기반
Génération de question à partir d’analyse sémantique pour l’adaptation non supervisée de modèles de compréhension de documents (Question generation from semantic analysis for unsupervised adaptation of document understanding models)
La génération automatique de questions à partir de textes peut permettre d’obtenir des corpus d’apprentissage pour des modèles de compréhension de documents de type question/réponse sur des textes. Si cette tâche de géné…
document understandingQuestion GenerationQuestion-GenerationApproche de g\'en\'eration de r\'eponse \`a base de transformers (Transformer based approach for answer generation)
Cet article pr{\'e}sente une approche non-supervis{\'e}e bas{\'e}e sur les mod{\`e}les Transformer pour la g{\'e}n{\'e}ration du langage naturel dans le cadre des syst{\`e}mes de question-r{\'e}ponse. Cette approche perm…
Answer GenerationEvaluation automatique de la satisfaction client \`a partir de conversations de type ``chat'' par r\'eseaux de neurones r\'ecurrents avec m\'ecanisme d'attention (Customer satisfaction prediction with attention-based RNNs from a chat contact center corpus)
Cet article pr{\'e}sente des m{\'e}thodes permettant l{'}{\'e}valuation de la satisfaction client {\`a} partir de tr{\`e}s vastes corpus de conversation de type {``}chat{''} entre des clients et des op{\'e}rateurs. Extra…
Classification d'entit\'es nomm\'ees de type film
Dans cet article, nous nous int{\'e}ressons {\`a} la classification contextuelle d{'}entit{\'e}s nomm{\'e}es de type film . Notre travail s{'}inscrit dans un cadre applicatif dont le but est de rep{\'e}rer, dans un texte…
ClassificationGeneral ClassificationVocal Bursts Type PredictionUtilisation d'une base de connaissances de sp\'ecialit\'e et de sens commun pour la simplification de comptes-rendus radiologiques (Radiological text simplification using a general knowledge base)
Dans le domaine m{\'e}dical, la simplification des textes est {\`a} la fois une t{\^a}che souhaitable pour les patients et scientifiquement stimulante pour le domaine du traitement automatique du langage naturel. En effe…
General KnowledgeText Simplification