paper-with-me

Papers

InPars: Data Augmentation for Information Retrieval using Large Language Models

2022-02-10 · Luiz Bonifacio, Hugo Abonizio, Marzieh Fadaee, Rodrigo Nogueira

The information retrieval community has recently witnessed a revolution due to large pretrained transformer models. Another key ingredient for this revolution was the MS MARCO dataset, whose scale and diversity has enabled zero-shot transfer learning to various tasks. However, not all IR tasks and domains can benefit from one single dataset equally. Extensive research in various NLP tasks has shown that using domain-specific training data, as opposed to a general-purpose one, improves the performance of neural models. In this work, we harness the few-shot capabilities of large pretrained language models as synthetic data generators for IR tasks. We show that models finetuned solely on our unsupervised dataset outperform strong baselines such as BM25 as well as recently proposed self-supervised dense retrieval methods. Furthermore, retrievers finetuned on both supervised and our synthetic data achieve better zero-shot transfer than models finetuned only on supervised data. Code, models, and data are available at https://github.com/zetaalphavector/inpars .

📄 PDF Abstract BibTeX arXiv:2202.05144

Code (1)

zetaalphavector/inpars 공식 구현

Tasks

Data AugmentationDiversityInformation RetrievalRetrievalTransfer Learning

Similar Papers 제목 키워드 기반

InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval

2023-01-04 · Vitor Jeronymo, Luiz Bonifacio, Hugo Abonizio, Marzieh Fadaee 외

Recently, InPars introduced a method to efficiently use large language models (LLMs) in information retrieval tasks: via few-shot examples, an LLM is induced to generate relevant queries for documents. These synthetic qu…

Information RetrievalRetrieval

InPars+: Supercharging Synthetic Data Generation for Information Retrieval Systems

2025-08-19 · Matey Krastev, Miklos Hamar, Danilo Toapanta, Jesse Brouwers 외 arxiv

This work revisits and extends synthetic query generation pipelines for Neural Information Retrieval (NIR) by leveraging the InPars Toolkit, a reproducible, end-to-end framework for generating training data using large l…

Synthetic Data GenerationInformation Retrieval

InPars-Light: Cost-Effective Unsupervised Training of Efficient Rankers

2023-01-08 · Leonid Boytsov, Preksha Patel, Vivek Sourabh, Riddhi Nisar 외

We carried out a reproducibility study of InPars, which is a method for unsupervised training of neural rankers (Bonifacio et al., 2022). As a by-product, we developed InPars-light, which is a simple-yet-effective modifi…

Language ModellingRe-RankingRetrieval

InPars Toolkit: A Unified and Reproducible Synthetic Data Generation Pipeline for Neural Information Retrieval

2023-07-10 · Hugo Abonizio, Luiz Bonifacio, Vitor Jeronymo, Roberto Lotufo 외

Recent work has explored Large Language Models (LLMs) to overcome the lack of training data for Information Retrieval (IR) tasks. The generalization abilities of these models have enabled the creation of synthetic in-dom…

GPUInformation RetrievalRetrievalSynthetic Data Generation

Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval

2023-11-10 · Nandan Thakur, Jianmo Ni, Gustavo Hernández Ábrego, John Wieting 외

There has been limited success for dense retrieval models in multilingual retrieval, due to uneven and scarce training data available across multiple languages. Synthetic training data generation is promising (e.g., InPa…

Language ModelingLanguage ModellingLarge Language ModelRetrieval