paper-with-me

Papers

Building Russian Benchmark for Evaluation of Information Retrieval Models

2025-04-17 · Grigory Kovalev, Mikhail Tikhomirov, Evgeny Kozhevnikov, Max Kornilov, Natalia Loukachevitch

We introduce RusBEIR, a comprehensive benchmark designed for zero-shot evaluation of information retrieval (IR) models in the Russian language. Comprising 17 datasets from various domains, it integrates adapted, translated, and newly created datasets, enabling systematic comparison of lexical and neural models. Our study highlights the importance of preprocessing for lexical models in morphologically rich languages and confirms BM25 as a strong baseline for full-document retrieval. Neural models, such as mE5-large and BGE-M3, demonstrate superior performance on most datasets, but face challenges with long-document retrieval due to input size constraints. RusBEIR offers a unified, open-source framework that promotes research in Russian-language information retrieval.

📄 PDF Abstract BibTeX arXiv:2504.12879

Code (1)

kaengreg/rusbeir 공식 구현 pytorch

Tasks

Information RetrievalRetrieval

Similar Papers 제목 키워드 기반

Wikipedia-based Datasets in Russian Information Retrieval Benchmark RusBEIR

2025-11-07 · Grigory Kovalev, Natalia Loukachevitch, Mikhail Tikhomirov, Olga Babina 외 arxiv

In this paper, we present a novel series of Russian information retrieval datasets constructed from the "Did you know..." section of Russian Wikipedia. Our datasets support a range of retrieval tasks, including fact-chec…

Information Retrieval

The Russian-focused embedders' exploration: ruMTEB benchmark and Russian embedding model design

2024-08-22 · Artem Snegirev, Maria Tikhonova, Anna Maksimova, Alena Fenogenova 외

Embedding models play a crucial role in Natural Language Processing (NLP) by creating text embeddings used in various tasks such as information retrieval and assessing semantic text similarity. This paper focuses on rese…

Information RetrievalRerankingRetrievalSemantic Textual Similarity+3

RUMBA: Russian User Memory Benchmark

2026-07-23 · Elizaveta Shevtsova, Inna Glebkina, Mark Baushenko, Pavel Gulyaev 외 arxiv

The ability to handle long-term memory in LLMs is becoming increasingly critical, yet existing benchmarks remain English-centric and rely on aggregate retrieval metrics, failing to capture interactions between long-range…

No One-Size-Fits-All: Building Systems For Translation to Bashkir, Kazakh, Kyrgyz, Tatar and Chuvash Using Synthetic And Original Data

2026-02-04 · Dmitry Karpov arxiv

We explore machine translation for five Turkic language pairs: Russian-Bashkir, Russian-Kazakh, Russian-Kyrgyz, English-Tatar, English-Chuvash. Fine-tuning nllb-200-distilled-600M with LoRA on synthetic data achieved chr…

Machine Translation

Word Sense Disambiguation in Monolingual Dictionaries for Building Russian WordNet

2016-01-01 · GWC 2016 1 · Daniil Alexeyevsky, Anastasiya V. Temchenko

Russian Language is currently poorly supported with WordNet-like resources. One of the new efforts for building Russian WordNet involves mining the monolingual dictionaries. While most steps of the building process are s…

Word Sense Disambiguation