paper-with-me

TinyQA Benchmark++

1개 벤치마크 · 논문 1편 · 이 태스크의 논문 보기 →

Benchmarks

Most implemented

Papers

Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation

2025-05-17 · Vincent Koc

Tiny QA Benchmark++ (TQB++) presents an ultra-lightweight, multilingual smoke-test suite designed to give large-language-model (LLM) pipelines a unit-test style safety net dataset that runs in seconds with minimal cost. …

Dataset GenerationGPULarge Language ModelMMLU+2