TinyQA Benchmark++
1개 벤치마크 · 논문 1편 · 이 태스크의 논문 보기 →
Benchmarks
tinyqabenchmark_core-en
결과 8개
Most implemented
Papers
Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation
2025-05-17
· Vincent Koc
Tiny QA Benchmark++ (TQB++) presents an ultra-lightweight, multilingual smoke-test suite designed to give large-language-model (LLM) pipelines a unit-test style safety net dataset that runs in seconds with minimal cost. …
Dataset GenerationGPULarge Language ModelMMLU+2