🐎 YakutEval — офлайн LLM лидерборд на якутском (саха) языке
Бенчмарк для якутского: модели оцениваются автоматически и воспроизводимо на замороженном наборе верифицируемых задач. Space модели не запускает — вы прогоняете оценку локально и присылаете JSON с результатами.
Ранжирование — Elo (Bradley-Terry по задачам): для каждой пары моделей на каждой задаче побеждает та, что набрала больше; рейтинг сводит эти попарные исходы. Это отражает, кто кого обыгрывает, а не просто среднее. (Не human-арена — Elo выводится из верифицируемого бенчмарка.)
Первый открытый бенчмарк LLM для якутского — низкоресурсного тюркского языка.
1 | yakut-grpo-math | 1055 | 21.7 | 42 | 18 | 86 | 2 | 0 | 0 | 95.3 | 234.378 |
Задачи
- math — Математика — GSM8K, переведённый на якутский (ответ верифицируется числом).
- physics — Физика — задачи на якутском (кинематика, сила, работа), числовой ответ.
- tools — Tool-calling — якутский запрос → верный инструмент + аргументы.
- cloze — Cloze — угадать пропущенное слово в якутском предложении.
- grammar — Грамматика — MC по падежам/гармонии гласных/формам глагола.
- vocab — Лексика — MC по значению слова / синонимам (знание языка).
- fluency — Fluency — доля якутской кириллицы/букв в свободной генерации.
- ppl — Perplexity — на held-out якутском тексте (меньше = лучше).
- overall — Среднее по 7 задачам (без ppl).
1. Прогоните оценку локально (нужен GPU только у вас):
git clone https://huggingface.co/spaces/lab-ii/YakutEval # код + бенчмарк
pip install torch transformers
python yakuteval/run_eval.py --model <ваш_hf_id> --name <имя>
2. Загрузите получившийся файл yakuteval/results/<имя>.json и нажмите Submit.