🐎 YakutEval — офлайн LLM лидерборд на якутском (саха) языке

Бенчмарк для якутского: модели оцениваются автоматически и воспроизводимо на замороженном наборе верифицируемых задач. Space модели не запускает — вы прогоняете оценку локально и присылаете JSON с результатами.

Ранжирование — Elo (Bradley-Terry по задачам): для каждой пары моделей на каждой задаче побеждает та, что набрала больше; рейтинг сводит эти попарные исходы. Это отражает, кто кого обыгрывает, а не просто среднее. (Не human-арена — Elo выводится из верифицируемого бенчмарка.)

Первый открытый бенчмарк LLM для якутского — низкоресурсного тюркского языка.

Задачи

  • math — Математика — GSM8K, переведённый на якутский (ответ верифицируется числом).
  • physics — Физика — задачи на якутском (кинематика, сила, работа), числовой ответ.
  • tools — Tool-calling — якутский запрос → верный инструмент + аргументы.
  • cloze — Cloze — угадать пропущенное слово в якутском предложении.
  • grammar — Грамматика — MC по падежам/гармонии гласных/формам глагола.
  • vocab — Лексика — MC по значению слова / синонимам (знание языка).
  • fluency — Fluency — доля якутской кириллицы/букв в свободной генерации.
  • ppl — Perplexity — на held-out якутском тексте (меньше = лучше).
  • overall — Среднее по 7 задачам (без ppl).