QBench
Модельно-независимый бенчмарк для маленьких (<1B параметров) языковых моделей: вызов инструментов (одиночные задачи и 8-ходовой диалог с естественными связками) плюс общие знания (ARC-Easy) и правдивость (TruthfulQA MC1). Ни одна модель — включая наши собственные — не получает принудительной коррекции вызова инструмента; каждая оценка отражает только то, что модель сгенерировала сама. Прогнать бенчмарк на своей модели и отправить результат: репозиторий на GitHub.
A model-agnostic benchmark for small (<1B parameter) language models: tool-use (single-turn tasks and an 8-turn natural-phrasing conversation) plus general knowledge (ARC-Easy) and truthfulness (TruthfulQA MC1). No model — including our own — gets forced-correct tool execution; every score reflects only what the model generated on its own. Run it on your own model and submit a result: GitHub repo.
一个模型无关的小型(<1B 参数)语言模型基准测试:工具调用(单轮任务 + 使用自然表达的 8 轮对话)加上通用知识(ARC-Easy)和真实性(TruthfulQA MC1)。没有任何模型——包括我们自己的——会得到强制修正的工具执行;每个分数只反映模型自己生成的内容。在你自己的模型上运行并提交结果:GitHub 仓库。
Загрузка таблицы…
Loading leaderboard…
正在加载排行榜…
Данные: q-project/qbench-results на Hugging Face, обновляется при каждой отправке результата через CLI. Data: q-project/qbench-results on Hugging Face, updated whenever someone submits a run via the CLI. 数据来源:Hugging Face 上的 q-project/qbench-results,每次有人通过 CLI 提交结果时更新。