OMLS-Bench: многоуровневый бенчмарк LLM для программной инженерии
Аннотация
В данной работе представлена система оценки OMLS-Bench (Open Multi-Level Skills Benchmark) двухэтапный фреймворк для всесторонней оценки больших языковых моделей в задачах программной инженерии. Цель предложенного подхода преодолеть ограничения существующих методик, которые либо измеряют узкие подзадачи, либо применяют единый уровень сложности и не фиксируют динамику инженерного мастерства и интерактивную природу диагностического рассуждения. Описываемая система охватывает девять доменов (Back-end, Front-end, Mobile, DevOps, Data Analysis, Machine Learning, Big Data, IoT, встроенные системы) и пять уровней сложности, что позволяет стратифицировать качество по доменам и уровням. Предлагается двухэтапная процедура: Этап I стандартизированные задания с множественным выбором и строгим форматом ответа , Этап II сценарные задания с пошаговыми контрольными списками и независимой моделью-судьёй. Формализованы метрики Tier Accuracy и Domain Accuracy, введён интегральный показатель OPS; раскрыты переменные формулы (1). Публикуются артефакты для воспроизводимости: JSON-схемы заданий, русскоязычные шаблоны промптов и скрипт оценки eval_mc.py с описанием входных/выходных параметров. Эксперименты показывают: неоднородность качества между доменами; снижение результатов при переходе от тестов с фиксированными вариантами к сценарным задачам; детальные диагностические отчёты по невыполненным пунктам контрольных списков. OMLS-Bench может служить практическим инструментом сравнения LLM в инженерных задачах и основой для целенаправленной донастройки моделей под конкретные области. Проведённая стартовая крупномасштабная оценка десяти современных больших языковых моделей выявила чёткую стратификацию результатов по уровням сложности и по сферам: модели большего масштаба демонстрировали высокую точность в широко представленных веб-ориентированных областях, тогда как специализированные направления (мобильная разработка, встроенные системы) показали существенно худшие показатели. Эти наблюдения подчёркивают важность как размера модели, так и разнообразия предметных данных при обучении. OMLS-Bench обеспечивает воспроизводимое и расширяемое средство оценки, которое может служить основой для разработки более надёжных и предметно ориентированных моделей-помощников инженера. В перспективе планируется развитие интерактивной фазы, повышение реалистичности сценариев и доработка контрольных чек-листов для приближения тестирования к профессиональной практике.
Об авторах
С. А. ЯрушевРоссия
Ярушев Сергей Александрович, к.т.н., директор научного центра
Москва
А. О. Ануров
Россия
Ануров Александр Олегович, лаборант-исследователь
Москва
Г. Г. Булгаков
Россия
Булгаков Геннадий Геннадьевич, аспирант
Москва
Список литературы
1. Ануров А. О., Булгаков Г. Г., Ярушев С. А. OMLS-Bench [Электронный ресурс]. – URL: https://github.com/Blgkff/OMLS-BENCH (дата обращения: 14.06.2025).
2. D. Hendrycks et al., “Measuring Massive Multitask Language Understanding,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2021. [Online]. Available: https://arxiv.org/abs/2009.03300
3. T. B. Brown et al., “Language Models are Few-Shot Learners,” Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 33, pp. 1877–1901, 2020. [Online]. Available: https://arxiv.org/abs/2005.14165
4. A. Wang et al., “GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding,” in *Proc. 2019 Conf. Empir. Methods Nat. Lang. Process. 9th Int. Jt. Conf. Nat. Lang. Process. (EMNLP-IJCNLP)*, pp. 353–361, 2019. [Online]. Available: https://arxiv.org/abs/1804.07461
5. A. Wang et al., “SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems,” in Proc. 3rd Workshop Eval. Compar. NLP Syst., 2020. [Online]. Available: https://arxiv.org/abs/1905.00537
6. S. Lu et al., “CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation,” in Proc. 2021 Conf. Empir. Methods Nat. Lang. Process. (EMNLP), 2021. [Online]. Available: https://arxiv.org/abs/2102.04664
7. M. Chen et al., “Evaluating Large Language Models Trained on Code,” arXiv preprint arXiv:2107.03374, 2021. [Online]. Available: https://arxiv.org/abs/2107.03374
8. M. Mitchell and D. C. Krakauer, “The Debate Over Understanding in AI’s Large Language Models,” arXiv preprint arXiv:2210.13966, 2022. [Online]. Available: https://arxiv.org/abs/2210.13966
9. D. Hendrycks et al., “Aligning AI With Shared Human Values,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2021. [Online]. Available: https://arxiv.org/abs/2008.02275
10. M. Suzgun et al., “Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them,” in Find. Assoc. Comput. Linguist.: ACL, pp. 4670–4685, 2022. [Online]. Available: https://arxiv.org/abs/2210.09261
11. M. Kazemi et al., “BIG-Bench Extra Hard,” arXiv preprint arXiv:2502.19187, 2025. [Online]. Available: https://arxiv.org/abs/2502.19187
12. H. Li et al., “CMMLU: Measuring Massive Multitask Language Understanding in Chinese,” in Find. Assoc. Comput. Linguist.: ACL, pp. 6543–6558, 2024. [Online]. Available: https://aclanthology.org/2024.findings-acl.671
13. Y. Wang et al., “MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark,” arXiv preprint arXiv:2406.01574, 2024. [Online]. Available: https://arxiv.org/abs/2406.01574
14. L. Austin et al., “Program Synthesis with Large Language Models,” in NeurIPS Workshop Mach. Learn. Syst., 2021. [Online]. Available: https://arxiv.org/abs/2108.07732
15. K. Cobbe et al., “Training Verifiers to Solve Math Word Problems,” Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 34, 2021. [Online]. Available: https://arxiv.org/abs/2110.14168
16. A. Radford et al., “Language Models are Unsupervised Multitask Learners,” OpenAI Tech. Rep., 2019. [Online]. Available: https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
Рецензия
Для цитирования:
Ярушев С.А., Ануров А.О., Булгаков Г.Г. OMLS-Bench: многоуровневый бенчмарк LLM для программной инженерии. Интеллектуальный транспорт. 2025;(3(35)):96-112.
For citation:
Yarushev S.A., Anurov A.O., Bulgakov G.G. OMLS-Bench: a multi-level benchmark for engineering LLMS. Intelligent transport. 2025;(3(35)):96-112. (In Russ.)
JATS XML




