Preview

Интеллектуальный транспорт

Расширенный поиск

OMLS-Bench: многоуровневый бенчмарк LLM для программной инженерии

Аннотация

В данной работе представлена система оценки OMLS-Bench (Open Multi-Level Skills Benchmark) двухэтапный фреймворк для всесторонней оценки больших языковых моделей в задачах программной инженерии. Цель предложенного подхода преодолеть ограничения существующих методик, которые либо измеряют узкие подзадачи, либо применяют единый уровень сложности и не фиксируют динамику инженерного мастерства и интерактивную природу диагностического рассуждения. Описываемая система охватывает девять доменов (Back-end, Front-end, Mobile, DevOps, Data Analysis, Machine Learning, Big Data, IoT, встроенные системы) и пять уровней сложности, что позволяет стратифицировать качество по доменам и уровням. Предлагается двухэтапная процедура: Этап I стандартизированные задания с множественным выбором и строгим форматом ответа , Этап II сценарные задания с пошаговыми контрольными списками и независимой моделью-судьёй. Формализованы метрики Tier Accuracy и Domain Accuracy, введён интегральный показатель OPS; раскрыты переменные формулы (1). Публикуются артефакты для воспроизводимости: JSON-схемы заданий, русскоязычные шаблоны промптов и скрипт оценки eval_mc.py с описанием входных/выходных параметров. Эксперименты показывают: неоднородность качества между доменами; снижение результатов при переходе от тестов с фиксированными вариантами к сценарным задачам; детальные диагностические отчёты по невыполненным пунктам контрольных списков. OMLS-Bench может служить практическим инструментом сравнения LLM в инженерных задачах и основой для целенаправленной донастройки моделей под конкретные области. Проведённая стартовая крупномасштабная оценка десяти современных больших языковых моделей выявила чёткую стратификацию результатов по уровням сложности и по сферам: модели большего масштаба демонстрировали высокую точность в широко представленных веб-ориентированных областях, тогда как специализированные направления (мобильная разработка, встроенные системы) показали существенно худшие показатели. Эти наблюдения подчёркивают важность как размера модели, так и разнообразия предметных данных при обучении. OMLS-Bench обеспечивает воспроизводимое и расширяемое средство оценки, которое может служить основой для разработки более надёжных и предметно ориентированных моделей-помощников инженера. В перспективе планируется развитие интерактивной фазы, повышение реалистичности сценариев и доработка контрольных чек-листов для приближения тестирования к профессиональной практике.

Об авторах

С. А. Ярушев
Российский Экономический Университет им. Г.В. Плеханова
Россия

Ярушев Сергей Александрович, к.т.н., директор научного центра

Москва



А. О. Ануров
Российский Экономический Университет им. Г.В. Плеханова
Россия

Ануров Александр Олегович, лаборант-исследователь

Москва



Г. Г. Булгаков
Российский Экономический Университет им. Г.В. Плеханова
Россия

Булгаков Геннадий Геннадьевич, аспирант

Москва



Список литературы

1. Ануров А. О., Булгаков Г. Г., Ярушев С. А. OMLS-Bench [Электронный ресурс]. – URL: https://github.com/Blgkff/OMLS-BENCH (дата обращения: 14.06.2025).

2. D. Hendrycks et al., “Measuring Massive Multitask Language Understanding,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2021. [Online]. Available: https://arxiv.org/abs/2009.03300

3. T. B. Brown et al., “Language Models are Few-Shot Learners,” Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 33, pp. 1877–1901, 2020. [Online]. Available: https://arxiv.org/abs/2005.14165

4. A. Wang et al., “GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding,” in *Proc. 2019 Conf. Empir. Methods Nat. Lang. Process. 9th Int. Jt. Conf. Nat. Lang. Process. (EMNLP-IJCNLP)*, pp. 353–361, 2019. [Online]. Available: https://arxiv.org/abs/1804.07461

5. A. Wang et al., “SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems,” in Proc. 3rd Workshop Eval. Compar. NLP Syst., 2020. [Online]. Available: https://arxiv.org/abs/1905.00537

6. S. Lu et al., “CodeXGLUE: A Machine Learning Benchmark Dataset for Code Understanding and Generation,” in Proc. 2021 Conf. Empir. Methods Nat. Lang. Process. (EMNLP), 2021. [Online]. Available: https://arxiv.org/abs/2102.04664

7. M. Chen et al., “Evaluating Large Language Models Trained on Code,” arXiv preprint arXiv:2107.03374, 2021. [Online]. Available: https://arxiv.org/abs/2107.03374

8. M. Mitchell and D. C. Krakauer, “The Debate Over Understanding in AI’s Large Language Models,” arXiv preprint arXiv:2210.13966, 2022. [Online]. Available: https://arxiv.org/abs/2210.13966

9. D. Hendrycks et al., “Aligning AI With Shared Human Values,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2021. [Online]. Available: https://arxiv.org/abs/2008.02275

10. M. Suzgun et al., “Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them,” in Find. Assoc. Comput. Linguist.: ACL, pp. 4670–4685, 2022. [Online]. Available: https://arxiv.org/abs/2210.09261

11. M. Kazemi et al., “BIG-Bench Extra Hard,” arXiv preprint arXiv:2502.19187, 2025. [Online]. Available: https://arxiv.org/abs/2502.19187

12. H. Li et al., “CMMLU: Measuring Massive Multitask Language Understanding in Chinese,” in Find. Assoc. Comput. Linguist.: ACL, pp. 6543–6558, 2024. [Online]. Available: https://aclanthology.org/2024.findings-acl.671

13. Y. Wang et al., “MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark,” arXiv preprint arXiv:2406.01574, 2024. [Online]. Available: https://arxiv.org/abs/2406.01574

14. L. Austin et al., “Program Synthesis with Large Language Models,” in NeurIPS Workshop Mach. Learn. Syst., 2021. [Online]. Available: https://arxiv.org/abs/2108.07732

15. K. Cobbe et al., “Training Verifiers to Solve Math Word Problems,” Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 34, 2021. [Online]. Available: https://arxiv.org/abs/2110.14168

16. A. Radford et al., “Language Models are Unsupervised Multitask Learners,” OpenAI Tech. Rep., 2019. [Online]. Available: https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf


Рецензия

Для цитирования:


Ярушев С.А., Ануров А.О., Булгаков Г.Г. OMLS-Bench: многоуровневый бенчмарк LLM для программной инженерии. Интеллектуальный транспорт. 2025;(3(35)):96-112.

For citation:


Yarushev S.A., Anurov A.O., Bulgakov G.G. OMLS-Bench: a multi-level benchmark for engineering LLMS. Intelligent transport. 2025;(3(35)):96-112. (In Russ.)

Просмотров: 29

JATS XML


Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 3033-6007 (Online)