БОЛЬШИЕ ЯЗЫКОВЫЕ МОДЕЛИ В АВТОМАТИЗАЦИИ ТЕСТИРОВАНИЯ НА ПРОНИКНОВЕНИЕ: СОВРЕМЕННОЕ СОСТОЯНИЕ, ОГРАНИЧЕНИЯ И ПЕРСПЕКТИВЫ ПРИМЕНЕНИЯ В ПРОФЕССИОНАЛЬНОЙ ПОДГОТОВКЕ СПЕЦИАЛИСТОВ ПО ИНФОРМАЦИОННОЙ БЕЗОПАСНОСТИ
Аннотация
Статья посвящена анализу современного состояния исследований в области применения больших языковых моделей (LLM) для автоматизации тестирования на проникновение (пентеста). Рассматриваются причины стремительного роста интереса к данному направлению, обусловленные усложнением ИТ-инфраструктур, высокой стоимостью традиционных методов аудита защищённости и развитием концепции DevSecOps. На основе систематизации обзорных и прикладных исследований 2023–2025 годов выявлены четыре ключевых направления применения LLM в кибербезопасности: поддержка принятия решений и стратегического планирования атак, автоматизация этапов пентеста, обеспечение защищённости самих языковых моделей (AI Red Teaming), а также интеллектуальный анализ исходного кода. Проведён критический анализ архитектур мультиагентных систем с использованием подходов Retrieval-Augmented Generation (RAG), систем тестирования и оценки эффективности, а также коммерческих решений. Установлено, что даже наиболее продвинутые системы пентеста на базе LLM находятся на промежуточных уровнях автономности (3–4 из 5), не способны самостоятельно формулировать цели и оценивать последствия своих решений. Обосновывается тезис о том, что на конец 2025 года LLM выступают прежде всего инструментом аналитика, а не автономным пентестером. Рассматриваются педагогические аспекты интеграции LLM-инструментов в профессиональную подготовку специалистов по информационной безопасности, обосновывается необходимость формирования у обучающихся критического мышления в отношении возможностей и ограничений данных технологий. Отдельное внимание уделяется требованиям к воспроизводимости исследований и педагогической интерпретации полученных результатов.
Онлайн просмотр
Список литературы
- Новиков, А. М. Профессиональное образование России: перспективы развития / А. М. Новиков. – Москва: ИЦП НПО РАО, 1997. – 254 с.
- Леонтьев, А. Н. Деятельность. Сознание. Личность / А. Н. Леонтьев. – Москва: Политиздат, 1975. – 304 с.
- Лернер, И. Я. Проблемное обучение / И. Я. Лернер. – Москва: Знание, 1974. – 64 с.
- Тихомиров, В. П. Цифровая трансформация образования: вызовы и возможности / В. П. Тихомиров, Н. В. Тихомирова // Открытое образование. – 2019. – № 4. – С. 4–14.
- Alaryani, M. Towards Supporting Penetration Testing Education with Large Language Models: an Evaluation and Comparison / M. Alaryani [et al.] // arXiv preprint arXiv:2501.17539. – 2025.
- Happe, A. Getting pwn'd by AI: Penetration Testing with Large Language Models / A. Happe, J. Cito // Proceedings of the 31st ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering. – 2023. – P. 2082–2086.
- Deng, G. PentestGPT: An LLM-empowered Automatic Penetration Testing Tool / G. Deng [et al.] // arXiv preprint arXiv:2308.06782. – 2023.
- Xu, Z. AutoAttacker: A Large Language Model Guided System to Implement Automatic Cyber-attacks / Z. Xu [et al.] // arXiv preprint arXiv:2403.01038. – 2024.
- Fang, R. LLM Agents can Autonomously Exploit One-day Vulnerabilities / R. Fang [et al.] // arXiv preprint arXiv:2404.08144. – 2024.
- Shao, R. Empirical Analysis of Large Language Models in Automated Vulnerability Discovery / R. Shao [et al.] // arXiv preprint arXiv:2312.02337. – 2023.
- Bhatt, M. Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models / M. Bhatt [et al.] // arXiv preprint arXiv:2312.04724. – 2023.
- Wan, Y. Cybersecurity Issues and Challenges: In Brief / Y. Wan [et al.] // IEEE Access. – 2024. – Vol. 12. – P. 1–15.
- Moskal, S. LLM in the Shell: Generative AI-Powered Pentesting / S. Moskal [et al.] // arXiv preprint arXiv:2312.09552. – 2023.
- Charan, P. V. S. From Text to MITRE Techniques: Examining the Layered Approach to Explainability With a Large Language Model (LLM) / P. V. S. Charan [et al.] // arXiv preprint arXiv:2308.09197. – 2023.
- Tihanyi, N. CyberMetric: A Benchmark Dataset for Evaluating Large Language Models Knowledge in Cybersecurity / N. Tihanyi [et al.] // arXiv preprint arXiv:2402.07688. – 2024.
- Peng, B. PenHeal: A Two-Stage LLM Framework for Automated Pentesting and Optimal Remediation / B. Peng [et al.] // arXiv preprint arXiv:2407.17788. – 2024.
- Wan, Y. HackMentor: Fine-Tuning Large Language Models for Cybersecurity / Y. Wan [et al.] // arXiv preprint arXiv:2312.01234. – 2023.
- Yang, J. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? / J. Yang [et al.] // arXiv preprint arXiv:2310.06770. – 2023.
- Краевский, В. В. Методология педагогики: новый этап / В. В. Краевский. – Москва: Академия, 2006. – 400 с.
- Батышев, С. Я. Профессиональная педагогика / С. Я. Батышев; под ред. С. Я. Батышева, А. М. Новикова. – 3-е изд. – Москва: ЭГВЕС, 2010. – 456 с.
- Вербицкий, А. А. Активное обучение в высшей школе: контекстный подход / А. А. Вербицкий. – Москва: Высшая школа, 1991. – 207 с.
- Сластёнин, В. А. Педагогика / В. А. Сластёнин. – Москва: Академия, 2002. – 576 с.
- Зеер, Э. Ф. Психология профессионального образования / Э. Ф. Зеер. – Москва: Академия, 2009. – 384 с.
- Alias Robotics. Cybersecurity AI (CAI): An Open, Bug Bounty-Ready Agentic Framework // arXiv preprint arXiv:2504.06017. – 2025.
Лицензия
Copyright (c) 2025 В. С. Греков (Автор)