🛡 OGL-Mini: три стадии защиты ИИ-агентов от промпт-инъекций Tenable в декабре 2025 заставила агента Microsoft Copilot Studio раскрыть платёжные данные и бесплатно забронировать отпуск. Промпт-инъекция обошла проверку личности. Встроенные фильтры не спасают. По данным habr_infosec, промпт-инъекции остаются первым пунктом OWASP LLM Top 10. Автор выложил модель OGL-Mini с открытым кодом — внешний слой проверки перед LLM. Три стадии: эвристики (0.1 мс), мини-классификатор TF-IDF (3–7 мс), средство обнаружения PII (1 мс). Полный цикл — 10–300 мс на слабом CPU. Модель дистиллирована из DeBERTa-v3-xsmall, обучена на 110 734 примерах: 54 162 промпт-инъекций, 22 500 атак на агентов, 14 000 обфускаций. Работает как модуль для TypeScript, Python, Go. OGL-Mini не полагается на встроенные фильтры. Policy Puppetry от HiddenLayer обходила GPT-4, Claude, Gemini — здесь классификатор независимый. Непрямые инъекции через отравленную документацию (кампания Zscaler ThreatLabz с requests-secure-v2) перехватываются на входе, до передачи в модель. Атаки на агентов типа LITL проверяются в выходных данных. Ограничение: сканер для вызовов инструментов в MCP пока только в планах. Внешний фильтр с объяснимостью — это не панацея, но первый шаг к нормальному обнаружению угроз в SOC: вы видите, что отсеяли, и можете проверять ложные срабатывания. Без логов такая модель — просто чёрный ящик поменьше. #LLMsecurity #PromptInjection #AIagents #OGLMini #AppSec