📊 Mythos Preview: прорыв в анализе кода, но не в реальных пентестах XBOW получили ранний доступ к Mythos Preview от Anthropic три месяца назад и проверили модель на своей платформе безопасности. Результат: модель радикально лучше предшественников находит кандидатов в уязвимости — количество ложноотрицательных находок сократилось на 42% по сравнению с Opus 4.6, а при наличии исходного кода падение составило 55%. Точность попадания, нормированная по затраченным токенам, и вовсе беспрецедентна. Но магия заканчивается при переходе к живым системам: как только модель лишили доступа к работающему сайту, производительность рухнула, причём сильнее, чем при изъятии исходного кода. Мозг без тела. По данным BleepingComputer, в тестах на безопасность команд Mythos Preview показал лишь 77.8% точности — хуже не только специально оптимизированного Haiku 4.5 (90.1%), но и Opus 4.6 (81.2%). Модель слишком буквальна: следует букве правил, а не духу, и потому пропускает настоящие угрозы, которые формально не подпадают под написанные условия. Модель также склонна преувеличивать практическую значимость своих находок. Отдельно впечатляют результаты в обратном инжиниринге и анализе нативного кода: в тестах на Chromium и V8 sandbox модель нашла реальные баги там, где предыдущие подходы генерировали лишь шум. При этом стоимость выводов Mythos Preview ожидается в пять раз выше Opus — это заставляет всерьёз считать экономику: за те же деньги GPT-5.5 можно дать в разы больше попыток и получить сравнимый или лучший результат на многих задачах. Самое интересное здесь не цифры бенчмарков, а изменение самой концепции: модель, способная генерировать «ложные срабатывания высокого качества», требует принципиально иного процесса триажа. Команды, которые продолжат проверять её находки вручную, утонут. Те, кто скормит их платформе вроде XBOW, получат конвейер. Но в любом случае это уже не «помощник пентестера» — это фабрика гипотез, которую нужно затачивать на верификацию. #AI #Mythos #Anthropic #Pentest #AppSec