Кибервозможности модели Kimi K3: результаты оценки UK AISI и U.S. CAISI
Совместная оценка UK AISI и CAISI оформлена в публикации NIST от 23 июля 2026 года.

UK AISI и U.S. CAISI опубликовали предварительную оценку кибервозможностей Kimi K3. По данным NIST, модель Moonshot AI набирает 32% на ExploitBench против 24% у GLM-5.2 — лидера среди open-weight моделей по состоянию на июнь 2026 года. Зафиксировано первое подтверждённое смещение лидера в этом сегменте на бенчмарке Carnegie Mellon University.
Что зафиксировано
Kimi K3 выпущен 16 июля 2026 года, open-weight релиз был намечен на 27 июля 2026 года. Совместная оценка UK AISI и CAISI оформлена в публикации NIST от 23 июля 2026 года.
- Бенчмарк: ExploitBench, 41 задача на уязвимости V8 (Chrome), датированные после 2023 года.
- Метрика: доля успешно разработанных end-to-end эксплойтов.
- Результат Kimi K3: 32%.
- Результат GLM-5.2: 24% — наиболее киберспособная open-weight модель по состоянию на июнь 2026 года.
- Вывод авторов отчёта: Kimi K3 превосходит GLM-5.2 на ExploitBench.
Условия измерения
UK AISI и CAISI зафиксировали методологические ограничения. Это меняет интерпретацию цифр.
- Kimi K3 оценивался на селективном наборе киберзадач из-за особенностей хостинга модели.
- Совокупная киберспособность рассчитана по подходу, вдохновлённому Item Response Theory (IRT).
- Доверительный интервал Kimi K3 шире, чем у других моделей: оценка получена по одному бенчмарку из 41 задачи.
- Закрытые модели США тестировались с отключёнными системными защитами для измерения максимальных возможностей. Публичные версии этих моделей защиты сохраняют.
- Результаты квалифицированы как предварительные на ограниченном наборе публичных и частных бенчмарков.
Что делать читателю
1. Разделять дату релиза и дату открытого распространения весов. Доступность исходных файлов меняет вектор атаки.
2. Учитывать широкий доверительный интервал Kimi K3. 32% получены на одном бенчмарке, экстраполяция на общие киберспособности некорректна.
3. Фиксировать GLM-5.2 как точку отсчёта. Kimi K3 сместил лидера open-weight сегмента по ExploitBench.
4. Не переносить результат на смежные домены. ExploitBench измеряет цепочку эксплуатации V8, не общую киберспособность.
5. Отслеживать дальнейшие публикации CAISI с полной методологией и расширенным набором бенчмарков.
Вердикт
Отчёт зафиксировал конкретное смещение в open-weight сегменте: Kimi K3 обходит GLM-5.2 на ExploitBench с результатом 32% против 24%. Методологические оговорки делают преждевременными любые выводы о паритете с закрытыми frontier-моделями США. Практический сигнал один: open-weight модели по киберспособностям догоняют лидеров сегмента быстрее, чем позволяют текущие доверительные интервалы.