digestors.

Понятно, практично, по делу

Кибервозможности модели Kimi K3: результаты оценки UK AISI и U.S. CAISI

Совместная оценка UK AISI и CAISI оформлена в публикации NIST от 23 июля 2026 года.

Кибервозможности модели Kimi K3: результаты оценки UK AISI и U.S. CAISI

UK AISI и U.S. CAISI опубликовали предварительную оценку кибервозможностей Kimi K3. По данным NIST, модель Moonshot AI набирает 32% на ExploitBench против 24% у GLM-5.2 — лидера среди open-weight моделей по состоянию на июнь 2026 года. Зафиксировано первое подтверждённое смещение лидера в этом сегменте на бенчмарке Carnegie Mellon University.

Что зафиксировано

Kimi K3 выпущен 16 июля 2026 года, open-weight релиз был намечен на 27 июля 2026 года. Совместная оценка UK AISI и CAISI оформлена в публикации NIST от 23 июля 2026 года.

  • Бенчмарк: ExploitBench, 41 задача на уязвимости V8 (Chrome), датированные после 2023 года.
  • Метрика: доля успешно разработанных end-to-end эксплойтов.
  • Результат Kimi K3: 32%.
  • Результат GLM-5.2: 24% — наиболее киберспособная open-weight модель по состоянию на июнь 2026 года.
  • Вывод авторов отчёта: Kimi K3 превосходит GLM-5.2 на ExploitBench.

Условия измерения

UK AISI и CAISI зафиксировали методологические ограничения. Это меняет интерпретацию цифр.

  • Kimi K3 оценивался на селективном наборе киберзадач из-за особенностей хостинга модели.
  • Совокупная киберспособность рассчитана по подходу, вдохновлённому Item Response Theory (IRT).
  • Доверительный интервал Kimi K3 шире, чем у других моделей: оценка получена по одному бенчмарку из 41 задачи.
  • Закрытые модели США тестировались с отключёнными системными защитами для измерения максимальных возможностей. Публичные версии этих моделей защиты сохраняют.
  • Результаты квалифицированы как предварительные на ограниченном наборе публичных и частных бенчмарков.

Что делать читателю

1. Разделять дату релиза и дату открытого распространения весов. Доступность исходных файлов меняет вектор атаки.

2. Учитывать широкий доверительный интервал Kimi K3. 32% получены на одном бенчмарке, экстраполяция на общие киберспособности некорректна.

3. Фиксировать GLM-5.2 как точку отсчёта. Kimi K3 сместил лидера open-weight сегмента по ExploitBench.

4. Не переносить результат на смежные домены. ExploitBench измеряет цепочку эксплуатации V8, не общую киберспособность.

5. Отслеживать дальнейшие публикации CAISI с полной методологией и расширенным набором бенчмарков.

Вердикт

Отчёт зафиксировал конкретное смещение в open-weight сегменте: Kimi K3 обходит GLM-5.2 на ExploitBench с результатом 32% против 24%. Методологические оговорки делают преждевременными любые выводы о паритете с закрытыми frontier-моделями США. Практический сигнал один: open-weight модели по киберспособностям догоняют лидеров сегмента быстрее, чем позволяют текущие доверительные интервалы.