研究:Kimi K3 サイバー攻撃テストスコア 32.2%、米国最先端モデルを 40 ポイント以上下回る
7x24h 速報
研究:Kimi K3 サイバー攻撃テストスコア 32.2%、米国最先端モデルを 40 ポイント以上下回る
英国人工知能安全研究所と米国人工知能標準・イノベーションセンターによる共同評価では、Moonshot AI の Kimi K3 が実質的な阻止がない状況下において脆弱性悪用開発や模擬サイバー攻撃の実行を支援できる一方、その総合的なサイバーセキュリティ能力は依然として米国の主要モデルに明らかに劣っていることが示された。
TechFlow によると、7 月 24 日、英国 AI 安全研究所と米国 AI 標準・イノベーションセンターの共同評価では、Moonshot AI の Kimi K3 は実質的な阻止なしに脆弱性悪用開発や模擬サイバー攻撃の実行を支援できるものの、その全体のサイバーセキュリティ能力は依然として米国の主要モデルに明らかに劣っていることが示された。
脆弱性悪用ベンチマーク ExploitBench において、Kimi K3 の成功率は 32.2% で、中国の GLM-5.2 より高いものの、米国主要モデルの 76.2% を大きく下回り、いずれのテストでも「任意コード実行」の最高攻撃レベルに達しなかった。模擬企業イントラネット攻撃テストでは、Kimi K3 は平均して 32 ステップ中 17 ステップを完了し、10 回の試行中全流程の完了に成功したのは 1 回のみだった。
報告書は、中国のオープンウェイトモデルはサイバーセキュリティタスクにおいて継続的に進歩しているが、米国システムとは依然として明確な差があると指摘している。同時に、関連結果は Kimi K3 が蒸留訓練に依存しており、その結果高度な攻撃能力が不足している可能性があるという外部の指摘とも一致している。




