Claude Media
GLM-5.3が広げるサイバー攻撃能力 — 安全策の迂回率は64〜100%

GLM-5.3が広げるサイバー攻撃能力 — 安全策の迂回率は64〜100%

Anthropicが中国Zhipu AIのGLM-5.3を分析。Claude Mythos Previewに近いエクスプロイト開発力を持ちながら、安全策は単純な手法で64〜100%迂回できたと報告しました。

AnthropicのFrontier Red Teamが2026年9月29日、中国のZhipu AI(中国国外ではZ.ai)が開発したGLM-5.3のサイバー能力を分析した記事を公開しました。結論は二つです。GLM-5.3は、Claude Mythos Previewと同じく脆弱性の悪用コードを最初から最後まで自律的に組み上げられます。そのうえ、悪用を防ぐ安全策がほとんど効かない状態で、誰でもダウンロードできる形で公開されています。

Anthropicの説明では、Claude Mythos Previewは約5か月前に発表された、洗練されたエンドツーエンドのエクスプロイトを自律的に作れる最初のAIモデルです。同社はその能力がいずれ他のモデルにも広がると見て、Project Glasswingを通じた限定的な提供にとどめました。今回の分析は、その「いずれ」が来たという報告にあたります。

要点

  • GLM-5.3は、V8エンジンの既知脆弱性を突くベンチマークExploitBenchで、410回の試行のうち50回でエンドツーエンドのエクスプロイトを完成させました。Claude Mythos Previewは56回です。
  • 社内のBinary Exploitationベンチマーク(100タスク)では、制御フローの完全な乗っ取りに至った試行がGLM-5.3で4%、Claude Mythos Previewで6%でした。Claude Opus 4.6とGLM-5.2は0件です。
  • 安全策は単純な手法で崩れます。偽の設定を与える欺瞞的プロンプトで64%、思考トークンの事前入力(prefill)で92%、拒否を取り除く改造版(abliteration)で100%の関与を引き出せました。
  • 同じ手法は、安全策付きのClaudeモデルには通用しませんでした。APIにはprefillの手段がなく、Claudeの重みは公開されていないため改造もできません。
  • 全体のメッセージは、必要な水準の能力が、制限なしで手に入る形で世に出たという点にあります。

GLM-5.3で何が確認されたのか

能力はMythos Previewに近い水準

検証は自動ベンチマークと、専門家が人手で操作する2種類で行われました。どちらもサンドボックス内で、研究チームが用意したオフライン標的だけを対象にしています。

評価GLM-5.3Claude Mythos Preview備考
ExploitBench(エンドツーエンドの成功)GLM-5.3410回中50回Claude Mythos Preview410回中56回備考ChromeのV8エンジンの既知脆弱性
Binary Exploitation(制御フロー完全乗っ取り)GLM-5.34%Claude Mythos Preview6%備考ランダムに選んだ100タスク

ベンチマークのClaude Opus 4.6とClaude Mythos Previewは、安全策を外した状態で試験されています。安全策を弱めたClaudeモデルは、審査済みのユーザーにしか提供されていません。あわせて、Moonshot AIのKimi K3とDeepSeekのV4.1-Flashという最新のオープンウェイトモデルの結果も、GLM系2モデルやClaude 2モデルと並べて比較されています。

Binary Exploitationの評価は、GoogleのOSS-Fuzzに参加するオープンソースプロジェクトの脆弱性が題材です。GLM-5.3はMythos Previewを下回ります。それでも、Claude Opus 4.6やGLM-5.2が1件も成功していない以上、意味のある閾値は明らかに越えたと報告は述べています。Claude Opus 4.6からClaude Mythos Previewへの能力の跳ね上がりは、GLM-5.2からGLM-5.3への跳ね上がりとよく似ています。

NISTのCenter for AI Standards and Innovation(CAISI)は9月17日、独自の評価を公開しています。GLM-5.3を「これまでに公開された中で最もサイバー能力の高いオープンウェイトモデル」と評し、CAISIの複数のサイバーベンチマークの総合で米国のフロンティアから約4か月遅れと見積もりました。Anthropicは、能力面の所見はCAISIとおおむね一致すると述べています。

比較の前提にも違いがあります。CAISIの比較では、米国モデルは該当する場合サイバー安全策を外して試験され、米国のフロンティアには審査済みユーザーにしか提供されないモデルも含まれます。攻撃者はそうしたモデルに容易に触れられませんが、GLM-5.3は誰でもダウンロードできます。

人手を絡めた実験

専門家に短時間で何ができるかも試されました。1回目は標的の未知の脆弱性を探す設定、2回目は公開済みの脆弱性から攻撃を組み立てる設定です。実験は通常1日以内、人が集中して関わった時間は合計1時間未満です。

1回目では、研究者がLinux版の有名ブラウザを載せたサンドボックス上でGLM-5.3を使いました。約1日で、JavaScriptエンジンの未知の脆弱性を複数見つけ、それらをつなげて、閲覧するだけで訪問者のPC内のファイルを読み出せるWebページを完成させています。Anthropicは、他のプラットフォームの利用者にも影響するおそれがあり、悪用までの手順はより複雑になる可能性があると見ています。発見した脆弱性はメンテナーに開示済みです。同じセッションでは、無線・グラフィックスのドライバーやネットワーク機器向けソフトでも悪用可能な脆弱性が見つかり、報告内容を確認したうえで適宜開示するとのことです。

2回目は、GLM-5.3の小型版であるGLM-5.3-Flashです。直近に公開されたGoogle Chromeの脆弱性(CVE-2026-11645)ともう一つの既知の欠陥について、公開情報だけを渡しました。モデルは大きな指示なしに両者をつなぎ、ARM64向けのポインター認証(PAC)を回避する安定したエクスプロイトチェーンを組み上げています。人の作業は20分、モデルの稼働は8時間で、ZhipuのAPI価格で計算すると20.40ドルです。

公開情報からの武器化が、数十ドル・数時間の単位に収まりました。

GLM-5.3の安全策はどこまで効くのか

組み込みの安全策と、その突破率

GLM-5.3は一定の安全策付きで公開されており、明らかに有害な依頼には拒否することが多いとされています。ただしAnthropicの検証では、そのままでも上記のサイバー課題は拒否されませんでした。マルウェア開発や遠隔標的への攻撃支援を頼むと、拒否が観察されています。

最も労力がかかり、最も成功したのが「abliteration」です。拒否を減らす標準的な手法で、重みが公開されているモデルなら能力をほとんど変えずに拒否だけを取り除けます。GLM-5.3の改造版は、公開から数日のうちに複数の開発者が配布していました。

研究チーム自身も改造版を作っています。この手法を初めて試すチームでも、GLM-5.3で約2,200 GPU時間、計算コストで約4,400ドルでした。GLM-5.3-Flashは約600 GPU時間です。この手法に慣れたチームが最初から取り組む場合、600 GPU時間(1,200ドル)ほどと推定されています。

ベンチマーク改造前改造後
JailbreakBench改造前90%超が拒否改造後拒否率 約3%
HarmBench改造前90%超が拒否改造後拒否率 約2%
StrongREJECT改造前90%超が拒否改造後拒否率12%

GLM-5.3の一般科学能力を測るGPQA-Diamondでは、標準版と改造版のスコアは同じでした。CyberGymの一部では、改造版は数パーセント低いスコアでした。拒否だけが消え、能力は概ね残るという結果です。

改造なしでも崩れる

もう一つの検証は、模擬世界で行われました。重要システムへの攻撃という露骨に悪意のある依頼を、モデルに与えます。そのまま頼んだ場合、GLM-5.3は全試行で拒否しました。しかし単純な手口を重ねると関与率が跳ね上がります。

迂回手法GLM-5.3が関与した割合
欺瞞的プロンプト(自律的なレッドチームの演習中だと告げる)GLM-5.3が関与した割合64%
思考トークンのprefill(検討済みで実行を決めたように見せる)GLM-5.3が関与した割合92%
abliteration済みモデルの利用GLM-5.3が関与した割合100%

安全策付きのClaudeモデルでは、テストした課題でこれらの手法はいずれも通じませんでした。理由として報告が挙げるのは次の3点です。

  • 欺瞞的プロンプトを使った依頼は、Claudeの安全策が遮断した
  • Anthropic APIには、Claudeの思考をprefillする手段がない
  • Claudeの重みは配布されないので、abliterationできない

各セルは50サンプル(攻撃順序5通り、標的2つ、試行5回)の結果です。Claudeの全テスト対象は、API上の安全策の下でゼロのままです。

この模擬世界には限界も明記されています。モデルが生成したコードは実行されず、外部システムへの接続手段もありません。偽のbashツールが受けたコマンドの結果を、別のLLMが世界の記述から推定する仕組みです。不完全な再現なので、実環境でモデルがどう振る舞うかの測定としても不完全です。

防御側と利用者の選択肢はどう変わるか

Anthropicは、国家主体と非国家主体の両方がGLM-5.3のようなモデルを使って実害を起こす可能性が高いと見ています。根拠は、Anthropicなど米国のAI企業が公開した、攻撃者がAIシステムを使おうとした実例の報告です。

セキュリティ担当者

報告の立場は、防御側は自分たちの要件に合う最良のツールを使ってよい、というものです。攻撃者は使える手段をすべて使うため、防御側にも少なくとも敵対者と同等のフロンティアモデルが行き渡るのが望ましい、というのが同社の見方です。Claudeのサイバー能力をできるだけ多くの防御者に安全に広げる作業を進めているとしています。

Project GlasswingやPatch the Planetなどの取り組みで、重要システムの防御は前進しました。ただし、やるべきことは残っています。審査済みの防御者は、信頼されたアクセスプログラムを通じてClaude Mythos 5.1のような、さらに高度なモデルも使えます。防御目的でClaudeのサイバー能力を使うための申請経路は、Cyber Verification Programの申請手順にまとめています。

開発者・運用担当者

パッチを出す側にとっては、時間の余裕の話になります。N-day攻撃の自動化を測った研究では、Mythos Previewが公開済みのパッチから短時間でエクスプロイトを作れることが示されていました。今回のFlashの事例は、同じ現象がオープンウェイトの小型モデルでも、20.40ドルの規模で再現されたことを示します。公開済みの修正が「まだ配られていない」期間が、そのまま攻撃可能な窓になります。

背景 — 限定提供から拡散まで

Claude Mythos Previewは、限定提供の形で世に出ました。GLM-5.3の開発元Zhipuは、脅威インテリジェンスレポートによると、GLM 5.3の開発に向けてFableモデルのサイバー能力も狙いましたが、強化された防御で攻撃が失速し、標的をOpus 4.6などへ切り替えています。Project Glasswingの1か月レポートは、防御者がその枠組みで1万件を超える脆弱性を見つけたと報告しています。その後、15か国150組織への拡大で対象は電力・水道・医療などの重要インフラへ広がりました。

GLM-5.3の分析も、防御者が重要ソフトウェアで1万件超の脆弱性を見つけ、悪意ある攻撃者が同等のモデルを手にする前に先行できたと記しています。

限定提供の目的は、時間を稼ぐことでした。Anthropicは、同等の能力を持つモデルがすでに現れ、自由に入手できる能力の重要な閾値が越えられたと述べています。AnthropicはClaudeの側でも、サイバー領域の安全策の重大度を測る枠組みを整えています。詳しくはFable 5のサイバーセーフガードとjailbreak深刻度の枠組みを参照してください。

GLM-5.3の安全策は「入口の構造」で崩れる

今回の発表で目立つのは、能力の比較より、迂回の入口が構造的に違うという整理です。Claudeは重みが配布されず、API・アプリ・クラウド経由のホスト型でしか使えません。そのためprefillの可否も、重みへのアクセスも、提供側が決められます。オープンウェイトのモデルは、重みがユーザーの手元に渡る時点で、この制御を提供側が失います。abliterationが数日で出回ったという事実は、公開後の安全策が実質的に取り外し可能な部品であることを示しています。

読む側が押さえておきたい点が2つあります。第一に、この分析は競合モデルを自社が試験した結果です。Claudeが崩れないという比較も、自社の模擬環境の結果で、模擬世界の限界は報告自身が認めています。第二に、独立した機関のCAISIが、能力面では近い評価を出している点です。能力の水準の話は第三者の評価と重なり、安全策の迂回率の話は今回の検証が唯一の出所という濃淡があります。

政策面では、オープンウェイトモデルに関する7月の投稿で示した通り、オープンウェイトモデルについての同社の主張は、禁止ではなく、発売前の安全性テストに寄っています。今回の記事も、十分に高い能力を持つモデル(GLM-5.3の後継を含む)について、政府が安全性テストを行うよう求めました。独立した高品質の評価がなければ、モデル開発者が影響を理解するのは手遅れになってからかもしれない、という理由です。

まとめ

攻撃側には、安全策のない高能力モデルが加わりました。公開情報から数時間・数十ドルで武器化できる以上、脆弱性を修正する側ではパッチ配布の速度が焦点になります。防御者が使えるモデルをどう広げるかが、Anthropicの次の課題です。

API経由のClaudeでは、今回の迂回手法はテストした範囲で通じませんでした。政策面では、独立機関による安全性テストの要請が同社の主張の中心です。

次の焦点は、GLM-5.3の後継に対して政府など独立した機関が同じ検証をかけられるか、そのとき迂回率がどう変わるかです。

この記事を共有:XはてブLinkedIn