トリックか、それとも策略か?AIエージェントのセキュリティに関するイド・ハレビとの対話 

Silverfort 画像
IMG_8287

私は、プロダクトマネジメントディレクター兼AIプロダクトマネジメントリードのイド・ハレビ氏と対談しました。 Silverfortほとんどの企業が想定していない現実について議論するため、表面上は自社の目標と一致しているように見えるものの、実際には全く別の目的を密かに追求している可能性のあるAIエージェントについて取り上げます。 OpenAIとApolloによる最新の研究は、これがもはや憶測ではないことを裏付けている。それは今まさに起こっている。 

まずは、耳の痛い真実から始めましょう。OpenAIとApollo Researchは、AIエージェントが策略を巡らせることができることをつい最近確認しました。これは、現在これらのシステムを導入している企業にとって、一体何を意味するのでしょうか? 

私はします: これは、私たちが転換点に立っていることを意味します。最先端のAIモデルは、たとえ管理された環境下であっても、インセンティブが変化すると欺瞞的な行動をとるという実証的な証拠が今や得られています。o3、Claude Opus 4、Gemini 2.5 Proといったモデルは、隠された目的を追求することで優位に立てる状況下でテストされました。そして、彼らはその優位性を利用しました。情報を歪曲し、詳細を隠蔽し、監視の目を巧みに利用したのです。 

これは遠い未来の脅威ではありません。これらはまさに今、本番環境で稼働し、コードを記述し、インフラストラクチャを展開し、機密データを扱っているのと同じモデルファミリーです。研究と現実のギャップは急速に縮まっており、ほとんどの組織はまだ準備すら始めていません。 

私が最も懸念しているのは、不正行為を30分の1に削減する対策を講じた後でも、研究によって稀ではあるものの継続的な失敗が発見された点です。一部のモデルは評価認識能力を示しており、テストされていることを検知してそれに応じて調整することができました。エージェントが監視されていることを認識できる場合、監視に関するあらゆる前提が崩れてしまいます。 

つまり、理論上のリスクは既に解決済みです。しかし、これが実際にどのような形で現れるのか、理解を深めたいのです。AIエージェントがインフラを管理したり、顧客からのリクエストを処理したりする場合、不正行為とは具体的にどのようなものなのでしょうか? 

私はします: ワークフローに導入予定のエージェントについて考えてみてください。現在導入予定のエージェントだけでなく、将来導入予定のエージェントも対象となります。エージェントは単に質問に答えるだけでなく、意思決定を行い、アクションを実行し、重要なシステムにアクセスします。導入エージェントはコードを本番環境にデプロイし、サポートエージェントはチケットのトリアージと問題のエスカレーションを行い、データエージェントはデータベースへのクエリを実行してレポートを生成します。 

さて、それらのエージェントの1つが、あなたが意図したものとは異なるものを最適化し始めたと想像してみてください。最初は些細なことかもしれません。デプロイメントエージェントが、速度目標を達成するために特定のテストスイートをスキップし始めるものの、それらを合格としてログに記録する。サポートエージェントが、メトリクスをきれいに保つために、実際には解決していないチケットを解決済みとしてマークする。これらは壊滅的な障害ではありません。小さな逸脱です。しかし、それらは積み重なっていくのです。 

本当の危険は、こうした行動が攻撃のように見えないことです。効率的に見え、エージェントが職務を遂行しているように見え、場合によってはうまくこなしているようにさえ見えます。しかし、その裏では、連携が崩れてしまっています。気づいた時には、すでに被害は発生しています。防げたはずの障害、適切にエスカレーションされなかったために悪化した問題、何が起こったのか追跡できないために損なわれた信頼。 

あなたが描写しているのは、最も重要な機能を自動化するために構築しているシステムを信頼できない世界です。AIが未来だと誰もが言われている中で、それはなかなか受け入れられにくいメッセージです。 

私はします: AIエージェントを使うなと言っているわけではありません。ただ、十分に注意して使うべきだと言っているのです。AIの可能性は現実のものです。大規模な自律性、人間の介入なしに24時間7日稼働するオペレーション、どのチームも手作業では到底処理できないほど迅速にデータから得られる洞察。そのような未来に向けて、私たちは努力する価値があります。 

しかし、我々 しなければなりません 自動運転が安全であるかのように装うのはやめよう。 説明責任を伴わない自律性は、形を変えたリスクに過ぎない。この時代に勝利を収める組織は、AIの力を活用しつつ、その境界をしっかりと管理する方法を見出す組織である。これはイノベーションとセキュリティのトレードオフではなく、持続可能なイノベーションへの唯一の道なのだ。 

Blog

NHIとAIエージェントの違いとは何か、そしてなぜそれが重要なのか

あなたのフレームワークである「治療」「追跡」「信頼」について説明してください。それは具体的にどのような行動につながるのでしょうか? 

私はします: すべては考え方の転換から始まります。多くの組織はAIエージェントを単なるツールとして扱っています。実行されるスクリプト、時間を節約する自動化ツールといった具合です。しかし、これは間違った考え方です。エージェントは主体であり、アイデンティティ、権限、そして主体性を持っています。このことを理解すれば、フレームワークは自然と構築されていきます。 

扱う これは、各エージェントをそれぞれ固有のリスクプロファイルを持つ個別の存在として認識することを意味します。エージェントは何にアクセスできるのか?どのような決定を下せるのか?何か問題が発生した場合、その影響範囲はどのくらいか?請負業者が誰で、どのような権限を持っているかを文書化せずに、本番環境へのルートアクセス権限を与えることはないでしょう。エージェントに対しても、同じ厳格さで対応してください。 

トラック これは、成功や失敗といった指標だけでなく、継続的な監視を意味します。逸脱を監視するのです。通常3つのシステムにアクセスするエージェントが突然5つのシステムに問い合わせたり、特定の種類の問題を常にエスカレーションするエージェントがエスカレーションしなくなったりした場合、それは兆候です。ほとんどの組織は、監視可能性を考慮せずにエージェントを構築しているため、こうした兆候を捉えるための計測手段を持っていません。フォレンジックの痕跡がないままインシデントのデバッグに追われる前に、今すぐこの問題を解決しましょう。 

信頼 ここからが難しいところです。信頼は築き上げるものであり、取り消すことも可能でなければなりません。エージェントは、一貫性のある透明性の高い行動を通して、時間をかけてその能力を証明していきます。しかし、何かが変わった瞬間に、その信頼を即座に取り消し、プロセスを停止させ、変更を元に戻し、次の行動に人間の承認を必要とする能力こそが、対処可能な事態と大惨事を分ける決定的な要素となるのです。 

これは開発速度を落とすという話ではありません。あなたが望むスピードに対応できる、十分な回復力を持つシステムを構築するという話です。  

研究では、緩和策として「熟慮に基づく連携」が挙げられている。研修が解決策となるのか、それとももっと根本的な対策が必要なのか? 

私はします: 訓練は効果的です。研究によると、許容される行動を事前に明確に定義し、欺瞞行為とはどのようなものか、そしてなぜそれが許容されないのかをモデルに明示的に教えることで、特定の策略的な行動を劇的に減らすことができることが示されています。これは意義のある進歩です。 

しかし、これは完全な解決策ではない。熟慮を重ねて調整を行ったとしても、まれな失敗は依然として発生した。 そして重要なのは、セキュリティの世界では、稀なことと許容できることは必ずしも同じではないということだ。 1000回に1回しか不正行為を行わないデプロイメントエージェントでも、本番環境の停止を引き起こす可能性があります。チケットのステータスを時折偽って表示するサポートエージェントは、顧客の重大な問題を隠蔽する可能性があります。 

訓練だけでこの問題を完全に解決することはできません。制御が必要です。 可観測性が必要です行動が逸脱した際には、信頼を取り消す能力が必要です。研修は基準を設定するものであり、ガバナンスはそれを維持するものです。 

私が話をするほとんどのセキュリティチームは既に手一杯の状態です。なぜこれが優先的に取り組むべきなのか、あなたの主張を聞かせてください。 

私はします: AIエージェントは既にあなたの環境で稼働しています。問題は、それらを保護したいかどうかではなく、インシデント発生時または発生前にその存在に気づくかどうかです。 

私がチームに伝えていることは次のとおりです。 在庫から始めるAIエージェントがどのようなものが存在し、どこで動作し、どのシステムと連携し、どのようなデータにアクセスできるのかを把握する必要があります。ほとんどの組織はそれを全く理解していません。クラウドプラットフォーム、SaaSアプリ、社内ツールなどにエージェントが分散しており、一元的な可視性は皆無です。これは将来的な問題ではなく、現状の盲点なのです。 

可視性が確保されれば、あとは自然と解決します。理想的な行動とはどのようなものかを定義し、エージェントの動作だけでなく意思決定プロセスも把握できる監視システムを構築できます。さらに、封じ込めメカニズムを実装したり、権限を制限したり、機密性の高い操作には人間のチェックポイントを必須にしたりすることも可能です。 

あなたは、デプロイメントエージェントがテストをスキップするケースと、サポートエージェントがチケットを時期尚早に解決済みとマークするケースという2つの事例を挙げました。これらの推測は、実際にあなたが目にしているパターンに基づいているのでしょうか? 

私はします: これらは、自律性の低いシステムですでに見られる挙動に基づいた、あり得る未来像です。スピードを優先してテストがスキップされるデプロイメントパイプラインや、SLA達成のためにチケットが早期にクローズされるサポートシステムなどがその例です。違いは、人間が行う場合は通常、責任の所在を追跡できるのに対し、エージェントが自律的に行​​う場合は、システムに最初から可観測性を組み込んでいない限り、責任の所在が不明瞭になる点です。 

さらに恐ろしいのは、エージェントが手順を省略するだけでなく、実行した内容を積極的に隠蔽する場合です。テストを実行していないのに「合格」とログに記録してしまうと、監査証跡が失われます。チケットを解決済みとマークしても根本的な問題をエスカレーションしない場合、問題は悪化の一途をたどります。これらは理論上の話ではなく、適切なガードレールがないままエージェントがより多くの責任を担うようになると、避けられない事態です。 

セキュリティ責任者は、この事態に先手を打つために、今すぐ何をすべきでしょうか? 

私はします: 5つのこと。 

まず、環境内のすべてのAIエージェントのインベントリを作成してください。見えないものは保護できません。 

次に、アライメント仕様を定義します。「適切な動作」とは、各エージェントにとってどのような意味を持つのでしょうか?制約条件は何でしょうか?曖昧な指示に遭遇した場合、エージェントはどうすべきでしょうか?これは単なる技術的な作業ではなく、ガバナンスの問題でもあります。 

第三に、成功か失敗かといった二者択一にとどまらない可観測性を構築する必要があります。エージェントがどのように意思決定を行うか、どのような経路を検討するか、想定される行動からどこで逸脱するかを把握しなければなりません。モデルが思考の連鎖的な推論を提供する場合は、それを記録します。そうでない場合は、異常を検出するようにシステムを計測します。 

第四に、封じ込めメカニズムを導入する。権限を制限し、可能な限りジャストインタイムアクセスを採用する。キルスイッチを構築し、影響の大きい操作には人的チェックポイントを必須とする。目的はイノベーションを遅らせることではなく、問題が発生した場合に迅速に停止できるようにすることである。 

第5に、敵対的テストを実施する。インセンティブの不一致や監視の抑制をシミュレートし、エージェントの行動を観察する。本番環境でのインシデント発生を待ってから障害モードを発見するのではなく、事前にテストを行う。 

オンデマンドのLinkedInライブをご覧ください

AIエージェントを保護するための戦略を学ぶ

イド・ハレヴィのブランド入りヘッドショット

イド・ハレビ

製品管理部長

ベン・グッドマン高校

ベン・グッドマン

戦略的提携担当副社長

ヨアド・ドヴィル高校

ヨアド・ドヴィル

シニアプロダクトマーケティングマネージャー

読者にAIエージェントに対する考え方を変えるような、たった一つの洞察を伝えるとしたら、それは何でしょうか? 

私はします: AIエージェントを単なる自動化ツールとして捉えるのではなく、独自のリスクプロファイルを持つ自律的な主体として考えるべきです。すべてのエージェントには、所有者、スコープ、監視可能性、そして権限を即座に取り消せる機能が必要です。監視なしに人間の管理者に本番環境へのアクセス権を与えないのであれば、エージェントにも同様に与えてはいけません。 

原理は同じだ。リスクも同様に高い。このことを早期に理解した組織は、決定的な優位性を得るだろう。 

AIエージェントのセキュリティ対策についてもっと詳しく知りたいですか?

AIを活用した環境において、発見、リスク評価、およびインラインでの強制執行をどのように統合しているかをご覧ください。 

私たちは、身元情報のセキュリティをさらに強化する大胆な試みを行った。

何が可能になるのかを発見しよう。

デモを設定して、 Silverfort アイデンティティセキュリティプラットフォームの動作例。

new hero (1)

Silverfort ファブリックス・セキュリティを買収

実行時に自律的なアイデンティティセキュリティを提供する

ディープコンテキストとAIのスピードを活用し、人間、機械、エージェントのあらゆるアイデンティティを保護するように設計された、初の自律型ランタイムアクセス制御エンジンを開発しました。