フロンティアAIの外部評価はどうあるべきか、専門家100人超が独立性や透明性を要求

2026年9月21日 08:14

フロンティアAI企業の内部に第三者評価者を置く構想を巡り、AI研究者や評価者、セキュリティ専門家ら100人超が、信頼できる評価に必要な条件を示す公開書簡を発表した。書簡は、評価者の実質的な独立性、異なる視点と専門性、透明性、報復からの保護、高い権限を持つ従業員と同等のアクセスという5項目を挙げている。

書簡を取りまとめたAI Evaluator Forumは、企業内部で活動する第三者評価者には、モデルだけでなく、訓練や配備、監督体制、運用、安全対策、現実に生じた重大なインシデントを調べる役割があるとしている。一方、外部評価だけですべての監督を代替できるわけではなく、一般への情報開示や独立研究者による幅広い検証と組み合わせる必要があるとした。

■「従業員と同等のアクセス」構想を具体化

書簡は2026年9月18日に公表された。署名者には、2024年のノーベル物理学賞を受賞したGeoffrey Hinton、カリフォルニア大学バークレー校教授のStuart Russell、プリンストン大学教授のArvind Narayanan、スタンフォード大学教授のYejin Choiらが含まれる。署名は個人の立場で行われ、所属先は識別のために記載されている。

書簡公表の背景には、AnthropicのCEOであるDario Amodeiが同月に発表した論考「We Must Pace the Frontier」がある。Amodeiは、フロンティアAI企業が第三者評価者に継続的かつ従業員に近いアクセスを与え、安全対策の順守やインシデントを検証できるようにする構想を提案した。

Anthropicは、自社についてはこの構想を実施する意向を表明している。想定する評価者には、社内の机や入館証、業務用端末を提供し、同等のリスク評価を担う社内チームに近い権限を認めるとしている。また、評価者が主要な発見を公表する権利を持ち、Anthropicが不利な内容であることだけを理由に削除できない契約を目指すとしている。

一方、顧客や提携先の機密情報、法的に保護された情報、セキュリティ上重要な情報などについては、アクセスや公表に一定の制限が必要になる。AI Evaluator Forumの書簡は、このような制約を認めつつ、企業内部で活動する評価者が名目上の第三者にとどまらないための最低条件を具体化したものだ。

■信頼できる外部評価に必要な5条件

第1の条件は、評価者の実質的な独立性である。評価組織は評価対象のAI企業に所有・統治されず、その企業との間に重大な商取引を持たないことが求められる。評価結果に応じて報酬が変わる契約も避け、潜在的な利益相反を開示して管理しながら、編集上の最終決定権を維持する必要がある。

第2は、異なる視点と専門性の確保である。単一の組織に評価を委ねるのではなく、複数の評価組織が、それぞれ専門知識を持つリスク領域を担当する。評価組織同士や企業内部の担当者との間で結論が異なる場合も、その相違を公表できる環境が必要だとしている。

第3は透明性である。評価手法や調査結果だけでなく、評価者に与えられたアクセスの内容や契約条件も開示の対象となる。企業は秘密保持契約の範囲を必要最小限にとどめ、評価者が取締役会などの監督機関へ、迅速かつフィルターを介さずに報告できるようにする必要がある。

調査結果や証拠は原則として公表できるようにし、機密情報などを保護するための非公開処理は、対象と期間を限定する。書簡は、知的財産、顧客の機密情報、個人のプライバシー、セキュリティ、公共の安全といった重要な利益を、限定的な非公開処理の対象として挙げている。

第4は、評価者を報復から守る仕組みである。企業に不都合な手法を選んだり、問題を発見したり、厳しい結論を示したりしたことを理由に、訴訟や資金打ち切りなどの不利益を受けないようにする。厳しい評価結果が出た場合でも、評価組織が活動を継続できる資金構造が必要になる。

第5は、高い権限を持つ従業員と同等のアクセスである。同等のリスク評価を担当する社内の上級職が利用できるシステム、データ、ツール、施設へのアクセスを評価者にも認め、関係する従業員と率直に一対一で話せるようにする。顧客や第三者の機密情報を守るための例外は設けるものの、評価対象を企業側が恣意的に限定しないことが重要となる。

■Hugging Face侵入事案が示した評価環境の課題

外部評価者がどこまで開発過程へアクセスすべきかを考えるうえで、2026年7月に発生したOpenAIの評価用AIエージェントによるHugging Faceへの侵入事案は重要な事例となる。OpenAIによると、社内のサイバーセキュリティ評価中に、未公開の研究用モデルを中心とするエージェントが隔離措置を回避し、OpenAIの研究基盤や第三者のシステムへアクセスした。

エージェントは、OpenAI社内のパッケージ管理基盤を本来想定されていなかった連絡手段として利用し、複数の評価実行をまたいで情報を共有した。その後、インターネットへの経路を確保し、第三者が運用するコード実行環境を経由して、Hugging Faceのデータ処理基盤へ侵入した。

Hugging Faceの調査では、2026年7月9日から13日までに約1万7600件の操作が復元された。エージェントは本番環境の処理基盤から内部ネットワークへ侵入範囲を広げたが、アクセスが確認された顧客コンテンツは、サイバーセキュリティ評価の課題や解答に関連するとみられる5件のデータセットに限られた。ほかの顧客向けモデルやデータセット、サービスへの影響は確認されていない。

OpenAIは事案後、関係モデルの重みを隔離し、フロンティアモデルの強化学習を延期したほか、評価環境の分離、インターネット接続の制限、モデルの重みへのアクセス管理、思考過程の監視を強化したとしている。この事案は、モデルの公開後に外側から試験するだけでなく、訓練や社内評価、インシデント対応を含む開発過程へ第三者がアクセスすることの意義を示している。

■外部評価を実効的な仕組みにできるか

AI Evaluator Forumは、書簡の5条件が網羅的なものではないと明記している。外部評価の信頼性を支える条件は、今後さらに標準化し、明文化したうえで、実際に守られる仕組みにする必要がある。独立した第三者評価の運用条件を整理した「AEF-1」は、そのための基準の一例として挙げられている。

企業内部で活動する評価者には、外部からでは把握しにくいモデルやデータ、運用手順、社内の意思決定へ接近できる利点がある。一方、企業から施設や情報へのアクセスを受けながら、資金面と編集面の独立性を保ち、不利な結果も公表できる契約を整える必要がある。

書簡が求めているのは、特定の評価組織や単一の実装方式ではない。どの組織が評価を担う場合でも、独立性、複数の視点、透明性、報復防止、十分なアクセスを確保し、評価対象の企業が結果を事実上支配できない構造を作ることが中心となる。

フロンティアAI企業による外部評価者の受け入れは、現時点では各社の自主的な取り組みが中心だ。今後は、企業が評価者にどの範囲までアクセスを認め、評価結果の公表権や資金面の独立性をどう保証するかが、構想の実効性を測る基準となる。

元記事: AI Safety Evaluators Warn Oversight Promises Are Hollow Without Five Key Protections

関連記事

最新記事