金融AIの実務性能に限界、投資タスク評価でClaude Fable 5も適合率49.2%

2026年7月30日 17:33

投資プロフェッショナル向けAIを開発する米Samaya AIは、投資業務のワークフローを評価するオープンベンチマーク「FrontierFinance」を公開した。評価の結果、Anthropicの「Claude Fable 5」など最新のフロンティアモデルでも、評価基準への適合率は50%未満にとどまった。金融機関がAIを導入する際、現時点では人間の検証を伴わずに投資調査業務を自律的に遂行させることにはリスクがあり、引き続き専門家による確認が不可欠となる。

■投資タスクにおけるAIの現在地

投資プロフェッショナルはこの2年間、AIが実際の調査ワークフローを処理できる段階に達しているかを問い続けてきた。今回、その問いを検証するために設計され、実務家による検証を経た初のオープンベンチマークが、「まだその段階にはなく、そこからも程遠い」という最初の答えを示した。

カリフォルニア州マウンテンビューに拠点を置き、投資プロフェッショナル向けAIに特化するスタートアップのSamaya AIは、投資ワークフロー全体におけるAIエージェントの性能を測定するオープンベンチマーク「FrontierFinance」の評価結果を公開した。評価対象となったフロンティアモデルのうち、最も高い成績を収めたAnthropicの「Claude Fable 5」でも、ルーブリック適合率は49.2%にとどまった。OpenAIの「GPT-5.6 Sol」が46.8%、「Claude Opus 4.8」が45%で続いた。Googleの「Gemini 3.1 Pro」も評価に参加したが、いずれのモデルも50%を下回った。

ここでいう「ルーブリック」とは、回答に含めるべき情報や満たすべき条件を細分化した評価項目を指す。「ルーブリック適合率」は、AIの回答がそれらの評価項目をどれだけ満たしたかを示す割合であり、タスクそのものの正答率や完了率を意味するものではない。

Samaya独自のプロプライエタリなエージェントシステムは、まさにこうしたタスクのために設計されており、50%を上回った。ただし、その差はわずかで、「低エフォート」構成ではFable 5の約4分の1の推論コストで50.8%、「高エフォート」モードでは約半分のコストで56%の適合率だった。

■FrontierFinanceが実際に測定するもの、そして従来の金融ベンチマークが不十分だった理由

このベンチマークの設計思想は、既存の金融AI評価がなぜ実態を正しく表しにくいのかという分析から始まっている。従来のベンチマークは、提出書類から数値を抽出したり、貸借対照表の項目に関する事実確認の質問に答えたりする金融データ抽出に、ほぼ専念していた。これらも現実に存在するタスクだが対象範囲は狭く、大規模なテキストコーパスで訓練されたモデルであれば、ある程度は処理できる。

FrontierFinanceは、そうしたデータ抽出の前後に位置するタスクまで対象としている。複数の情報源からセクター全体の状況をまとめる、投資アイデアの候補群から機会をスクリーニングする、決算説明のコメントを通じて財務制限条項(コベナンツ)を追跡する、マクロ経済上のカタリストが発生した際にモデルを更新するといった作業だ。これらは資本配分の意思決定を左右するタスクであり、その判断を支える単なる情報検索とは異なる。

このベンチマークは、「スクリーニングと発見」「企業調査」「セクターおよびマクロ分析」「決算とイベント」「カバレッジとカタリストの監視」「財務データとモデリング」という6つのユースケースにまたがる、220件の自由回答形式のクエリで構成される。各クエリには、完全な回答が満たすべき原子的かつ検証可能な基準として、専門家が作成した合計1万1,543項目のルーブリックが紐付けられている。ルーブリック項目は、「必須項目(許容可能な回答に必要)」または「情報項目(回答を充実させるが必須ではない)」に分類される。スコアには、各基準を満たした割合であるルーブリック適合率を使用し、クエリごとに算出した結果をマクロ平均する。各ルーブリックの判定は、独立した3つの審査モデルによる多数決で決まる。

この評価設計は、Samayaの金融専門家が、投資プロフェッショナル向けの本番AIシステムを複数年にわたって構築する中で蓄積した、約5,000件の複雑な事例からなる大規模な社内アノテーションデータを基に構築した。完全なデータセットと評価コードは、それぞれHugging FaceとGitHubで公開されており、第三者による独立した再現が可能となっている。

■3つの異なるハーネスが示すコストと品質のトレードオフ

今回の発表における技術的に重要な発見の1つは、単なるスコアの違いだけではなく、同じモデルでも、接続されるツールや実行基盤である「ハーネス」によって性能が大きく変わることだ。Samayaは、3つの異なるハーネスアーキテクチャでモデルを評価した。

「ウェブ検索ハーネス」は、各フロンティアモデルを組み込みのウェブ検索APIと組み合わせたもので、企業の多くが調査タスクに汎用AIを導入する際に用いている方法だ。独立系評価企業Vals AIが開発し、GitHubでオープンソース化している「Finance Agent v2ハーネス」は、モデルをSECのEDGAR API、市場価格データAPI、ウェブ検索、HTML解析、長文文書内のコンテンツ検索、計算機という6つの金融関連ツールに接続する。Samayaの社内ハーネスは、同社独自のカスタムモデル、プロプライエタリなデータインデックス、投資関連コンテンツに最適化した検索エンジンを追加している。

データは、ハーネスがベースモデルと同じくらい重要であることを示している。同じモデルを使った場合、Finance Agent v2ハーネスはウェブ検索だけを使う構成よりも一貫して高い成績を収めた。ハーネスとモデルの組み合わせでは、品質とコストの間に大きなトレードオフがあり、ルーブリック適合率を実質的に向上させるには、クエリ当たりの推論コストが急増した。ただしSamayaによれば、同社のシステムは、同一の技術構成で小規模な汎用モデルを使用するのではなく、カスタムモデルのアーキテクチャとドメイン特化型の検索によって、このトレードオフを打破しているという。

評価対象となったオープンソースモデルおよび低コストモデルのうち、「DeepSeek V4 Pro」はFinance Agent v2ハーネス上で40.5%を記録し、クエリ当たりの推論コストはFable 5の約26%だった。プロプライエタリなハーネスを持たないモデルの中では、コストと品質のバランスが最も良かった。これは、データ所在地や機密保持に関する要件により、調査ワークフローを第三者のAPIへ送信できない機関にとって重要な結果である。

ベンチマークの情報源は、投資プロフェッショナルが実際に扱う情報の分布を反映している。SECへの提出書類がルーブリックの根拠の約39%を占め、残りは決算説明会のトランスクリプト、投資家向けプレゼンテーション、専門知識、市場データで構成される。この構成比は、評価対象となる6つのユースケースによって大きく異なる。

■50%未満という上限が投資ワークフローにとって実際に意味すること

2022年にGoogle Brain、Meta、Amazonの研究者らと共にSamaya AIを設立したCEO兼創業者のMaithra Raghu氏は、「投資のユースケースはAIにとって特有の難しさがあります。ほぼ正しいだけでも、損失につながるからです」と述べた。「専門家レベルの回答を生成するには、もっともらしく見える出力だけではなく、長く複雑なワークフロー全体にわたり、すべてのデータポイントとすべての推論ステップが正確でなければなりません」

この説明は、ベンチマークが定量化した構造的問題を捉えている。複数の同業他社を対象とした相対価値モデルの構築、ポートフォリオに照らしたセクターカタリストの分析、決算資料の脚注に埋もれた財務制限条項に関係する表現の検出など、複数段階からなる投資ワークフローでは、推論過程のどこかで発生したエラーが、その後のすべての結論を無効にする可能性がある。ルーブリックの49%を満たすモデルが、「半分は役に立つ」出力を提供しているとは限らない。重要性の高いタスクの多くでは、エラーを発見するために人間が全体を検証する必要があり、生産性向上の大部分が相殺される。

ここでは、この結果を取り巻く状況も重要だ。金融AIのハルシネーションは、もはや理論上のリスクではない。FINRA(米金融取引業規制機構)の2026年次監督報告書は、AIのハルシネーションを金融機関が管理すべきコンプライアンスリスクとして明示した。また、高リスクの金融AIシステムに人間による監視と正確性の保証を求めるEU AI法の要件も、間もなく適用される。このような環境において、具体的な精度上限を示すドメイン特化型ベンチマークは、公開リーダーボードでは得られなかった指標、すなわちアナリストが実際に行うタスクと結びついたスコアを調達担当者に提供する。

■FrontierFinanceの信頼性をめぐる問題と、それでも重要である理由

Samaya AIがこのベンチマークを構築し、Samaya AIのシステムが最高得点を記録した。この利益相反は現実に存在し、FrontierFinanceを参照基準として採用するかどうかを検討する組織は、この点を慎重に考慮すべきである。

AIにおけるベンチマークのゲーム化、すなわちスコアを意図的に高める問題は、広く知られている。2026年1月、MetaのCEOはFinancial Timesに対し、Chatbot Arenaに提出されたLlama 4が「ごまかされた」ものであり、現実世界での性能ではなく、ブラインド形式の比較投票に最適化された専用バリアントだったことを認めた。OpenAIは、問題への独占的な早期アクセスを維持しながら、FrontierMathベンチマークへ秘密裏に資金を提供していた。この現象は研究コミュニティで「ベンチマキシング(benchmaxxing)」と呼ばれる。スコアが実際の能力を反映しているかどうかにかかわらず、報道、資金調達、企業の調達判断を左右するリーダーボード上の順位に最適化する行為を指す。

Samayaは、自己評価に伴う問題へ構造的に対処しようとしている。220件のクエリと1万1,543項目のルーブリックを含む完全なデータセットを公開し、評価コードもGitHubでオープンソース化した。どの機関でも、標準化されたハーネスを使用し、同じルーブリックに対してフロンティアモデルを独立して評価できる。これは意味のある設計上の選択であり、プロプライエタリなベンチマークの多くは、データセットと評価コードのいずれも提供していない。

今回の結果を信頼できるか判断するうえで、より重要なのは次の点だ。Samaya自身のスコアである低エフォートモードの50.8%と高エフォートモードの56%は、独立して検証された性能ではなく、自社システムに関する企業側の主張として受け止めなければならない。一方、フロンティアモデルのスコアは性質が異なる。Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Proはいずれも45%から49.2%の範囲に収まった。これらは、Samaya独自のシステムだけを同社の非公開ルーブリックで評価し、同社独自の審査手法で採点した結果ではない。外部のフロンティアモデルを、固定され一般公開されたルーブリックセットに基づいて評価した結果である。したがって、フロンティアモデルの性能上限という発見は、ベンチマークの作成者が誰であるかという問題から、比較的独立して成立する。

この発見には、別の評価による裏付けもある。独自のルーブリック手法を採用する別の評価企業が開発したVals AIの「Finance Agent v2」ベンチマークでは、2026年を通じ、現実的な投資タスクにおけるフロンティアモデルの成績が40%台後半から50%台前半に集中している。独立して設計された2つのベンチマークが近い結果を示していることから、50%前後という性能上限はSamayaの宣伝上の主張というより、プロフェッショナル水準の投資調査に対するフロンティアAIの現在地を示す構造的な観察とみることができる。

■難易度はどのように測定されるか、そしてその手法が金融タスクについて明らかにするもの

FrontierFinanceの難易度測定には、トーナメントのランキングで用いられる統計的手法であるブラッドリー・テリー・モデルが使われている。このモデルは1952年に一対比較データのために開発され、現在ではChatbot ArenaのEloシステムの基礎構造を含むAI評価でも広く使用されている。ベンチマークの難易度スコアは、AIエージェントにFrontierFinanceのクエリと従来の金融ベンチマークのクエリを一対比較させ、完全かつ正確に回答するのが難しいのはどちらかを判定させることで算出した。その後、一対比較による判定にブラッドリー・テリー係数を当てはめ、クエリ全体の相対的な難易度ランキングを作成した。

その結果、FrontierFinanceは、既存の公開金融ベンチマークよりも広い難易度範囲をカバーし、平均難易度も高いことが示された。ユースケース別の内訳からは、特に大きな能力差が存在する領域も明らかになった。「スクリーニングと発見」および「セクター、業界、マクロ分析」は、評価対象となったすべてのシステムで最も難しいユースケースであり、最高性能のモデルにも大きな改善余地があった。一方、「フォーマットとプレゼンテーション」のルーブリックでは各システムの成績が最も高かった。これは、現在のAIが最も確実に処理できるのは回答の見せ方であり、分析の深さではないことを示唆する。

方法論上、注意すべき点もある。難易度のスコアリング自体が、一対比較を行うAI審査モデルに依存していることだ。この審査モデルは、金融の質問を分析的に難しくする要素について、独自の体系的なバイアスを持っている可能性がある。そのため、実務家にとって最も重要なタスクではなく、審査モデルがたまたま判断しにくいタスクの難易度が高く評価される可能性がある。Samayaのチームは、金融専門家によるクエリの作成、専門家によるルーブリックの作成、専門家によるレビューと整理、タクソノミーに基づく再調整という、4段階の専門家主導型データ収集プロセスを開示している。しかし、難易度スコア自体はAIによる判定に基づいており、これは独立した研究者がベンチマークを評価する際に検証すべき限界である。

■これはAIがアナリストを代替できないことを意味するのか?

必ずしもそうではない。このベンチマークは、アナリストが行うあらゆるタスクを均等にテストするのではなく、投資ワークフローの中でも特に難しい領域を評価するよう意図的に設計されている。要約、情報抽出、一次スクリーニング、構造化された決算データの統合では、AIは大幅に高い性能を発揮する。Samayaや競合企業のプラットフォームを利用するヘッジファンドや資産運用会社では、こうした用途ですでに生産性を向上させている。

今回の結果が明確に示しているのは、出力段階で人間が検証することなく、AIにエンドツーエンドの投資調査ワークフローを自律的に処理させられるという主張を、現在利用可能な最も高性能なフロンティアモデルのいずれについても、実証結果がまだ裏付けていないことだ。Samayaは、NVIDIA、NEA、Databricks、Eric Schmidt氏、Yann LeCun氏などの投資家から支援を受けており、同社によれば、そのプラットフォームは世界各地のヘッジファンド、資産運用会社、銀行で数万人の投資プロフェッショナルに利用されている。この事業規模を踏まえると、ベンチマークの公開は単なるマーケティング活動にとどまらない。プロフェッショナルのワークフローに深く組み込まれたプラットフォームには、適切な水準で精度要件を定義する現実的な動機がある。

同社は、モデルの能力が向上し、コミュニティからのフィードバックを通じて評価手法が成熟するのに合わせ、今後さらに難しいFrontierFinanceを公開する予定だとしている。完全なベンチマークデータセット、ルーブリック、評価コードは、Samaya Researchのサイトで公開されている。

■注目ポイントQ&A

●FrontierFinanceベンチマークとは何ですか?誰が構築しましたか?

FrontierFinanceは、AIエージェントシステムが実際の投資調査タスクをどの程度処理できるかを測定するオープンベンチマークです。単なるデータ抽出問題ではなく、アイデアのスクリーニング、企業調査、セクターおよびマクロ分析、決算の監視、カタリストの追跡など、アナリスト業務の一連の流れを対象としています。投資プロフェッショナル向けAIを専門とするマウンテンビューのスタートアップ、Samaya AIが構築しました。本番システムの開発を通じて複数年にわたり蓄積した約5,000件の社内事例を基に、専門家が作成した220件のクエリと1万1,543項目のルーブリックを使用しています。完全なデータセットと評価コードは、Hugging FaceとGitHubで公開されています。

●2026年現在、最高性能のAIモデルは金融アナリストのタスクでどの程度の成績ですか?

FrontierFinanceでは、最も成績の高かったフロンティアモデルであるAnthropicの「Claude Fable 5」のルーブリック適合率が49.2%でした。「GPT-5.6 Sol」は46.8%、「Claude Opus 4.8」は45%で、評価対象となったすべてのフロンティアモデルが50%未満でした。別の手法を用いる独立したVals AIの「Finance Agent v2」ベンチマークでも同様の結果が報告されており、現実的な投資分析タスクにおけるフロンティアモデルの成績は、40%台後半から50%台前半に集中しています。独立して設計された2つの評価で近い結果が得られていることは、50%前後という性能上限が単一の評価手法だけによるものではなく、実際の構造的な能力差を反映している可能性を示しています。

●Samaya AI自身のベンチマークにおける自社スコアは信頼できますか?

慎重に受け止める必要があります。SamayaはFrontierFinanceを構築し、自社システムが50.8%(低エフォート)および56%(高エフォート)を記録したと報告していますが、これらの結果は独立して検証されていません。ベンチマークの作成者自身が最高得点を報告しているという利益相反は、現実の限界です。2025年と2026年には、複数の著名なAIシステムでベンチマーク評価に合わせたスコア操作が発覚しており、作成者が所有するベンチマークでの自己申告スコアには、広く認識された信頼性上の問題があります。今回の発表で比較的独立性が高いのは、固定され一般公開されたルーブリックセットに対して外部のフロンティアモデルを実行して得られたスコアです。評価を実行する時間と計算資源を持つ組織であれば、これらのスコアを独立して検証できます。

●これらの結果に基づいて、投資会社はどのような対応を取るべきですか?

エラーが重大な財務上またはコンプライアンス上の結果につながる投資調査ワークフローでは、現在のフロンティアAIモデルを、人間による検証なしに自律運用すべきではありません。このベンチマークでは、最も高性能な汎用モデルでも、実際のアナリスト業務を反映した評価基準の約半分を満たせませんでした。一方、AIは、情報抽出、要約、一次スクリーニング、書式調整など、明確に定義され、人間がレビューするサブタスクの生産性を高める手段として価値があります。しかし今回の結果は、出力段階で人間が検証することなく、エンドツーエンドの調査判断をAIに委ねることを支持していません。調達に際しては、一般的なリーダーボードのスコアではなく、自社の実際のワークフローを代表するタスクで実施したドメイン特化型ベンチマークの結果を求めるべきです。FINRAの2026年次監督報告書は、AIのハルシネーションリスクを理論上の懸念ではなく、管理すべきコンプライアンス上のリスクとして扱っています。

元記事: Finance AI Ceiling: Claude Fable 5 Tops Frontier Models at Just 49% on Investment Tasks

関連記事

最新記事