NAVER Labs Europe、ViT本体を再学習しないロボットナビゲーションなど10論文をECCV 2026で発表

2026年8月11日 17:26

韓国のインターネット大手NAVERのAI・ロボティクス研究部門であるNAVER Labs Europeは、2026年9月に開催されるコンピュータビジョンの国際会議「ECCV 2026」で10本の査読付き論文を発表する。3Dシーン再構築や人間理解など多岐にわたる研究が含まれるが、中でも事前学習済みの視覚モデル本体を再学習せずにロボットナビゲーションへ応用する手法は、AIロボット導入のコスト構造を大きく変える可能性がある。

■人間の環境で稼働するロボットのための視覚基盤

フランスのグルノーブルを拠点とする韓国インターネット大手NAVERのAI・ロボティクス研究部門、NAVER Labs Europeは、スウェーデンのマルメで9月8日から12日にかけて開催される欧州コンピュータビジョン会議(ECCV 2026)で、10本の査読付き論文を発表する。同ラボの公式発表によると、論文のテーマは3Dシーンの再構築と生成、ロボットナビゲーション、一人称視点(エゴセントリック)ビデオの理解、モデルの蒸留とマージ、3Dでの人間理解、プライバシーを保護する視覚ローカリゼーションなど多岐にわたる。しかし、これらを貫く研究ミッションはただ一つ、「人間の環境で確実に動作するロボットのための、知覚とナビゲーションの基盤を構築すること」である。

実用面で最も重要な貢献とみられるのは、AI搭載ロボットの展開には大規模な視覚モデルの高コストなファインチューニング(微調整)が必要であるという一般的な前提を覆すナビゲーションの研究結果だ。Steeven Janny、Leonid Antsfeld、Christian Wolfの各氏による論文は、凍結された、つまり重みを更新しない事前学習済みのVision Transformer(ViT)から、画像パッチごとに単一のスカラー値を抽出するだけで、物理ロボットを現実環境で高速にナビゲートするのに十分であることを実証している。ViT本体は再学習されず、最小限の後段レイヤーのみが学習される。これはエンボディドAI(身体性を持つAI)の経済性における意味のある構造的変化であり、高品質なロボットビジョンを導入するための障壁が、最先端級の計算資源を必要とするという一般的な認識よりも低い可能性を示唆している。

ECCVは、欧州コンピュータビジョン協会が運営する、2年に1度開催される欧州最高峰のコンピュータビジョン会議であり、今回で19回目を迎える。ECCV 2026の統計によると、約10,473本の論文が投稿され、約2,883本が採択された。推定採択率は27.5%である。同会議は、CVPRやICCVと並び、コンピュータビジョン分野で世界トップ3の会議の一つとして常に評価されている。ミラノで開催されたECCV 2024には64カ国から約6,700人が参加しており、2026年のマルメ大会でも同規模の国際的な参加が見込まれている。

■エンボディド・インテリジェンスのための研究所

NAVER Labs Europeのルーツは、NAVERが2017年に買収し、欧州のAI・ロボティクス研究部門として再編したXerox Research Centre Europe(XRCE)にある。同ラボの研究は、テキストや画像だけを個別に扱うのではなく、現実世界の3D環境を知覚し、推論し、その中を移動するAIシステムである「エンボディド・インテリジェンス(身体知能)」を中心としている。

同ラボの過去の研究には、カメラのキャリブレーションなしで深度推定、カメラ姿勢の復元、3D再構築などのタスクを単一のモデルに統合した、Transformerベースの3D基盤モデル群であるDUSt3R(CVPR 2024で発表)やMASt3R(ECCV 2024で発表)がある。これらのモデルはコンピュータビジョンの研究コミュニティで広く注目を集め、派生技術や応用を生み出した。ECCV 2026の論文群は、その研究課題を継続するとともに、多様な方向へ発展させるものである。

この研究には、成果を商用化へつなげる直接的な経路もある。NAVERの親会社は、韓国の城南市に、世界初のロボット向けに設計された高層ビルとされる「1784」を運営している。そこでは約110台の自律型配送ロボット「Rookie」が、ARC(AI、Robot、Cloud)システムを利用し、5Gで接続されたフロアを移動している。2026年7月、NAVERは日本の東京ミッドタウン八重洲にRookieロボットとマルチロボット制御システム「ARC Brain」を導入した。1784で開発された技術が海外顧客向けに商用展開されたのは、これが初めてである。ViTナビゲーションの研究やMulti-HMR 2を含むECCV 2026の論文のいくつかは、こうした実運用システムが必要とする能力を直接扱っている。

■3D再構築:BLASt3Rと自己回帰の最前線

ECCV 2026での発表のうち最大のグループは、3Dシーンの理解と生成に関するものだ。

Vincent Leroy、Philippe Weinzaepfel、Lojze Zust、Yohann Cabon、Jerome Revaudの各氏による「BLASt3R(マルチビューマッチングと単眼事前知識を用いた任意の画像セットのバンドル調整)」は、カメラがキャリブレーションされておらず、撮影条件も制御されていない場合に、任意の画像セットを一貫した3Dモデルへ確実に位置合わせするという、3Dビジョンにおける長年の課題に取り組んでいる。従来のStructure from Motion(SfM)パイプラインは、明示的な特徴マッチング(通常はSIFTキーポイント)、幾何学的検証、反復的なバンドル調整を必要とし、キャリブレーションの品質や視点の変化に左右されやすい。BLASt3Rは、Transformerが学習したマルチビューマッチングの手がかりと、マルチビュー情報が曖昧な場合に単一視点から深度を推論するための単眼幾何事前知識を組み合わせることで、こうした制約を回避する。この研究は、DUSt3R/MASt3Rに連なる3D基盤モデルを、制約のない画像集合に対応する統合バンドル調整手法へと拡張するものである。

2つ目の主要な3D関連研究は、生成アプローチを採用している。Thomas Lucas、Maxime Pietrantoni、Wonjune Cho、Bardienus Pieter Duisterhof、Philippe Weinzaepfel、Vincent Leroy、Jerome Revaudの各氏による「マルチビューデータからの自己回帰的3Dシーン生成」は、マルチビュー観測を条件として、3Dシーンをトークン単位で生成するモデルを学習する。この論文は3D生成を、自然言語処理を変革したLLM(大規模言語モデル)型の自己回帰生成に対応するアプローチとして位置付けており、ロボティクスのシミュレーション環境、AR/VRコンテンツ制作、合成学習データの生成に直接的な意味を持つ。画像から受動的にシーンを再構築するのではなく、3D生成を能動的かつ逐次的な予測タスクとして扱う点が特徴だ。

3D研究群を締めくくるのは、Zeren Jiang氏とオックスフォード大学の共同研究者による「Syn4D」であり、大規模なマルチビュー合成4Dデータセットを提供する。空間構造と時間的変化の両方を捉える4次元データセットは、現実世界から収集することが非常に難しく、コストもかかる。大規模な合成データという代替手段は、現在データ不足がボトルネックとなっている次世代の動的シーン理解モデルを発展させる可能性がある。

■パッチごとの単一スカラーがロボットナビゲーションの経済性を変える理由

NAVER Labs Europeの発表の中で技術的に最も注目すべき論文は、事前学習済みの凍結されたVision Transformerの各画像パッチから単一のスカラー値を抽出し、それを使って物理ロボットのナビゲーションポリシーを学習するというものだ。

Steeven Janny、Leonid Antsfeld、Christian Wolfの各氏による論文「事前学習済みViTからのパッチごとのスカラーが現実世界での高速移動ナビゲーションを可能にする」は、コンピュータビジョン分野で蓄積されてきた一つの知見に基づいている。大規模に事前学習されたVision Transformerは、各パッチの特徴量に豊かな空間的・意味的表現を埋め込んでおり、その情報が非常に高密度であるため、最小限の射影だけでも下流タスクに利用できるというものだ。論文では、これを現実世界のロボットナビゲーションで実証している。「Pure Attention Projection」により、凍結したViTのパッチ特徴量から解釈可能なアフォーダンスマップを抽出し、そのマップを入力としてロボットのナビゲーションポリシーを強化学習で訓練する。これにより、システムは現実の物理環境を高速に移動できる。

導入の観点から見たこの論文の決定的な特徴は、ViTエンコーダーが終始凍結され、重みを更新しないというアーキテクチャ上の制約だ。新しい環境やタスクごとに大規模なVision Transformerをファインチューニングするには、多大な計算資源とエンジニアリング時間が必要となる。この要件自体を回避し、凍結した特徴量と軽量な学習対象ヘッドを組み合わせる方式は、最先端のAI研究所が保有するような規模の資源を投入しなくても、汎用的な視覚基盤モデル上に高品質なエンボディドAIナビゲーションを構築できる可能性を示唆している。論文著者の1人であるChristian Wolf氏は、2026年7月のInternational Computer Vision Summer Schoolで「空間AI:エンドツーエンドで学習されたロボットナビゲーションにおける知覚、記憶、行動」と題した基調講演を行った。これは、同ラボがこの研究方向を分野への中心的な貢献と位置付けていることを示す一つのシグナルである。

■人や物体を追跡する:一人称視点映像と人体理解

論文群のうち2つの領域は、ロボットやAIシステムが、空間を共有する人間や物体をどのように理解するかという課題に取り組んでいる。

Jacob Chalk、Saptarshi Sinha、Dima Damen、Yannis Kalantidis、Diane Larlusの各氏による「Whareformer:長時間の一人称視点映像で、何がどこにあるかを追跡する学習」は、連続する一人称視点カメラ映像で物体を長期的に追跡するという特有の課題に挑む。頭部やロボットに搭載されたカメラからのエゴセントリック(一人称視点)映像では、頻繁なオクルージョン(遮蔽)、急激なカメラの動き、同じ場所を再訪するまでの長い間隔が発生する。そのため、整えられたベンチマーク映像と比べ、時間をまたいで物体の同一性を維持することがはるかに難しい。Whareformerは、この用途に特化したTransformerアーキテクチャを導入し、現実環境で典型的に発生する映像の不連続性を越えて、時間的一貫性を保つことを重視している。

人体理解の領域では、Guénolé Fiche、Philippe Weinzaepfel、Romain Brégier、Fabien Baradelの各氏による「Multi-HMR 2(複数人物のカメラ中心型検出、メッシュ復元、追跡)」が、同ラボの従来のMulti-HMRフレームワークを、統合された1段階のシステムへと発展させている。このシステムはDETRベースの検出器を使い、シーン内にいるすべての人物を検出すると同時に、各人物の3Dボディメッシュを復元する。各メッシュはカメラを基準とした実寸空間に配置されるため、システムは体形だけでなく、カメラに対する各人物の正確な距離と位置も把握できる。さらに、SAM2から画像ベースのメモリ特徴量を蒸留することで追跡にも対応し、静止画像だけで学習されているにもかかわらず、映像のフレーム間で人物の同一性を一貫して対応付ける。従来の人体メッシュ復元手法は、骨盤を中心としたルート相対座標での出力に重点を置いていた。これは身体各部の相対的な位置を示すが、人物が現実空間のどこにいるかは示さない。人を避けて移動したり、特定の人物に物を手渡したりするロボットに実際に必要なのは、カメラを基準とした出力である。

Multi-HMR 2は、同ラボがオープンソースで公開するパラメトリックボディモデル「Anny」を基盤としている。Annyは、乳児から高齢者までの年齢、さまざまな体形や身体比率に汎化するよう設計されており、実際の公共空間で動作するシステムにとって重要な、包摂性を考慮した設計となっている。

■大規模化に対応する効率性:蒸留とモデルマージ

2つの論文は、AIシステムが大規模化するほど切実になる課題、すなわち、新しいタスクのたびにすべてをゼロから再学習することなく、高性能で効率的なモデルを構築するという課題に取り組んでいる。

Feyza Yavuz、Mert Bülent Sarıyıldız、Diane Larlusの各氏による「IDeaL(改良版Dead Leavesによるデータフリーのマルチティーチャー蒸留)」は、プライバシー上の制約、知的財産上の制限、元データセットの規模などを理由に、元の学習データを利用できない状況で、コンパクトな汎用視覚エンコーダーを学習させることを目的としている。このアプローチでは、改良された「Dead Leaves」合成画像生成器を使用する。これは、形状を幾層にも重ねることで自然画像の統計的性質を模した画像を生成する確率モデルである。生成した画像を使い、複数の専門的な教師モデルから同時に学ぶ生徒モデルへの学習信号を作り出す。実際の学習データを必要とせずに、複数教師モデルによる蒸留の品質を維持できれば、データへアクセスできないため従来は適用できなかった環境でも、この手法を利用できるようになる。

Pau de Jorge、César Roberto de Souza、Björn Michele、Mert Bülent Sarıyıldız、Philippe Weinzaepfel、Florent Perronnin、Diane Larlus、Yannis Kalantidisの各氏による「タスクアライメント:多様なビジョンタスクを実用的にモデルマージするためのシンプルな代理指標」は、独立して学習されたモデルを単一のシステムへ統合する取り組みを扱っている。モデルマージに適したハイパーパラメータを見つけるには、多数の候補構成を評価する必要があり、通常は評価のたびにタスク固有のデコーダーを学習しなければならない。出力形式が異なる多様なタスクを対象とする場合、これは高コストとなる。この論文は、デコーダーを学習することなく、どのマージ構成が成功するかを予測するタスクアライメントの代理スコアを提案し、ハイパーパラメータの探索コストを桁単位で削減する。

■3D人体モデリング:Annyの進化

Multi-HMR 2に加え、もう1本の論文が同ラボの3D人体表現に関する研究を深めている。Romain Brégier氏らによる「Anny Bodyのためのヒューマンメッシュモデリング」は、Multi-HMR 2でも使用されるパラメトリックボディモデル「Anny」の技術的基盤を強化するものである。Annyは、プロプライエタリなボディメッシュモデルに代わる無料のオープンソースモデルとして公開され、幅広い年齢層を包含することを明確に意図して設計されている。ECCV 2026の論文は、このフレームワークにおけるモデリング上の選択を、査読付き論文として技術的に説明するものである。

■場所を示すAIマップは本当にプライバシーを守れるのか

一連の論文の最後は、機能面からセキュリティへと視点を移している。Maxime Pietrantoni、Torsten Sattler、Gabriela Csurkaの各氏による「拡散モデルベースの攻撃に対するプライバシー保護視覚ローカリゼーション手法の脆弱性」は、現在オープンソースツールとして広く利用できる拡散モデルを使い、プライバシーに配慮しているはずのマップから、元のシーンの幾何構造を逆算できるかどうかを検証している。

視覚ローカリゼーションとは、既知の3Dマップ内でカメラがどこに位置しているかを特定する処理であり、拡張現実(AR)ナビゲーション、ロボット運用、位置情報サービスの基盤となっている。プライバシー保護型の視覚ローカリゼーションは、現実の画像がマップから再構築され、建物内部や私的空間の監視に使われることを防ぐため、生のシーン幾何情報を難読化された表現に置き換える。この論文が提起する懸念は、インターネット規模の画像分布で学習された拡散モデルが、部分的な幾何学的手がかりから、それらしい視覚コンテンツを推定し、こうした保護を損なうほどの精度を持ち得るということだ。視覚ローカリゼーションが消費者向けARアプリケーションへ広がるにつれ、この研究結果が示すセキュリティ上の影響は、ロボティクス研究所の枠を大きく超える可能性がある。

■論文発表以外のカンファレンス活動

研究者のDiane Larlus氏はECCV 2026で、純粋なデジタル環境ではなく、物理世界と相互作用するAIシステムを研究するための新たな場となる、ECCV初の「Physical AI」ワークショップを共同開催する。また、NAVER Labs Europeの研究者4人、Yohann Cabon、Gabriela Csurka、Florent Perronnin、Mert Bülent Sarıyıldızの各氏が、ECCV 2026プログラム委員会から優秀査読者に選出された。

■ロボティクスにおいてECCV 2026が注目に値する理由

NAVER Labs EuropeがECCV 2026で発表する研究の幅広さは、意図的に設計された研究体系を反映している。同ラボは、3D再構築、生成型シーンモデリング、人体理解、一人称視点での追跡など、複数の方向から知覚技術を同時に構築している。その明確な目標は、最終的に、人と同じ空間で確実に動作できるロボットを実現することだ。

2026年7月下旬に報じられた東京ミッドタウン八重洲での導入は、この研究パイプラインが現実の商用成果にどれほど近いかを示している。NAVERが城南市に構える「1784」は、5,000億ウォン、ドル換算で約3億5,200万ドルを投じたロボット親和型高層ビルである。1ドル=159円で換算すると約560億円となる。そこで開発され、厳しい実環境で検証された技術が、現在は東京の商業ビルで稼働している。ECCV 2026の論文と実運用されるロボットとの隔たりは、10年ではない。製品開発の1サイクルにまで縮まっている。

■注目ポイントQ&A

●ECCV 2026とは何ですか?なぜロボティクスにとって重要なのですか?

ECCV(欧州コンピュータビジョン会議)は、CVPRやICCVと並ぶ、世界有数のコンピュータビジョン会議の一つであり、今回で19回目を迎えます。2026年大会は9月8日から12日にかけてスウェーデンのマルメで開催され、2024年大会と同程度の約6,700人の参加が見込まれています。ロボティクスにとって重要である理由は、コンピュータビジョンとロボティクスの研究が融合しつつあるためです。ECCVで議論される3D知覚、シーン再構築、人体理解の技術は、ロボットシステムが現実環境で動作するために必要とする能力でもあります。この水準の会議で10本の論文が採択された研究所は、その融合の最前線に貢献していると言えます。

●パッチごとのスカラーを用いたVision Transformerのナビゲーション手法は、実際にはどのように機能するのですか?

Vision Transformerは、カメラ画像を固定サイズのパッチ、つまり小さな画像タイルに分割し、それらをセルフアテンション層で処理して、各パッチの特徴ベクトルを出力します。パッチごとのスカラーを用いる手法は、それぞれの特徴ベクトルから、移動可能性を示す最小限の「アフォーダンス」信号となる単一の数値を抽出し、強化学習で訓練するナビゲーションポリシーへ入力します。重要なのは、Vision Transformer本体が凍結されていることです。ナビゲーションタスクのためにViTの重みが更新されることはありません。学習されるのは、Vision Transformerのパッチ特徴量をナビゲーション用のスカラーへ変換する軽量な投影部分と、その情報を利用するナビゲーションポリシーです。この方式は、ViT全体をファインチューニングするよりもはるかに低コストです。その結果、変更を加えていない汎用視覚モデルを基盤として、現実世界で動作するロボットナビゲーションシステムを構築できます。

●BLASt3Rとは何ですか?DUSt3RやMASt3Rとはどのように関連していますか?

DUSt3R(CVPR 2024で発表)は、カメラのキャリブレーションを必要とせず、Transformerを使って画像ペアから3Dポイントマップを予測することで、従来のStructure from Motionパイプラインを置き換えました。MASt3R(ECCV 2024)は、高密度な対応関係を求めるマッチングヘッドを追加してDUSt3Rを拡張し、数千枚の画像での利用を可能にしました。BLASt3R(ECCV 2026)は、その系譜の次の段階です。画像ペア間で学習されたマルチビューマッチングの手がかりと、単一視点から深度を推論する単眼幾何事前知識を組み合わせ、キャリブレーションされていない任意の画像セットで正確なバンドル調整を実現します。この進展は、同じ研究所が3回のECCV/CVPRのサイクルを通じて、現実環境で3D再構築を不安定にしてきた制約を体系的に取り除いていることを示しています。

●プライバシー保護ローカリゼーションの論文は、どのようなセキュリティリスクを明らかにしていますか?

プライバシー保護型の視覚ローカリゼーション手法は、3Dマップを難読化した形式で符号化することにより、機密性の高いシーンの幾何情報を保護します。これにより、マップへアクセスできる第三者が元のシーン画像を再構築し、監視に利用することを防ぎます。NAVER Labs EuropeのECCV 2026論文は、部分的な手がかりから、それらしい視覚コンテンツを推定して写実的な画像を生成できる拡散モデルが、こうした難読化マップを攻撃し、元のシーンに近い画像を復元できることを示しています。視覚ローカリゼーション技術が消費者向けARアプリケーションへ広がると、対象となるマップには建物内部、住宅、オフィスなどの私的空間が含まれる可能性があるため、特に重要な問題となります。

元記事: NAVER Labs Europe Brings No-Retrain Robot Navigation to ECCV 2026 with Ten Vision Papers

関連記事

最新記事