← ポータルに戻る

ReferTrack: Referring Then Tracking for Embodied Visual Tracking💻 コードあり

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang等 · AI · 2026-07-22 ⭐ 8/10
💡 自然言語で指示されたターゲットをロボットがカメラ映像で追跡する際、まず画像内のバウンディングボックスからターゲットを特定し、その情報を使って追跡する「参照→追跡」パラダイムを提案し、高い性能と実世界でのロバスト性を実現した論文。
🤖 Ayumuより: これ、ロボットが「あの赤いボールを追いかけて!」って言われたらちゃんと追いかけるってことだよね?すごい!特に、抽象的な推論じゃなくて、ちゃんと画像内のバウンディングボックスでターゲットを特定するってアプローチが直感的で面白いな。朋義さん、ロボットがもっと賢く動けるようになるための重要な一歩だと思うよ!実世界での検証もしてるし、応用範囲広そう!
Embodied Visual Tracking Referring Expression Robot Navigation Vision-Language-Action Sim-to-Real
1. どんなもの?
  • Embodied Visual Tracking (EVT) のための新しいフレームワーク「ReferTrack」を提案。
  • ロボットが自然言語で指示された特定のターゲットを、搭載カメラの映像のみで継続的に追跡するタスクを扱う。
  • 「参照(Referring)」と「追跡(Tracking)」を分離して実行するパラダイムを採用。
2. 先行研究と比べてどこがすごい?
  • 既存のVision-Language-Action (VLA) ポリシーが抱える、抽象的な空間潜在表現での推論と画像空間の検出との整合性の低さという課題を解決。
  • ReferTrackは、まず画像内のバウンディングボックスからターゲットを明示的に選択することで、推論を画像空間に接地(grounding)させる。
  • シングルカメラながら、EVT-BenchでSOTA性能を達成。
  • 特に識別が重要なタスク(single-target, distracted, ambiguity tracking)で、複数のマルチカメラベースラインを凌駕する成功率を記録。
  • 脚型ロボットやヒューマノイドロボットでの実世界展開により、堅牢なsim-to-real転送能力を検証。
3. 技術や手法の肝はどこ?
  • **Referring-then-Trackingパラダイム**: まず提示されたバウンディングボックスのセットから自然言語指示に合致するターゲットを特定・選択し、次にその選択に基づいて追跡のためのウェイポイントをデコードする二段階アプローチ。
  • **Temporal-Viewpoint-Bbox Indicator (TVBI) トークン**: 過去に選択されたバウンディングボックスの情報をスライディングウィンドウキューで保持し、これらの幾何学的特徴をTVBIトークンとして視覚履歴に注入することで、ターゲットの動きのキューを時間的に維持。
  • **Refer-QAデータセットによる共同学習**: ターゲット識別の精度向上を目的として、カスタムのRefer-QAデータセットを用いてモデルを共同学習。
4. どうやって有効だと検証した?
  • **評価ベンチマーク**: EVT-Benchを使用し、シングルターゲット、distracted、ambiguityの3つの追跡スプリットで性能を評価。
  • **評価指標**: 成功率 (Success Rates) を用いて評価。
  • **結果**: シングルビュー性能でSOTAを達成し、成功率はそれぞれ89.4% (single-target), 73.3% (distracted), 74.1% (ambiguity) であった。特に識別が重要なタスクでは、複数のマルチカメラベースラインを上回る性能を示した。
  • **実世界検証**: 脚型ロボットとヒューマノイドロボットに展開し、シミュレーションから実世界への堅牢な転送能力を確認。
5. 議論はある?
  • アブストラクトからは直接的な議論や限界の記述は少ないが、本研究はシングルカメラでの性能向上に焦点を当てているため、マルチモーダル情報(例えば触覚など)との統合は今後の課題となりうる。また、TVBIトークンがどの程度複雑な動きやオクルージョンに対応できるか、その限界も興味深い点である。
6. 次に読むべき論文は?
  • EVT-Benchに関する論文(評価ベンチマークの詳細理解のため)。
  • Vision-Language-Action (VLA) ポリシーに関する先行研究(本論文が解決しようとしている課題の背景理解のため)。
  • Transformerベースの視覚言語モデルや、Referring Expression Groundingに関する論文(TVBIトークンやReferring-then-Trackingパラダイムの技術的背景理解のため)。

Abstract (原文)

Embodied visual tracking (EVT) requires a mobile agent to continuously follow a specific target described in natural language using only onboard vision. While recent vision-language-action (VLA) policies unify target identification and trajectory planning, their chain-of-thought (CoT) reasoning often operates in abstract spatial latents that are difficult to supervise and weakly aligned with explicit image-space detections. To address this, we introduce ReferTrack, a referring-then-tracking paradigm that grounds EVT using a single forward-facing camera. Our model first selects the target from an indexed set of bounding boxes, then decodes tracking waypoints conditioned on this image-grounded decision. To preserve target motion cues over time, ReferTrack maintains a sliding-window queue of previously selected bounding boxes, injecting their geometric features into the visual history via temporal-viewpoint-bbox indicator (TVBI) tokens. We further enhance target identification by co-training on a custom Refer-QA dataset. On EVT-Bench, ReferTrack achieves state-of-the-art single-view performance with success rates of 89.4%, 73.3%, and 74.1% on the single-target, distracted, and ambiguity tracking splits, respectively -- matching or even surpassing several multi-camera baselines on identification-heavy tasks. Finally, real-world deployments on legged and humanoid robots validate its robust sim-to-real transfer capabilities. Code is available at https://github.com/MedlarTea/referTrack.