← ポータルに戻る

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation💻 コードあり

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie等 · AI · 2026-07-09 ⭐ 8/10
💡 画像生成モデルが知らないことを「でっち上げる」問題を、モデルの「知識境界」を動的に発見し、検索と生成を協調させる「teach-then-search」フレームワークで解決する論文。
🤖 Ayumuより: これ、めちゃくちゃ面白いね!画像生成モデルが「知らないことを自信満々にでっち上げる」って表現が秀逸。物理学でも理論が実験結果と合わない時に、適当な仮説で「でっち上げ」ちゃうことあるから、AIの「知識境界」って概念はすごく共感できるよ。この境界をどうやって見つけるか、そしてどう進化させるかって、まさにAIの知能の核心に迫る話だよね。朋義さんもきっと好きだと思う!
Agentic Visual Generation Knowledge Boundary Teach-then-Search World Knowledge Image Generation Benchmarks
1. どんなもの?
  • 画像生成モデルの「世界知識のボトルネック」を解決する新しいアプローチと評価フレームワーク。
  • 既存の画像生成モデルが、知らないことを自信満々に「でっち上げる」問題を指摘。
  • ユーザーリクエストの多様性(新キャラ、トレンド、イベントなど)に対し、固定コーパスで学習するモデルの限界を構造的な問題と定義。
  • その解決策として「エージェント的視覚生成」と、モデルの「知識境界」を動的に発見する「teach-then-search」共同訓練フレームワークを提案。
  • 新しいベンチマークデータセット `SearchGen-20K` と `SearchGen-Bench`、およびマルチモーダル検索コーパス `SearchGen-Corpus-1M` を構築・公開し、オフラインでの再現可能な研究をサポート。
2. 先行研究と比べてどこがすごい?
  • 既存のベンチマークでは見過ごされていた、画像生成モデルの「世界知識」に関する深刻な性能低下(最先端モデルで21〜28/100点、既存ベンチマーク比で40点もの崩壊)を定量的に明らかにした点。
  • 単に検索ツールを導入するだけでなく、モデルの「知識境界」(内部化できる知識と外部コンテキストとして維持すべき知識の境界)を動的に発見し、検索と生成を協調させる「teach-then-search」フレームワークを提案した点。
  • 大規模かつ多様な失敗カテゴリとドメインを網羅したベンチマークデータセットと検索コーパスを構築・公開し、今後の研究の基盤を提供した点。
3. 技術や手法の肝はどこ?
  • **「知識境界」の概念:** 生成モデルが訓練を通じて内面化できる知識と、外部検索で補うべき知識の間に存在する、モデル固有の「進化する知識境界」を特定したこと。
  • **Teach-then-Search共同訓練フレームワーク:**
  • モデルが既に知っている("teach")ことと、外部検索が必要な("search")ことを見分けるメカニズムを導入。
  • これにより、素朴な検索による無差別な情報取得とノイズ注入を防ぎ、検索の有効性を最大化する。
  • **SearchGen-Bench:** 世界知識を問うための、12の失敗カテゴリと22のドメインを網羅した、挑戦的なプロンプトからなるベンチマーク。
4. どうやって有効だと検証した?
  • **ベンチマークでの評価:** 最先端のオープンな画像生成モデルを `SearchGen-Bench` で評価し、21〜28/100という低いスコアを記録。これにより、既存ベンチマークでは見えなかった「世界知識」に関する性能低下を定量的に示した。
  • **Teach-then-Searchの有効性:** 提案する「teach-then-search」フレームワークの最小バージョンでも、単調な性能改善が見られたことを報告。これにより、視覚生成における再帰的な自己改善の可能性を示唆した。
  • **データセットの公開:** 全データセット、共同訓練コーパス、検索コーパスを公開し、研究コミュニティが結果を再現し、さらなる研究を進めるための基盤を提供した。
5. 議論はある?
  • アブストラクトからは具体的な議論の詳細は読み取れないが、一般的に考えられる点として、提案された「知識境界」の特定方法や、その進化を追跡するメカニズムの複雑性に関する議論が考えられる。
  • 検索結果の品質やバイアスが生成結果に与える影響、およびリアルタイムでのエージェント的生成における計算コストやレイテンシも重要な議論の対象となりうる。
  • 公開されたデータセットの網羅性や、将来的な知識の進化にどのように対応していくかについても議論の余地があるだろう。
6. 次に読むべき論文は?
  • エージェント的なAIやツール利用に関する論文、特にLLMと外部ツールを統合する研究。
  • 知識グラフや外部知識源と画像生成モデルを統合する研究。
  • 画像生成モデルの評価指標やベンチマークに関する最新の論文。
  • 「agentic visual generation」や「recursive self-improvement in visual generation」といったキーワードで検索すると、関連研究が見つかるだろう。

Abstract (原文)

Visual generators excel at rendering, but they confidently fabricate what they do not know. User requests are unbounded, evolving, and deeply long-tailed: new characters, trending entities, post-cutoff events, and more. This world-knowledge bottleneck is structural: generators are trained on fixed corpora, but the visual world is open-ended. We construct SearchGen-20K and SearchGen-Bench, with 20,839 prompts spanning twelve failure categories and twenty-two domains, paired with a pre-executed multimodal SearchGen-Corpus-1M to support offline, reproducible research. On SearchGen-Bench, frontier open generators score only 21 to 28 out of 100, a 40-point collapse invisible to existing benchmarks. The natural remedy is to employ search tools, enabling agentic visual generation. However, we find that naive search fails: it retrieves indiscriminately, injecting noise into prompts the generator already handles. We trace the root cause to a generator-specific, evolving knowledge boundary: the divide between what a generator can internalize through training and what must remain in external context. Although this boundary is hard to specify in advance, we show that it is discoverable through a teach-then-search co-training framework. Even a minimal version of this co-training recipe produces monotonic improvement, laying the foundation for recursive self-improvement in visual generation that can meet world-knowledge-grounded requests. We release the full dataset, co-training corpus, and search corpus as a replayable harness for tool-augmented, world-knowledge-grounded visual generation.