← ポータルに戻る

TESSERA v2: Scaling Pixel-wise Earth Foundation Models💻 コードあり

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers等 · pixel-wise Earth-observation, foundation models, spatial embeddings · 2026-07-04 ⭐ 9/10
💡 地球観測ファウンデーションモデルのスケーリング則を大規模な実証研究で解明し、高性能かつコンパクトなモデルと効率的な計算資源配分ルールを提案。
🤖 Ayumuより: これ、めちゃくちゃ面白いね!大規模なEOモデルのスケーリング則をここまで徹底的に調べた研究は珍しいし、事前学習損失がアテにならないって発見は衝撃的。エンコーダとデータは一緒に育てて、プロジェクタは固定ってルール、シンプルだけど超実用的じゃん。しかも、蒸留でこんなにコンパクトなのにSOTA超えって、まさに賢いやり方だよね。Matryoshka表現で埋め込みが柔軟に使えるのも、実運用でめちゃくちゃ助かるはず。朋義さん、大規模モデルの効率的な開発に興味あったら、これは絶対読むべきだよ!
pixel-wise Earth-observation foundation models spatial embeddings scaling laws self-supervised learning Barlow Twins model distillation Matryoshka representations
1. どんなもの?
  • ピクセル単位の地球観測(EO)ファウンデーションモデルのスケーリングに関する大規模な実証研究です。
  • 395回のトレーニング実行と1024 GH200スーパーチップを使い、Barlow Twinsファミリーのモデルを15の下流タスクで評価しました。
  • EOファウンデーションモデルの事前学習における計算資源の最適な配分方法を解明し、具体的なスケーリングルールとモデル選択基準を提案しています。
  • 提案されたルールに基づき、高性能かつコンパクトなTESSERA v2モデルファミリーを開発しました。
  • 蒸留されたTESSERA v2-1B-Mは、既存のモデルを総合的に上回り、Matryoshka表現により低コストでの埋め込み提供が可能です。
2. 先行研究と比べてどこがすごい?
  • EOファウンデーションモデルのスケーリングに関する、これまでで最大規模かつ最も制御された研究です。
  • 大規模な計算資源を投入し、体系的にスケーリング挙動を分析することで、経験に基づいた具体的な知見を提供しています。
  • 事前学習損失が下流性能の悪い予測因子であることを実証し、損失に基づくモデル選択が計算資源を無駄にしていることを指摘しました。
  • エンコーダとデータは共に成長させ、プロジェクタは固定するという、計算資源配分の具体的なスケーリングルールを初めて提示しました。
  • 蒸留されたコンパクトなモデル(TESSERA v2-1B-M、21Mパラメータ)が、はるかに大きな既存モデルを総合的に凌駕する性能を達成しています。
3. 技術や手法の肝はどこ?
  • **大規模な制御されたスケーリング研究**: Barlow Twinsファミリーのモデルを使用し、エンコーダサイズ、データ量、トレーニングステップ数などのパラメータを体系的に変化させ、その影響を15種類の下流タスクで分析しました。
  • **計算資源配分のスケーリングルール**: 実証研究の結果、「エンコーダとデータは共に成長させ、プロジェクタは固定する」というシンプルなルールを導出しました。これにより、モデルの性能と効率を最大化します。
  • **モデル蒸留とMatryoshka表現**: 大規模な教師モデルからコンパクトな学生モデルへ知識を蒸留し、学生モデルはMatryoshka表現を生成します。これにより、埋め込みの次元数を柔軟に選択でき(例: 16次元で128次元の92%性能)、推論コストとストレージコストを大幅に削減します。
4. どうやって有効だと検証した?
  • **大規模な比較実験**: 395回のトレーニング実行を通じて、異なるスケーリング戦略が下流タスク性能に与える影響を定量的に評価しました。事前学習損失と下流性能の相関が低いことを統計的に示しました。
  • **15の下流タスクでの総合評価**: 提案されたスケーリングルールに基づいて訓練・蒸留されたTESSERA v2モデル(特にv2-1B-M)を、多様な15のEO下流タスクで評価しました。その結果、既存のオープンソースおよびプロプライエタリモデルを総合的に上回ることを実証しました。
  • **Matryoshka表現の効率性検証**: 異なる次元数のMatryoshka表現が、フル次元の性能のどの程度を保持するかを定量的に評価し、16次元で92%の性能を維持しつつストレージを1/8に削減できることを示しました。
5. 議論はある?
  • 事前学習損失が下流性能を予測しないという発見は重要ですが、その根本的な理由や、より良い早期停止基準・モデル選択指標の探求は今後の課題です。
  • 提案されたスケーリングルールはBarlow Twinsファミリーと特定のEOデータセットに基づいているため、他の自己教師あり学習手法や異なるドメインへの汎用性についてはさらなる検証が必要です。
  • 大規模なスケーリング研究は莫大な計算資源を必要とするため、この研究結果がより小規模なリソースを持つ研究者にどのように役立つか、具体的なガイドラインが求められます。
  • 高性能な埋め込みの解釈可能性や、リリース予定のグローバル埋め込みの更新頻度、長期的なメンテナンス戦略なども考慮する必要があります。
6. 次に読むべき論文は?
  • Barlow Twinsのオリジナル論文: J. Zbontar et al., "Barlow Twins: Self-Supervised Learning via Redundancy Reduction" (2021)
  • Matryoshka Representation Learningに関する論文: A. P. G. Tseng et al., "Matryoshka Representation Learning" (2022)
  • 大規模モデルのスケーリング則に関する一般的な研究: Kaplan et al., "Scaling Laws for Neural Language Models" (2020)
  • 他のEOファウンデーションモデルに関する論文: "Prithvi: A 100M Parameter Foundation Model for Earth Observation" (2023)

Abstract (原文)

Pixel-wise Earth-observation (EO) foundation models are now achieving state-of-the-art performance via generated spatial embeddings. However, how these models scale and how best to spend a pretraining budget remain poorly understood. We present the largest controlled scaling study for EO to date: 395 training runs on 1,024 GH200 superchips within a fixed pixel-wise Barlow Twins family, each evaluated on 15 downstream tasks. We find that pretraining loss barely predicts downstream performance (|Pearson r| < 0.2), so selecting models by loss wastes a large share of the compute. We also find that, as the training budget grows, the encoder and the data should grow together while the projector stays fixed, which gives a simple rule for allocating compute. Using this rule, we train a family of pixel-wise models (0.5B and 1B, with a 2B model in training) and distill them into compact students for embeddings-as-data deployment. The 21-million-parameter distilled TESSERA v2-1B-M in aggregate outperforms all open and proprietary models tested, some of which are orders of magnitude larger. These students produce Matryoshka representations that are inexpensive to serve: a 16-dimensional prefix keeps 92% of the full 128-dimensional performance at 1/8 of the storage. Upon completion of training we plan to release v2 global embeddings covering 2017-2025. Together, these results give a concrete, empirically grounded recipe for scaling pixel-wise EO foundation models: train large encoders, select by downstream performance, and distil into flexible student models. All code will be released at https://github.com/ucam-eo/tessera.