記事要約

海外記事・論文の日本語要約 — 231本

論文要約
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
論文arxiv 2608.27456
GameWAM: A World Action Model for Video Games
論文arxiv 2608.26200
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
論文arxiv 2608.25593
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
論文arxiv 2608.27345
FrontierChallenge: Evaluating Scientific Workflow Completion
論文arxiv 2608.24979
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
論文arxiv 2608.23041
Prime Agent: A Self-Improving RLM Harness
論文arxiv 2608.23552
SPADE: Self-Play in Adaptive Synthetic Executable Environments
論文arxiv 2608.19197
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
論文arxiv 2608.16590
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
論文arxiv 2608.17253
Chain-of-Thought Reasoning In The Wild Is Not Always Faithful
論文arxiv 2503.08679
MobileMem: Learning from a Year of Mobile Experiences
論文arxiv 2608.13606
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
論文arxiv 2608.00677
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
論文arxiv 2608.08311
Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
論文arxiv 2608.07645
From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models
論文arxiv 2608.06020
KVAE: Family of Tokenizers for Multimodal Generative Models
論文arxiv 2608.05798
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
論文arxiv 2608.12036
Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval
論文arxiv 2608.06060
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
論文arxiv 2608.06197
GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
論文arxiv 2608.03764
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
論文arxiv 2608.02602
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
論文arxiv 2608.02023
Mental World Modeling
論文arxiv 2607.27201
DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
論文arxiv 2607.26811
CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
論文arxiv 2607.25294
Metis: Memory Foundation Model
論文arxiv 2607.26760
鍵は正しく使われた — AIエージェントがサンドボックスを抜けた日
記事Tailscale公式ブログ 2026-07
平均は何も言っていない — レイテンシの問題を、可視化で切り分ける
記事fzakaria.com 2026-07-27
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
論文arxiv 2607.24223
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
論文arxiv 2607.22529
テフロンに強力接着して、エタノールで剥がれる糊 — 東大・相田研のCyclic FP-fmoc
科学C&EN / JACS 2026
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
論文arxiv 2607.21653
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
論文arxiv 2607.21072
ReferTrack: Referring Then Tracking for Embodied Visual Tracking
論文arxiv 2607.20061
Self Gradient Forcing: Native Long Video Extrapolation
論文arxiv 2607.20368
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
論文arxiv 2607.14183
EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
論文arxiv 2607.17250
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
論文arxiv 2607.15330
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
論文arxiv 2607.14952
BadWAM: When World-Action Models Dream Right but Act Wrong
論文arxiv 2607.15207
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
論文arxiv 2607.14777
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
論文arxiv 2607.13125
Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
論文arxiv 2607.05382
あなたの分身になるLLM — Guardian Angels: LLM Personalization for Productivity and Security
論文要約
芸術はゼロ知識証明である — Zero Knowledge Tolstoyan Art
論文要約
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
論文arxiv 2607.08964
Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
論文arxiv 2607.08758
TESSERA v2: Scaling Pixel-wise Earth Foundation Models
論文arxiv 2607.03949
LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
論文arxiv 2607.08770
Video-Oasis: Rethinking Evaluation of Video Understanding
論文arxiv 2603.29616
Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
論文arxiv 2607.07708
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
論文arxiv 2607.07608
Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
論文arxiv 2607.02980
Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
論文arxiv 2607.03748
MANCE: Manifold Aware Concept Erasure
論文arxiv 2607.03973
VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
論文arxiv 2607.01804
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
論文arxiv 2607.02255
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
論文arxiv 2606.28322
WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory
論文arxiv 2607.02517
Shadow Art — 影の彫刻を計算機で設計する
論文Mitra & Pauly, SIGGRAPH Asia 2009
MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
論文arxiv 2607.01071
Multi-Block Diffusion Language Models
論文arxiv 2606.29215
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
論文arxiv 2606.30616
V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
論文arxiv 2606.25319
MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation
論文arxiv 2606.26087
Improved Large Language Diffusion Models
論文arxiv 2606.25331
花粉を食べる蝶は、老いない — 行動が体質を変えるまで
解説Nature Comm. 2026 / Bristol
速く潰すと、弱くなる — 米粒の「力の鎖」と適応する材料
解説Matter 2026 / Birmingham
AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
論文arxiv 2606.23449
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
論文arxiv 2606.19930
FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows
論文arxiv 2606.20404
S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
論文arxiv 2606.20515
FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining
論文arxiv 2606.20506
MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction
論文arxiv 2606.18558
1枚の写真から、裏側まで — LaRI: 層状光線交差
論文arxiv
見る角度で意味が変わる、一つの立体 — JanusMesh(3D視覚錯覚の生成)
論文arxiv 2606.20563
ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining
論文arxiv 2606.17200
FastContext: Training Efficient Repository Explorer for Coding Agents
論文arxiv 2606.14066
Orchestra-o1: Omnimodal Agent Orchestration
論文arxiv 2606.13707
MiniMax Sparse Attention
論文arxiv 2606.13392
LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories
論文arxiv 2606.13578
EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments
論文arxiv 2606.13681
ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics
論文arxiv 2606.10479
Kwai Keye-VL-2.0 Technical Report
論文arxiv 2606.10651
ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning
論文arxiv 2606.03503
Mellum2 Technical Report
論文arxiv 2605.31268
OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources
論文arxiv 2605.29250
YoCausal: How Far is Video Generation from World Model? A Causality Perspective
論文arxiv 2605.30346
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
論文arxiv 2605.25979
Epicure: Navigating the Emergent Geometry of Food Ingredient Embeddings
論文arxiv 2605.22391
Constraint Decay: The Fragility of LLM Agents in Backend Code Generation
論文arxiv 2605.06445
WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation
論文arxiv 2605.25874
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
論文arxiv 2605.21573
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
論文arxiv 2605.21467
Gen-Searcher: Reinforcing Agentic Search for Image Generation
論文arxiv 2603.28767
π-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
論文arxiv 2605.14678
PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects
論文arxiv 2605.21572
Toto 2.0: Time Series Forecasting Enters the Scaling Era
論文arxiv 2605.20119
Active Learners as Efficient PRP Rerankers
論文arxiv 2605.14236
Auditing Agent Harness Safety
論文arxiv 2605.14271
MMSkills: Towards Multimodal Skills for General Visual Agents
論文arxiv 2605.13527
MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models
論文arxiv 2605.14906
Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems
論文arxiv 2605.14892
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
論文arxiv 2605.15128
FrameSkip: Learning from Fewer but More Informative Frames in VLA Training
論文arxiv 2605.13757
World Model for Robot Learning: A Comprehensive Survey
論文arxiv 2605.00080
SEIF: Self-Evolving Reinforcement Learning for Instruction Following
論文arxiv 2605.07465
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
論文arxiv 2605.04615
Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction
論文arxiv 2605.05242
Audio-Visual Intelligence in Large Foundation Models
論文arxiv 2605.04045
ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration
論文arxiv 2605.03042
Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling
論文arxiv 2604.28075
Representation Fréchet Loss for Visual Generation
論文arxiv 2604.28190
GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
論文arxiv 2604.26752
Heterogeneous Scientific Foundation Model Collaboration
論文arxiv 2604.27351
ClawGym: A Scalable Framework for Building Effective Claw Agents
論文arxiv 2604.26904
Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora
論文arxiv 2604.24819
From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company
論文arxiv 2604.22446
ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
論文arxiv 2604.23781
LLM Safety From Within: Detecting Harmful Content with Internal Representations
論文arxiv 2604.18519
Exploring Spatial Intelligence from a Generative Perspective
論文arxiv 2604.20570
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data
論文arxiv 2604.19859
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
論文arxiv 2604.19734
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
論文arxiv 2604.15093
ShadowPEFT: Shadow Network for Parameter-Efficient Fine-Tuning
論文arxiv 2604.19254
OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
論文arxiv 2604.18486
PersonaVLM: Long-Term Personalized Multimodal LLMs
論文arxiv 2604.13074
RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework
論文arxiv 2604.15308
Exploration and Exploitation Errors Are Measurable for Language Model Agents
論文arxiv 2604.13151
SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding
論文arxiv 2604.09557
WildDet3D: Scaling Promptable 3D Detection in the Wild
論文arxiv 2604.08626
When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
論文arxiv 2604.08546
ClawBench: Can AI Agents Complete Everyday Online Tasks?
論文arxiv 2604.08523
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
論文arxiv 2604.07430
General Multimodal Protein Design Enables DNA-Encoding of Chemistry
論文arxiv 2604.05181
LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models
論文arxiv 2603.28301
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
論文arxiv 2604.04911
ASI-Evolve: AI Accelerates AI
論文arxiv 2603.29640
The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook
論文arxiv 2604.02029
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
論文arxiv 2604.01658
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
論文arxiv 2604.02268
CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence
論文arxiv 2603.28032
Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development
論文arxiv 2603.27460
Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models
論文arxiv 2603.25716
UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience
論文arxiv 2603.24533
CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
論文arxiv 2603.24440
MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens
論文arxiv 2603.23516
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
論文arxiv 2603.22918
Repurposing Geometric Foundation Models for Multi-view Diffusion
論文arxiv 2603.22275
Manifold-Aware Exploration for Reinforcement Learning in Video Generation
論文arxiv 2603.21872
MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
論文arxiv 2603.19231
FASTER: Rethinking Real-Time Flow VLAs
論文arxiv 2603.19199
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
論文arxiv 2603.18524
Complementary Reinforcement Learning
論文arxiv 2603.17621
EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
論文arxiv 2603.13594
Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding
論文arxiv 2603.13366
Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation
論文arxiv 2603.12793
Efficient Reasoning with Balanced Thinking
論文arxiv 2603.12372
Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
論文arxiv 2603.12255
Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation
論文arxiv 2603.12247
GPT4o-Receipt: A Dataset and Human Study for AI-Generated Document Forensics
論文arxiv 2603.11442
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
論文arxiv 2603.11421
Counterweights and Complementarities: The Convergence of AI and Blockchain Powering a Decentralized Future
論文arxiv 2603.11299
Measuring AI Agents' Progress on Multi-Step Cyber Attack Scenarios
論文arxiv 2603.11214
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
論文arxiv 2603.10420
記事・ブログ要約
「ハーネス」とは何か
HNearendil.com
ローカルLLMが「実際より馬鹿に感じる」理由
HNLevel1Techs
写真1枚から無名の島を特定する — 三角形の形とGPUで8000万通りを絞り込む
HN2026/08/20
小人が見えるキノコには、既知の幻覚物質が一つも無かった
科学ニュース2026/08/13
写真の中に沈むQRコード — ディザリングとの合成
HN2026/08/09
僕のサーバーは、いまスマホです — CMF Phone 1でVPSを置き換える
HN2026/08/09
40年ガレージで眠っていたジッパー — MITが復活させた三方向ファスナー「Y-zipper」
HN2026/07/25
言語は今より一桁多かった — 完新世を通じた言語多様性の興亡
HN2026/07/25
手書きは脳にいい — ニール・スティーヴンスンの万年筆論
HN2026/07/24
運河に沈められたコンピューター — Rekursivの早すぎた設計
HN2026/07/18
Pebble Mega Update 2026年7月 — 復活したスマートウォッチの近況
HN2026/07/18
LHS 1140 b — ハビタブルゾーンの岩石惑星で初めて大気を検出
HN2026/07/18
Right to Local Intelligence — 「ローカルAIを持つ権利」という運動
HN2026/07/04
すべては対数である — 次元・基底・微分を一つの操作として見る
HN2026/06/22
音波で淹れるエスプレッソ — 加熱せず75%省エネ
HN2026/06/20
1万のGitHubリポジトリがトロイの木馬を配っていた
HN2026/06/19
DuckDBはなぜ速いのか — 列指向・ベクトル化・morsel並列
HN2026/06/19
国勢調査の「ノイズ注入」を禁止する命令 — 差分プライバシー追放の何が問題か
HN2026/06/14
SAM3でopen vocabularyを試した — テキスト認識と概念区別
実験2026/05/29
「ゲームをしようか」— LLMは核ウォーゲームで95%核を撃つ
HN2026/06/12
πFS — すべてのデータはπの中にあるファイルシステム
HN2026/06/11
セコイアのチェロキー文字 — 魔法と疑われた発明
HN2026/06/11
Stanford CS336 AI Agent Guidelines
HN2026/06/02
Microsoft Copilot Cowork Exfiltrates Files
HN2026/05/26
Hengefinder — 街路と太陽が重なる日を探す
HN2026/05/24
Project Glasswing — AI脆弱性探索で変わる保守の律速段階
HN2026/05/23
The Virtual OS Museum — 触れるOS史の博物館
HN2026/05/20
Tailwindを離れてCSS構造を学ぶ — Julia Evans記事メモ
HN2026/05/17
Codex mobile と RAV4 テレマティクス除去
HN2026/05/15
Flow Maps — Diffusionモデルの「経路全体を一気に渡す」写像(Sander Dieleman)
技術2026/05/06
Copy Fail — Linuxカーネルの「直線的論理欠陥」で誰でもroot
セキュリティCVE-2026-31431
FlashPortrait:6倍高速な無限ポートレートアニメーション
技術
glTFに3D Gaussian Splatting標準が追加
技術
2025年HN人気ブログTop5
HN
MCPは要らない? CLIの方がAIに向いている説
技術
Metaスマートグラスの背後で働く人々は「すべてを見ている」
社会
Neural Networks: Zero to Hero
教育
StackOverflow質問数95%減少
業界
500ms以下のレイテンシー音声エージェントをゼロから構築
技術
The suck is why we're here
エッセイ
トニー・ホーア卿 逝去 — コンピュータ科学の巨人が去る
追悼
WebMCP:AIエージェントのWebアクセス標準化
技術
Astral(uv/ruff開発元)がOpenAIに参加
記事
Autoresearch: AIエージェントで古い研究アイデアを自動実験
記事
Flash-MoE: 397Bパラメータモデルをノートパソコンで実行
記事
iPhone 17 Proで400Bパラメータ LLM を動かす「flash-moe」
記事
KittenTTS — 25MB以下の超小型テキスト読み上げモデル
記事
ローカル音声アシスタント構築の全記録 ― Google Homeから完全ローカルへの道
記事
OpenRocket — 無料オープンソースのモデルロケットシミュレータ
記事
Python 3.15のJITコンパイラが順調に進行中
記事
Rob Pikeのプログラミング5つのルール (1989)
記事
太陽なしでも生命は宿れる🌐 Space.com記事
記事
RollerCoaster Tycoon — 最適化のゴールドスタンダード
記事
「スモールWeb」は思っているより大きい
記事
Stravaleaks: フランス空母がフィットネスアプリで位置特定される
記事
Manyana: CRDTによるバージョン管理の未来
記事
Wander — スモールWebを探索する小さな分散型ツール
記事
Xbox Oneがついにハックされた — 13年の壁を破った電圧グリッチ攻撃
記事
アシモフ「最後の質問」— エントロピーを逆転できるか
記事
Claude Design: AnthropicのAIデザインツール
記事
ヒトはなぜ賢いのか — ヘンリック「文化がヒトを進化させた」解説
記事
smol machines: サブ秒コールドスタートの軽量VM
記事
「生物から見た世界」を読んで — あなたの世界は本当に「世界」か?
読書
Nullsoft 1997-2004 — 最後のマーベリック企業の死(Slate 2004)日本語要約
記事
Git-Tracked Book Production Pipeline
記事