ロボットVLAモデルの専門家データ不足を解決する2段階事前学習「TAP」を解説。失敗軌跡も含む未ラベルデータで動作スキルを先習得し、行動模倣学習比+10%の向上とカメラ擾乱下25%の成功率を達成しました。
「知覚(証拠の特定)」と「推論(回答生成)」を明示的に切り離した2段階フレームワークP2Rを提案。4BモデルでV-Star 93.2%・HR-Bench-4K 81.9%のSOTA性能を達成しました。
57名が共同提案する世界基盤モデル「Orca」を解説します。「次状態予測」という統一パラダイムでテキスト・画像・ロボット行動を1つのモデルに統合し、同規模の特化型モデルを複数のベンチマークで上回ることを実証しました。
CoLTはテキストによる推論ステップを潜在思考ベクトルに置き換えることで、マルチモーダルLLMの推論時間を10.1倍短縮、テキスト生成を22.6倍高速化します。8ベンチマークで平均精度79.1%を達成し、既存の潜在推論手法を大幅に上回りました。
安全ポリシーをモデルに埋め込まず実行時に切り替える新しいガードレール手法「SingGuard」を紹介します。fast-slow分離RLで3段階推論を最適化し、56,340例・80超のリスク分類を含むベンチマークで35ベンチマークファミリーにてSOTAを達成しました。
Tencent HunyuanのViQは、視覚特徴をテキスト空間で整合させてから離散コードに変換する2段階フレームワークです。マルチモーダル訓練を最大70%高速化しながら、連続エンコーダと同等の理解性能と高精度な画像再構成を実現しています。
Proposer・Solver・Generatorの3役割が循環し、人間アノテーションなしに自己一貫性信号だけでモデルを改善するASGフレームワークを解説。MMMUで+3.5%、GenEvalで82%→85%の改善を達成しました。
分子とタンパク質の配列・3D構造・自然言語テキストを単一モデルで処理する「BioMatrix」を解説。80のタスク中77でSOTAまたは競合性能を達成した、生物学向けマルチモーダル基盤モデルの仕組みと成果を紹介します。
拡散言語モデルの並列デコードを活かし、画像内の複数マスク領域を一括でキャプション生成するPerceptionDLMを解説します。スループット3.44倍を達成し、新ベンチマークParaDLC-Benchで62.4%の精度を記録しています。
視覚言語モデルが苦手とする3D空間推論を、階層的ツールと二重メモリで克服する「S-Agent」が登場。8Bの小型モデルでもGPT-5.4やGemini 3と同等の空間知能スコアを達成した仕組みを解説します。
ロボット行動制御にビデオ生成は必要か、を実験で問い直したImageWAM。画像編集のKVキャッシュを行動予測に活用するだけでFLOPs 1/6・遅延1/4(263ms)を達成し、実機ロボットでも84.5%の成功率を記録しました。
人間の一人称視点映像(エゴセントリック映像)を適切に処理すると実ロボットデータを凌駕することを実証した「HumanScale」を解説。分布外タスクで90%の成功率向上を達成し、身体的AIのデータ収集コスト問題に新たな解法を示します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム