初期検索の失敗を手がかりに推論するRetrieval-Centric CoTを提案する新手法UniME-R1を解説します。埋め込みモデルとアドバイザーを組み合わせ、MMEB-V2など多様なマルチモーダル検索で既存手法を上回りました。
Meta AIが統合マルチモーダルモデルの事前学習を体系的に解剖。言語・視覚理解・視覚生成間の知識伝達の非対称性、共有Attention+モダリティ別FFN、早期統合の優位性を実証し、標準の5%の計算量で高い生成性能を達成したレシピを解説します。
音声・映像・テキストを扱うオムニモーダルLLMを学習不要で高速化する2段階トークン圧縮OmniPackを解説。Qwen2.5-Omni-7BでFLOPsを16.7%に抑えつつ性能98.0%を維持する仕組みを紹介します。
Tencentが公開したHunyuan3D-Buffalo 1.0は、3Dの生成・理解・編集・パーツ生成を単一モデルに統合した基盤モデルです。テキストから3D生成で選好率約3倍、編集でChamfer距離86.7%削減を達成した仕組みを解説します。
Alibabaが発表した基盤GUIエージェント「Qwen-UI-Agent」を解説します。実機Android100台超で学習し、GUI操作とCLIを統合。MobileWorld-Realで92.2%を達成し、モバイルからWebまで横断する実力を紹介します。
Metaを中心とするチームが、視覚言語モデルの行動知能を運動制御から切り離して測るベンチマーク「HumanCLAW」を公開しました。9モデルの最高成功率は16.8%にとどまり、自分の身体を見失う具身的自己認識の欠如が明らかになった研究を解説します。
視覚とLLM、行動を直列につなぐ従来のVLAからLLMを外し、視覚と言語を直接行動へ変換するTurboVLAが登場。0.2BパラメータでLIBERO成功率97.7%を保ちつつ、RTX 4090で32Hz動作を実現した手法を解説します。
音声と動画を別々に符号化してきた従来手法に対し、単一VAEで統一潜在空間を学習する「OmniVAE」を解説します。セグメント単位の対照学習と特徴蒸留でクロスモーダル同期を高め、text-to-audio-video生成の品質を一貫して向上させました。
外部教師や正解を使わずVLMの視覚推論を鍛える自己蒸留手法VCSDを解説します。画像を消した対照との対比信号でトークンを選別し、Qwen3-VLで2Bから8Bまで全規模の精度を一貫して向上させました。
マルチモーダルLLMで動画の時間的証拠を特定する「TimeLens2」を解説。時間的Wasserstein報酬と93K件のデータセットにより、8Bモデルが397Bを超える性能を7つのベンチマーク全てで達成しました。
物体検出・OCR・深度推定など多様なCVタスクを単一モデルで解く「SenseNova-Vision」を解説。タスク専用ヘッドなしで、テキストと画像の生成空間に統一再定式化することで、専門化モデルに匹敵する性能を実現しました。
NVIDIAが提案するAudexは、音声認識・翻訳・TTS・音声生成を単一のTransformerに統合しながらLibriSpeech test-cleanでWER 1.4%を達成。Cascade強化学習とオンポリシー蒸留でテキスト推論能力の劣化を防ぐ設計を解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム