マスク拡散LLMが推論の途中で答えを先に固定してしまう欠陥を特定した研究を解説します。単一パラメータ「frontier-gated commitment」でGSM8K精度を0.528から0.852へ改善し、最大4倍の並列デコードを維持した成果を紹介します。
初期検索の失敗を手がかりに推論するRetrieval-Centric CoTを提案する新手法UniME-R1を解説します。埋め込みモデルとアドバイザーを組み合わせ、MMEB-V2など多様なマルチモーダル検索で既存手法を上回りました。
Meta AIが統合マルチモーダルモデルの事前学習を体系的に解剖。言語・視覚理解・視覚生成間の知識伝達の非対称性、共有Attention+モダリティ別FFN、早期統合の優位性を実証し、標準の5%の計算量で高い生成性能を達成したレシピを解説します。
正解から逆探索して各ステップに密な報酬を与える強化学習手法ABSeekerを解説します。Qwen3.5-4BをわずかBrowseComp 37.3%(文脈管理で55.3%)に引き上げ、30B級に匹敵させた仕組みを紹介します。
推論、検索、画像生成を1つのモデルに統合したエージェント型画像生成ToolArtistを解説します。Emu3.5とRAD-GRPO強化学習でWISE0.79を達成し、Qwen-Imageを上回った手法を紹介します。
音声・映像・テキストを扱うオムニモーダルLLMを学習不要で高速化する2段階トークン圧縮OmniPackを解説。Qwen2.5-Omni-7BでFLOPsを16.7%に抑えつつ性能98.0%を維持する仕組みを紹介します。
1枚の画像から3Dシーンを再構成する新視点合成手法InfiniSplatを解説します。ピクセル整列ではなく深度から導く表面構造にガウスを配置し、大きな視点変化でもSOTAを達成しました。
Tencentが公開したHunyuan3D-Buffalo 1.0は、3Dの生成・理解・編集・パーツ生成を単一モデルに統合した基盤モデルです。テキストから3D生成で選好率約3倍、編集でChamfer距離86.7%削減を達成した仕組みを解説します。
因果的自己注意を勾配経路として使い、報酬勾配を連続潜在状態へ直接割り当てるテスト時推論手法「GradCuit」を解説します。5つのLLMと3ベンチマークで平均64.5%を達成し、CoTを6.6ポイント上回りました。
拡散Transformer訓練を2倍以上高速化する最適化手法CMuonを解説します。重み行列を機能ごとに分割してから直交化することで収束停滞を解消し、ImageNet 256でFID 1.18を200エポックで達成しました。
ByteDanceが自然言語による声質デザインと参照音声からのゼロショットクローンを1つに統合した音声生成モデルSwanTaleを解説。会話や歌唱、環境音まで一貫生成し、InstructTTSEvalで首位を獲得した仕組みと成果を紹介します。
ByteDance Seedが、拡散モデルの収束損失がプロンプト内の構造化言語量に応じて下がる新法則を発見。尤度指標GPGと属性指標EDで定量化し、構造化プロンプトと自動生成器で画像生成のSOTAを達成した成果を解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム