マスク拡散LLMが推論の途中で答えを先に固定してしまう欠陥を特定した研究を解説します。単一パラメータ「frontier-gated commitment」でGSM8K精度を0.528から0.852へ改善し、最大4倍の並列デコードを維持した成果を紹介します。
因果的自己注意を勾配経路として使い、報酬勾配を連続潜在状態へ直接割り当てるテスト時推論手法「GradCuit」を解説します。5つのLLMと3ベンチマークで平均64.5%を達成し、CoTを6.6ポイント上回りました。
35BのAIエージェント「Frontis-MA1」が機械学習開発の自己改善を実現しました。4つの進化操作と探索を組み合わせ、単一GPUでメダル獲得率を71.21%へ高めGPT-5.5+Codexを超えた仕組みを解説します。
デコーダ型LLMが記憶と推論を同じパラメータに詰め込む構造を分離する新手法「Memory Decoder」を解説します。410M本体に6.9Bの記憶を組み合わせ、総パラメータ39%減で12Bモデルを17ベンチマークで上回りました。
自己反省手法Self-RefineやReflexionは本当に有効なのか。同じトークン予算で繰り返しサンプリングと比較したところ、1.5Bから7Bまで一貫して反省が劣り、10件の設定で基準を下回った実証研究を解説します。
28段階・約450倍のコーパスで4つのRAG手法を統制比較した研究を解説します。1000万トークンを超えると古典的なBM25が密ベクトル検索やエージェント検索を約20ポイント上回り、構築コストも最小でした。
記憶を外部モジュールでなくモデル内部に組み込む「メモリ基盤モデル」Metisが登場。勾配計算なしのフォワード計算だけで情報を保存・検索するネイティブ記憶を実現し、重みを凍結したまま推論時に記憶を更新する新パラダイムを解説します。
オンポリシー蒸留で生徒が序盤の推論ミスを引きずる問題を、教師が要所で引き継ぐ軌跡リレー方式Relay-OPDで解決。Qwen3-1.7Bで標準OPD比+5.73%、学習軌跡長を50%以上短縮した新手法を解説します。
Salesforce Researchが発表したPC操作エージェントStateActを解説。画面ではなくプログラム状態を直接扱い、OSWorld 2.0で成功率を20.6%から26.9%へ改善しコストを約9分の1に削減した仕組みを紹介します。
Moonshot AIが総2.8兆パラメータのMoEモデル「Kimi K3」をオープン重みで公開。Kimi Delta AttentionとStable LatentMoEでK2比約2.5倍の学習効率を実現し、1M文脈と視覚対応を備えた新モデルを解説します。
会話の途中でユーザーの意図が明かされ・修正され・方向転換すると、静的評価では高性能なLLMも性能が急落する。Microsoft Researchらが検証した対話AIの盲点をわかりやすく解説します。
RoPEの周波数を反周期的に設計し系列の両端をメビウス境界条件で結ぶ新手法Möbius RoPEを解説。ニードル検索の精度を文脈長512で63.3%から90.3%へ高め、乱数シードによる性能のばらつきを解消します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム