正解から逆探索して各ステップに密な報酬を与える強化学習手法ABSeekerを解説します。Qwen3.5-4BをわずかBrowseComp 37.3%(文脈管理で55.3%)に引き上げ、30B級に匹敵させた仕組みを紹介します。
正解のない要約や創作を「スパイ探し」ゲームに変換し、検証可能な報酬を自動生成する強化学習RLSVRを解説。Qwen3-8Bで要約75.4%、創作77.3%の勝率を達成し、既存の自己改善手法を上回った成果を紹介します。
Qwenが提案する自己対戦RLフレームワーク「Skill-SP」を解説。スキルを仲介役にタスク生成器・解答器・スキル制御器を共進化させ、ツール利用や論理推論で最大40ポイント超の改善を実現した仕組みを紹介します。
NVIDIAが公開したエージェント強化学習フレームワーク「Molt」を解説します。約8.6千行のPyTorch中心コードで6万行超のverlより改変しやすく、700B MoEまでスケールしslimeと同等のスループットを実現します。
PPO-Clipの固定幅クリップが方策空間の幾何と食い違い探索崩壊を招くと指摘した新手法RIPOを解説。確率に応じた等長クリップでQwen3-8Bの7ベンチマーク平均を28.5から38.5へ改善しました。
ロボットの実機評価コストを削減する動画世界モデルの活用法を体系的に研究。7種のモデル・32万件超のロールアウト分析から、実世界との一致には「映像美」より「長期アクション忠実度」が重要と実証しました。
LLM強化学習の根本的問題「目標不一致」を初めて体系化。訓練ではなく推論ポリシーの単調改善を保証するMIPI原則とアルゴリズムMIPUを提案し、PPO・GRPOの設計方針を再考させる重要研究。
医療VQAの推論連鎖エラーを断ち切るRL手法「MRPO」を解説。初期推論エラー率を64.0%から13.0%に削減し、8B規模のQwen3-VL-8BがHuatuoGPT-Vision-34Bを2.79ポイント上回る精度を実現しました。
NVIDIAが提案したロボット向け継続学習フレームワーク「ASPIRE」を解説します。LLMによるコード生成・自律デバッグ・スキルライブラリ構築の3要素で、LIBERO-Proマニピュレーションで既存手法比77%向上を実現しました。
RL後訓練の方策モデルと参照モデルの対数確率比が、理論的に最適な優位関数と等価であることを証明した研究を紹介します。追加アノテーションなしで専用プロセス報酬モデルを上回る精度を達成し、テスト時スケーリング・不確実性定量化・失敗原因特定に即座に応用可能な Progress Advantage を解説します。
視覚的ワールドモデルの幻覚を初めて体系化した研究。65,600軌跡・427時間・23Mフレームの大規模MMBench2を構築し、知覚型など3種の幻覚モードを定義。PSNR +0.88 dBの改善を達成し、ロボット制御の信頼性向上に貢献します。
Qwenチームが提案する言語世界モデル「Qwen-AgentWorld」。7ドメイン・1,000万件超の実環境軌跡データをCPT→SFT→RLの3段階で学習し、LLM自体が次状態を予測する環境シミュレーターとして機能します。AgentWorldBenchでGPT-4oやGemini 2.5 Proを超える性能を達成。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム