正解のない要約や創作を「スパイ探し」ゲームに変換し、検証可能な報酬を自動生成する強化学習RLSVRを解説。Qwen3-8Bで要約75.4%、創作77.3%の勝率を達成し、既存の自己改善手法を上回った成果を紹介します。
頂点集合VAEとFlow Matchingを組み合わせた3Dメッシュ生成手法「Meshy T2」を解説します。画像からメッシュまでを中央値6秒で生成し自己回帰手法の10倍以上高速、面数制御やマルチパート資産にも対応します。
同じ動きを異なる見た目で二重描画する「シャドウペア」で、動作と見た目を分離する動画ワールドモデル「ShadowDancer」を解説します。ラベルや微調整なしで動作を環境間転送し、人間動作PSNR22.4を達成しました。
35BのAIエージェント「Frontis-MA1」が機械学習開発の自己改善を実現しました。4つの進化操作と探索を組み合わせ、単一GPUでメダル獲得率を71.21%へ高めGPT-5.5+Codexを超えた仕組みを解説します。
線形注意KDAとMLAを融合したハイブリッド拡散Transformer「Chimera」を解説します。Wan-2.1比7.3倍の計算効率と、5秒学習から30秒動画へのゼロショット外挿でFID劣化6.5%を実現した手法と成果を紹介します。
デコーダ型LLMが記憶と推論を同じパラメータに詰め込む構造を分離する新手法「Memory Decoder」を解説します。410M本体に6.9Bの記憶を組み合わせ、総パラメータ39%減で12Bモデルを17ベンチマークで上回りました。
自己反省手法Self-RefineやReflexionは本当に有効なのか。同じトークン予算で繰り返しサンプリングと比較したところ、1.5Bから7Bまで一貫して反省が劣り、10件の設定で基準を下回った実証研究を解説します。
PhiZeroは4秒の動画を256トークンの離散「物理言語」に圧縮し、VLMで未来を推論してから拡散モデルで描画する世界モデルです。Physics-IQ Verifiedなど主要ベンチマークで最高スコアを達成した仕組みを解説します。
Alibabaが発表した基盤GUIエージェント「Qwen-UI-Agent」を解説します。実機Android100台超で学習し、GUI操作とCLIを統合。MobileWorld-Realで92.2%を達成し、モバイルからWebまで横断する実力を紹介します。
コーディングエージェントがBlenderプログラムを書いて物理シミュレーションの下書きを作り、動画編集モデルで写実化する新手法VideoCoCoを解説。VBench-2.0の妥当性を52.18%から77.88%へ改善した仕組みを紹介します。
28段階・約450倍のコーパスで4つのRAG手法を統制比較した研究を解説します。1000万トークンを超えると古典的なBM25が密ベクトル検索やエージェント検索を約20ポイント上回り、構築コストも最小でした。
Metaを中心とするチームが、視覚言語モデルの行動知能を運動制御から切り離して測るベンチマーク「HumanCLAW」を公開しました。9モデルの最高成功率は16.8%にとどまり、自分の身体を見失う具身的自己認識の欠如が明らかになった研究を解説します。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム