被写体駆動型の動画生成に新たなアプローチを提案する「DomainShuttle」を解説します。Domain-MoT・VR-DualRoPE・CCLの3コンポーネントで、クロスドメインスコアSOTA比18.7%向上を実現しています。
米議会のMATCH法案が旧世代DUV露光装置まで禁輸対象を拡大しようとしていることに対し、EUV装置の唯一のメーカーであるASMLを抱えるオランダが正式に反発。AI半導体調達を左右する地政学リスクの最前線を解説します。
ByteDance Seedが開発したiLLaDA 8Bは、完全双方向Attentionと12兆トークン学習でLLaDAをBBH+21.6点で大幅に上回り、自己回帰型Qwen2.5 7Bと競合水準を達成した拡散型言語モデルです。
GoogleがGemini 3.5 FlashにComputer Useを統合、ブラウザ・デスクトップを自動操作するAIエージェントをGemini API経由で構築できます。敵対的学習によるプロンプトインジェクション対策も搭載しています。
Googleの研究チームが提案するFLATは、動画拡散モデルの潜在空間から三角形プリミティブを直接デコードし、幾何精度の高い3Dシーンを単一パスで生成します。ゲームエンジン対応のリアルタイムレンダリングも可能です。
OpenAIとBroadcomが共同開発したLLM推論特化チップ「Jalapeño」を正式発表。GPU調達コストの削減とNVIDIA依存リスクの低減を目的に、9カ月という短期間で設計を完了した独自シリコン戦略を解説します。
21の拡散変換器モデルを訓練・比較した結果、ImageNet FIDとT2I生成品質のピアソン相関が-0.38〜-0.58と負であることが判明。長年の評価慣行を見直すDiffusionBenchを提案します。
米ジャクソン研究所のDerya Unutmaz博士がGPT-5 Proを活用し、3年間解けなかったT細胞挙動の謎を解明した事例をOpenAIが公開。癌・自己免疫疾患研究への応用可能性と、AIが科学的発見を加速する新時代を解説します。
Qwenチームが提案する言語世界モデル「Qwen-AgentWorld」。7ドメイン・1,000万件超の実環境軌跡データをCPT→SFT→RLの3段階で学習し、LLM自体が次状態を予測する環境シミュレーターとして機能します。AgentWorldBenchでGPT-4oやGemini 2.5 Proを超える性能を達成。
ASMLが4億ドル超のHigh-NA EUV装置の量産投入を本格化させている。数値開口を0.55に引き上げることでトランジスタ密度を最大3倍に高める本装置は、AI向け次世代チップの製造基盤となり、半導体製造の競争地図を塗り替えようとしている。
分子とタンパク質の配列・3D構造・自然言語テキストを単一モデルで処理する「BioMatrix」を解説。80のタスク中77でSOTAまたは競合性能を達成した、生物学向けマルチモーダル基盤モデルの仕組みと成果を紹介します。
静的な埋め込みモデルの限界を超え、逐次更新される潜在メモリで文脈に応じた動的ベクトルを生成する「EvoEmbedding」を解説。Qwen3-Embedding-8Bなど大規模モデルを凌ぎ、RAGやエージェント記憶に直接応用できます。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム