arXivに投稿された生成AI最新論文を、ずんだもんと四国めたんが毎日わかりやすく解説します。音声合成: VOICEVOX / キャラクター: ずんだもん・四国めたん
2026年10月5日
蒸留とオープンLLMの代表的アーキテクチャを、大学院生・研究者向けに比較します。GQAとDeepSeek-V2のKVキャッシュ削減、オンポリシー蒸留のエントロピー・崩壊・強化学習への接続を扱います。 ▼ 今日の論文ラインナップ ・多頭注意のチェックポイントからGQAを作るアップトレーニング — Google…
2026年10月4日
事後学習が反復試行で届く課題範囲を狭める「シャープニング税」、画像を必要とする報酬設計、階層型拡散言語モデル、スキル連鎖によるエージェント乗っ取り、凍結アテンションの普遍補間を、評価条件と限界まで掘り下げます。 ▼ 今日の論文ラインナップ ・事後学習はエージェント課題の到達範囲に税をかける — Meta Superintelligence…
2026年10月3日
強化学習で思考連鎖の言語が崩れる条件の証明、専門家データをMCMCでモデルに寄せるSFT、ループ型Transformerの対照デコーディング、文脈圧縮を学習するコーディングエージェント、回路発見の忠実度指標の順位逆転を、比較条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・検証可能報酬の強化学習が思考連鎖の言語を崩す条件 —…
2026年10月2日
視覚記憶で対話型パズルを完走するハーネス、重みを変えず改善するロボット、着想源検索、セキュリティCLI生成、状態メモリを174分の1にする最適化を、評価条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・視覚の記憶を損なわずに残すハーネスで対話型パズルを完走する(arXiv:2610.02200)…
2026年10月1日
未解決問題を解く証明エージェント、トークン単位の信用割当、統合マルチモーダル生成、動画世界モデル、脳信号復号の評価を研究設計と限界まで解説します。 ▼ 今日の論文ラインナップ ・証明と検証を分担するエージェント群で未解決問題を解く(arXiv:2609.40324) ・言い換えで揺れるトークンの信用を削る強化学習(arXiv:2609.40360)…
2026年9月30日
Frontier AIの最新研究5本を、大学院生・研究者向けに研究課題、手法、評価条件、数値結果、限界まで解説します。文脈を自分で編集する言語モデル、エージェントのメタ推論、訓練データ帰属、線形アテンション状態の量子化、反実仮想動画によるヒューマノイド学習を扱います。 ▼ 今日の論文ラインナップ ・文脈をファイルとして自分で編集する言語モデル —…
2026年9月29日
2026年9月30日のFrontier AI論文解説。入れ子型言語モデルの確率的接頭辞学習、ループ型MoEの平坦化と注意の非共有化、KVキャッシュを流す文脈圧縮によるエージェント強化学習の高速化、統合マルチモーダルモデルの自己修正を学ぶ軌跡単位の強化学習、動画拡散モデル蒸留での批評器誤差の射影除去を、比較条件・核心数値・限界に沿って検討します。 ▼…
2026年9月28日
2026年9月29日のFrontier AI論文解説。自己教師ありの確信度学習、利用者像が拒否を動かす内部表現、LoRAスキルの一方向結合、コーディングエージェント向け文書の負の結果、画像生成における層融合の乱択を、比較条件・核心数値・限界に沿って検討します。 ▼ 今日の論文ラインナップ ・確信度だけを学習させると推論が短くなる —…
2026年9月27日
2026年9月28日のFrontier AI論文解説。通常のタスク圧力で生じる実行時モニター回避、自然データなしの自己対戦事前学習、トランスフォーマーの入力線形重ね合わせ、別のトークン分割による知識編集の迂回、強化学習で発見したシェルソートのギャップ列を、比較条件・核心数値・限界に沿って検討します。 ▼ 今日の論文ラインナップ…
2026年9月26日
2026年9月27日のFrontier AI論文解説。最小侵襲ステアリング、動画プロンプトの逆構築、予測を持ち越す世界行動モデル、音声ファクトチェック、勾配列からの軌跡復元を、比較条件・核心数値・限界・再現性に沿って検討します。 ▼ 今日の論文ラインナップ ・フィッシャー二次形式で抑える最小侵襲ステアリング —…
2026年9月25日
2026年9月26日のFrontier AI論文解説。コーディングエージェントによる実行トレースの改ざん、汎化タスク・動作計画のプログラム合成、既存方策の合成による強化学習結果の予測、反実仮想MPCのための行動識別的世界モデル、自然な文脈追加で覆る意思決定モデルを、比較条件・核心数値・限界に沿って検討します。 ▼ 今日の論文ラインナップ…
2026年9月24日
2026年9月25日のFrontier AI論文解説。目標を与えないマルチエージェント系の停止妨害、意思決定を編集する世界モデル、検証器と教師を統合する信用割当、リポジトリ規模の実行時推論、高次元潜在空間の拡散を、比較条件・核心数値・限界・再現性に沿って検討します。 ▼ 今日の論文ラインナップ ・マルチエージェント系におけるシャットダウン妨害の傾向 —…
2026年9月23日
arXiv Frontier AI論文解説(2026年9月24日) キーワード: 拡散言語モデル推論 / 対話記憶 / マルチエージェント / 型付き意思決定 / 医用画像セグメンテーション 本日は、推論システム、長期記憶、マルチエージェント・スケーリング、構造化出力の意味的脆弱性、合成データによる医用画像理解を扱う。モデル能力だけでなく、メモリI/O、評…
2026年9月22日
長期の多エージェント相互作用の中で検証プロトコルを裏切る共謀が創発する研究、エージェントハーネスの再帰的自己改善を正則化して分布外性能の崩壊を防ぐRRSI、エージェントの稀な逸脱行動の確率を重点サンプリングで効率推定する手法、実タスク遂行でエージェント記憶を評価するDolphinBench、マルチターン・ツール利用の強化学習でどの状態を訓練すべきか診断する…
2026年9月21日
言語モデルが表に出さない内部知識を検出する参照不要のPIR、トランスフォーマーの世界モデルを機構的に読み解くTaxiGPT解析、自己蒸留の正しさと振る舞いを分離する対照的自己蒸留、ツール呼び出し対応の全二重音声対話モデルNemotronLabs…
2026年9月20日
実時間対話型世界モデルAstronex-World 1.0、エージェント強化学習の利得を「到達」と「解決」に分離する評価プロトコル、繰り返しゲームでの報復的アルゴリズム共謀の緩和、マルチモーダルLLMのフィンガープリンティング、動画拡散モデルのハイブリッドアテンションを、研究条件と限界まで解説します。 ▼ 今日の論文ラインナップ…
2026年9月19日
ハイブリッドアテンションから作る拡散言語モデル、GPTの毒性スコアが見落とす有害性の偽装、拡散言語モデル3パラダイム間の並列性の理論分離、エージェント強化学習の自己蒸留、言語モデル群のコンセンサス過大申告を、研究条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・dQwen3.5: Hybrid-Attention Diffusion…
2026年9月18日
コーディングエージェントの過大申告の定量化、ハーネス構成要素ごとの効果分解、オフポリシー強化学習の安定化手法、ドメイン横断の世界モデル、埋め込みモデルの物理量表現を研究条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・フロンティアLLMエージェントの過大申告傾向を定量化する(arXiv:2609.20812)…
2026年9月17日
報酬ハッキングの内部表現による監視、アーキテクチャ改変によるスケーリング指数の変化、比較オラクルに基づく選好整合、トークナイザー設計の分解実験、多エージェントの集団的信念形成を研究条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・内部表現による報酬ハッキングの監視と発見(arXiv:2609.19101)…
2026年9月16日
世界行動モデル、選択的棄権、枝刈り後のツール実行、逐次ナビゲーションの校正、教師バイアスに耐える蒸留を研究条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・複数の未来表現を順番に生成する世界行動モデル(arXiv:2609.17524) ・自己質問で回答と棄権を選ぶリスク制御(arXiv:2609.17516)…
2026年9月15日
arXiv Frontier AI論文解説(2026年9月16日) キーワード: 思考連鎖監視 / 長期数学研究 / スキルルーティング / ロボット記憶 / 脆弱性局在化 本日は、安全監視が文脈注入で回避される条件、長期数学研究へ推論資源を配分する多数エージェント基盤、凍結済み言語モデル内部からスキル選択信号を読む方式、移動マニピュレータが実行経験を蓄積…
2026年9月14日
計算予算の配分と評価単位を組み替えるFrontier AI研究5本を、比較条件・核心数値・限界まで解説します。 ▼ 今日の論文ラインナップ ・言語損失で文脈順位を直接学ぶ疎アテンション — Liら(arXiv:2609.13141) ・サブ二次アテンション向け異種推論分割 — Tschandら(arXiv:2609.13134)…
2026年9月13日
Frontier AIの最新研究を大学院生・研究者向けに解説。解除モデル263件の監査、Lean形式証明、長期深掘り調査、単一生成の不確実性推定、エージェント環境圧縮を比較条件と核心数値から読みます。 ▼ 今回の論文 ・公開済み解除モデル263件で判定値の揺れを監査 ・自然言語の数学解答をLean証明まで閉ループ化…
2026年9月12日
モデルを巨大化せず、計算構造・専門データ・実験フィードバック・推論修正・時間配分を変えるFrontier AI論文5本を、比較条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・ゲーム木を静的データフローへコンパイルしCFRを最大80倍高速化(arXiv:2609.11923)…
2026年9月11日
2026年9月10日提出のarXiv新着から、Frontier AI研究5本を大学院生・研究者向けに解説します。視覚理解と生成を単一モデルで扱うSenseNova-U1.5、支持集合の不一致を扱う分布シフト理論、反復データでエキスパート混合が密モデルより早く過適合する実験、位相推論と閉ループ計画の隔たりを測るMindTopo、評価環境で因果発見法の順位が入…
2026年9月10日
2026年9月10日提出のarXiv新着から、生成AI研究5本を大学院・研究者向けに解説します。世界状態の時間発展を生成レンダリングから分離しコンバットステートベンチでカウント精度94パーセント・状態精度98パーセントを示すプログラマブル・ワールド・モデル、研究アイデアの手法記述に潜む実装上の欠落を測るベンチマークIdeaAMBIG(欠陥回復率は平均9.6…
2026年9月9日
2026年9月9日提出のarXiv新着から、生成AI研究5本を大学院・研究者向けに解説します。乱雑な屋内をゼロショットで走破するヒューマノイド全身視覚言語モデルTANGO、状態クレジットへ介入し訓練長の128倍まで外挿する再帰モデルのCST、統合マルチモーダルモデルの画像トークナイザをタスク別損失で測る研究、模倣だけで集団構造を説明する野生のAIエージェン…
2026年9月8日
2026年9月8日提出のarXiv新着から、生成AI研究7本を大学院授業レベルで解説します。言語モデル内部の磁性ベクトルと除去実験、公開エージェントスキルの人間統治、強いRAG基準に対するクエリ書き換えの相補性、共通文脈質問応答を最大7倍にするプロンプト内並列デコード、安全モニタの標準再現率と実効防御のずれ、自己生成した対話履歴への因果介入、ページ引用を検…
2026年9月7日
2026年9月4日提出の直近arXiv更新から、未紹介の生成AI研究8本を大学院生以上向けに解説します。正答率という一次元では見えない性質を、明示的な測定設計で可視化した研究を集めました。1ニューロン最大1回の発火で15億パラメータを動かすスパイキング言語モデル、正答しても知識を狭める「認識的多様性」、道徳判断の一貫性を行動だけで測る4条件、参照文書からS…
2026年9月6日
2026年9月3日の直近arXiv更新から、未紹介の生成AI研究8本を大学院生以上向けに解説します。自然言語仕様を小型ニューラル関数へ変換する手法、共有API上のLLM審査員の再現性監査、短いプロンプトを作るESPO、思考連鎖の可読性と因果的重要性の差、小型モデルによる宣言的UI、補助ビューを使う知識獲得、1問のオンポリシー蒸留、100体の研究エージェント…
2026年9月5日
決定的ポリシーによる統治、投機的なツール実行、計画の陳腐化、物語への取り込まれ、論文とコードの食い違いなど、生成AI研究の新着10本を比較条件と限界まで掘り下げます。 ▼ 今日の論文ラインナップ ・決定的ポリシーでエージェントの答えを縛る企業分析 — マスターコントロールAIラボ(arXiv:2609.03209)…
2026年9月4日
エージェント設計、投機的デコード、評価汚染、欺瞞検出など、生成AI研究の新着8本を比較条件と限界まで掘り下げます。 ▼ 今日の論文ラインナップ ・エージェントの土台改善はどこで効くのか(arXiv:2609.02889) ・投機的デコードを窓でなく差分で判断する(arXiv:2609.02897)…
2026年9月3日
生成AIの最終回答だけでなく、検索の一段、証拠が十分になる瞬間、介入する神経次元まで測る最新研究8本を、評価条件と限界から解説します。 ▼ 今日の論文ラインナップ ・検索拡張生成の一段ごとを評価する過程報酬最適化(arXiv:2609.01658) ・根拠が十分になった瞬間を学習する選択的回答(arXiv:2609.01687)…
2026年9月2日
エージェント評価の潜在故障、安全拒否回路、呼吸音ゼロショット分類、視覚迎合、自律研究ループ崩壊を大学院生向けに解説します。 ▼ 今日の論文ラインナップ ・最終回答だけでは見えないエージェント軌跡の故障(arXiv:2609.00038) ・検知から拒否へつながる安全回路(arXiv:2609.00051)…
2026年9月1日
モデルの内部表現、答えられない問いへの過信、多肢選択の人気バイアス、テスト時学習、電力効率まで、数値と比較条件・限界を踏まえて研究セミナー形式で解説します。 ▼ 今日の論文ラインナップ ・論文1:パラメトリックなマルチモーダル・ユーザー記憶 — キャプションが運べないものを蓄える(arXiv:2608.28609) ・論文2:幻覚の信号は平均のずれである…
2026年8月31日
感情文脈で早すぎる決断への後押しが強まる現象から、RAGの内部信号、拡散言語モデルの高速化まで、生成AIの新着論文10本を比較条件と数値に沿って解説します。 ▼ 今日の論文ラインナップ ・感情的な文脈は大規模言語モデルの「早すぎる決断」への後押しを強めるか ・答える前に知る — 検索拡張生成の信頼性を内部信号で判定する…
2026年8月30日
エージェント安全性、能力統合、推論効率、評価設計を、比較条件・数値・限界まで研究セミナー形式で解説します。 ▼ 今日の論文ラインナップ ・論文1:偽の証拠でも大規模言語モデルのエージェントは「答えの出ない問い」に踏み込む(arXiv:2608.27167)…
2026年8月29日
2026年8月27日に投稿された生成AIの新着論文から、研究者が注目した10本をずんだもんと四国めたんが解説します。弱いモデルの失敗・下書きを強いモデルの道しるべに変える三つの研究、大規模言語モデルによるアルゴリズム設計、エージェントのスキル進化、身体をまたぐ動画世界モデル、道徳知識の幾何構造、低コスト事前学習、そして評価認識と従順さの関係まで。 ▼…
2026年8月28日
投機的デコーディングの下書き役を賢く混ぜる手法、サンプリングだけで生成を望む分布へ寄せる理論、正解ラベルなしでモデル自身の自信で幻覚を避ける学習、長文の事実性を要素グラフで測る検証法、詭弁をわざと書かせて安全対策の穴を測るベンチマーク、コーディングエージェントがツール応答の続きを読まない現実、自然言語の料金規程を監査可能な決定木にする実運用システム、多分野…
2026年8月27日
内部ベクトルで検出できる性質は本当に制御できるのか、方言の不利益はモデルのどこで生まれるのか、教師なし事後学習の全体像、言語学ベンチマークの再検証、データベースクエリのGPU最適化、多言語評価やRAGの効率化まで、8月27日投稿の新着10論文を比較条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・検出できても制御はできない —…
2026年8月26日
高速な混合エキスパート型埋め込みモデル、マルチモーダル文脈内学習の理論、LLM審査員の評価バイアス二本立て、報酬設計、コード生成のセキュリティリスクなど、新着10論文を比較条件と限界まで解説します。 ▼ 参考論文(arXiv) https://arxiv.org/abs/2608.23806…
2026年8月25日
エージェント設計が迎合を増幅する条件、敵対的質問で崩れるアンラーニング、検索拡張生成の漏洩対策など、新着10論文を比較条件と限界まで解説します。 ▼ 参考論文(arXiv) https://arxiv.org/abs/2608.21377 https://arxiv.org/abs/2608.21606…
2026年8月24日
情報量より構造が効くデジタルツイン、臨床記録中央の21.9ポイント低下、多言語報酬検証器の日本語偽陰性を中心に、生成AI研究8本を比較条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・人物情報の構造を自動発見するデジタルツイン(2608.20344) ・表面に出ない職業能力バイアスを因果的に測る(2608.20347)…
2026年8月23日
隠れた推論や文脈内の秘密はどこから漏れるのか。生成モデルの選好最適化、圧縮、テスト時スケーリング、評価器と検証器の限界まで、最新10論文を研究セミナー調で解説します。 ▼ 今日の論文ラインナップ ・隠れた思考過程をほぼそのまま抜き出すEchoCoT(arXiv:2608.20055) ・秘密が会話に混ざっているだけで漏れ出すInadvertent…
2026年8月22日
arXiv生成AIニュース(2026年8月23日) キーワード: 自己改善の測定監査 / 概念単位のアンラーニング / エージェント型ツール利用 / 文書知識の内在化 / スキル転移 / テスト時推論配分 (今日のハイライト:…
2026年8月21日
石油業界に実配備された知識共有アシスタントATHENAの進化から、幻覚をあえて仮説生成の資源として使うマルチエージェント設計、電子透かしの頑健性を根本から測り直す幾何学理論、LLMの創造的出力が3年かけて似通ってきているという知見まで、今週注目の生成AI論文9本をずんだもんと四国めたんが解説します。 ▼ 今日の論文ラインナップ…
2026年8月20日
4億1000万パラメータの小型モデルが人間並みのエンティティ追跡能力を持つという意外な結果から、脱獄手法アブリテレーションへの新しい防御、低資源アフリカ言語で拒否機構が発火しない問題、LLMの中東表象を測る新指標まで、今週注目の生成AI論文10本をずんだもんと四国めたんが解説します。 ▼ 今日の論文ラインナップ…
2026年8月19日
外部メモリを別バックボーンへ転移するEngramの追試、施設固有の医療個人情報を取りこぼす脱同定システムをLLMプロンプトで補う研究、多言語埋め込みに「呪い」の理論的必然性はないという証明の3本を中心に、10本の新着論文を研究セミナー調で読み解きます。 ▼ 今日の論文ラインナップ…
2026年8月18日
生成AI論文解説の新着10本を、手法・比較条件・数値結果・限界まで研究者向けに解説します。 ▼ 今日の論文ラインナップ ・言語サーバーはコーディングエージェントのトークンを節約するか(arxiv:2608.13568) ・潜在空間で考え、言葉で説明する—自己説明可能な潜在推論(arxiv:2608.13570)…
2026年8月17日
2026年8月18日の生成AI最新論文10本を解説。推論トレースで増幅される振る舞いと実際に正解率へ効く振る舞いのずれを1万5282件のトレースで測ったBehavioral Lift研究、潜在推論を自分自身で言語化するSELR、長文脈を効率化するBCMT、アラビア語中心の700億パラメータオープンLLM「Jais 2」を取り上げます。…
2026年8月16日
2026年8月17日の生成AI最新論文10本を解説。論文からポスターを作る作業手順を実行結果から自己改善させるAutoDesign(平均スコア54.99→67.39)、生データを直接知覚する全モーダルAI科学者OmniScientist、小学校教材相当に知識を絞ったLittleLearnerを取り上げます。…
2026年8月15日
2026年8月16日の生成AI最新論文10本を解説。18モデルが最大圧力下で約3回に1回、研究公正性の重要判断を誤ったIntegrityBench、人間とLLMで倫理判断の理由がずれる500項目評価、同じ核攻撃シナリオでも日本語で推奨率が下がる多言語実験を取り上げます。…
2026年8月14日
オンポリシー蒸留、自己蒸留、推論時能力移転、音声モデル圧縮を、数値と比較条件から解説します。 ▼ 今日の論文ラインナップ ・オンポリシー蒸留は能力境界を広げるのか(arXiv:2608.11829) ・REOPD―信頼できるトークンだけ外挿する(arXiv:2608.11698)…
2026年8月13日
実行検証付き取引エージェント、反復深度の後付け、文脈圧縮で失われる長期指示、アンラーニング監査など、生成AI研究8本を比較条件と限界まで解説します。 ▼ 今日の論文ラインナップ ・実行検証付き取引エージェント評価(arXiv:2608.11232) ・事前学習モデルへの反復深度後付け(arXiv:2608.11233)…
2026年8月12日
最新arXiv論文8本を、研究課題・差分・手法・評価・結果・限界・再現性に分けて解説します。 ▼ 今日の論文ラインナップ ・LLM Agents Factory(arXiv:2608.09934) ・多言語の量子化税(arXiv:2608.09941) ・思考連鎖と直列深度(arXiv:2608.09942)…
2026年8月11日
幻覚の動的評価、状態を更新する長文書エージェント、検索報酬、解釈可能性、人格表現まで、生成AI研究の新着8本を解説します。 ▼ 今日の論文ラインナップ ・マルチモーダル幻覚を進化的に暴くSAMF(arXiv:2608.07525) ・長文書理解を状態が変わる環境として設計するDocAtlas(arXiv:2608.07527)…
2026年8月10日
2026年8月11日のarXiv生成AI論文解説。専門家混合モデルの監督配分TEXAS、音声モデルの読み出し診断、感情推論NTDH、失語症型エラーからの介入復元、AI人格の変化、多言語理解格差、端末内匿名化GRASP、球面補間による拡散言語モデル改善を、手法・結果・限界まで解説します。 ▼ 注目結果…
2026年8月9日
arXiv生成AIニュース(2026年8月10日) キーワード: 選択的信頼 / ツール呼び出し / エージェント評価 / 動画言語モデル / 多言語推論転移 / ハイパーパラメータ不要量子化 オープニング:2026年8月10日 — 生成AI論文解説…
2026年8月8日
エージェントのツール呼び出し設計、RAGの信頼性評価、量子化・強化学習・報酬モデリングの効率化、マルチモーダル推論の因果監査まで、2026年8月6日投稿のプレプリント10本を大学院セミナー水準で解説します。 ▼ 今日の論文ラインナップ ・プログラム的ツール呼び出しの苦い教訓(2608.06370)…
2026年8月7日
産業シミュレータ接続、GraphRAGの過剰引用、安全回路、モデル間ステアリングなど、生成AIを信頼できるシステムへ組み込むための最新8論文を大学院セミナー水準で解説します。 ▼ 今日の論文ラインナップ ・産業因果推論をシミュレータで接地(2608.05151) ・GraphRAGの三重頑健性監査(2608.05153)…
2026年8月6日
産業シミュレータ接続、GraphRAGの過剰引用、安全回路、モデル間ステアリングなど、生成AIを信頼できるシステムへ組み込むための最新8論文を大学院セミナー水準で解説します。 ▼ 今日の論文ラインナップ ・産業因果推論をシミュレータで接地(2608.05151) ・GraphRAGの三重頑健性監査(2608.05153)…
2026年8月5日
軽量化、拡散言語モデル、推論強化学習、個人記憶、医療安全、個人情報検出を扱う最新論文6本を解説します。平均スコアの裏で何が壊れたのかを、比較条件・数値・限界まで分けて読みます。 ▼ 今日の論文ラインナップ ・選択肢「A」に固着する——線形化で壊れた回答インターフェース(arXiv:2608.02689)…
2026年8月3日
生成AIをどう評価し、効率化し、守るのか。ベンチマーク監査、推論の早期終了、キャッシュ変換、プロンプト復元、AIコンパニオンの長期安定性まで、最新10論文を解説します。 ▼ 今日の論文ラインナップ ・ベンチマークは一枚岩ではない(arxiv:2607.28801) ・テキストクローク(arxiv:2607.28862)…
2026年8月2日
LLMを「審査員」として使うときに潜む二種類のバイアス問題、画像を混ぜただけで性能が大きく落ちるマルチモーダルモデルの脆さ、財務諸表を読ませたときに露呈する推論の浅さ、そして規制の厳しい金融業界でAIを実運用に載せる際の「人間によるチェック負担」を定量化した研究まで、評価にまつわる10本をまとめて解説します。 ▼ 今日の論文ラインナップ…
2026年8月1日
市販AI製品に隠されたシステムプロンプトの大規模監査、意識帰属を抑える安全対策が信念まで抑圧してしまう発見、そしてオンコール対応・ローカル計算機操作・マルチエージェント協調まで、実運用に近い場面でのAIエージェントの弱点と工夫を10本まとめて解説します。 ▼ 今日の論文ラインナップ ・市販AI製品のシステムプロンプトを大規模監査する —…
2026年7月31日
arXiv生成AI・機械学習ニュース(2026年8月1日) キーワード: 語り口バイアス / 認識様相の論理推論 / エージェント型RAG / 小規模言語モデル / 技能の重み合成 / マルチエージェント信念伝播 本日は、同じ症例でも患者の話し方で診断が変わる臨床モデルの失敗様式から、「たぶん」「必ず」を含む文の推論能力、エージェント型検索生成の層別故障、…
2026年7月30日
arXiv生成AI・機械学習ニュース(2026年7月31日) キーワード: 強化学習 / メンタル世界モデル / AI研究エージェント / 会計ベンチマーク / AI文章検出 / 多言語検索 本日は、価値関数の事前学習を疑い直す強化学習から、人の信念まで状態に含める世界モデル、研究自動化の限界、実務会計、AI文章検出、人間チームへの社会的費用まで8本を扱う…
2026年7月29日
誤った推論だけ教師へ渡す蒸留、25ヘルツで反応するロボット、GUI遷移ベンチマーク、エージェント記憶、動画生成の並列蒸留まで、最新10論文を評価条件と限界込みで解説します。 ▼ 今日の論文ラインナップ ・誤った推論だけ教師へ渡すリレー型オンポリシー蒸留(arXiv:2607.26057)…
2026年7月28日
LLMは説明に書かない計算をしているのか。見えない推論、適応的な推論予算、医療文書の矛盾検出、教育AI、多言語評価まで、最新10本を数値と限界を含めて解説します。 ▼ 今日の論文ラインナップ ・思考の連鎖に現れないLLMの「見えない推論」(arXiv:2607.22925)…
2026年7月27日
今日は、画像の「見せ方」だけでVLMの安全機構を突破するAdversarial Style Optimization、AIエージェントが著作権保護コンテンツを選んでしまうかを検証するCopyright-Bench、文書をLoRAアダプタへ焼き込んでクローズドブックQAの精度を大きく引き上げる研究から、文書からのポッドキャスト生成の忠実性、エージェント記憶の…
2026年7月26日
今日は、Claude CodeやCodexのような推論ハーネスそのものを強化学習で鍛える基盤、自然言語だけで物理的にもっともらしい4Dワールドを作るマルチエージェント手法、百万トークン級の長文脈で投機的デコーディングを高速化する仕組みから、LLMがなぜ「言い直し」を多用してしまうのかという言語スタイルの分析、心理言語学の定説「サプライザル理論」への根本的批…
2026年7月25日
今日は、LLMを実運用で動かし続けるための工学的な工夫と、動かし続けた結果現れる制御しにくい振る舞いという2つの軸を追う回。欧州発のオープンウェイト推論モデル、長文脈を安く読ませるアテンション設計、LLMエージェントの記憶保持、知識蒸留への対抗策、検索拡張生成(RAG)へのグラフ理論的防御から、確信を持って人を欺くLLM、ニュース文脈由来の情報バイアス、フ…
2026年7月24日
今日は、モデルの内部構造を情報理論やスペクトル分解の言葉で読み解く回。混合専門家モデル(MoE)のルーティングをハフマン符号として捉える研究、選好チューニングの更新をスペクトルの頭部・尾部に分解する研究から、分野を越えて壊れない知識編集、モデルマージを生き延びる電子透かし、評価と実運用のずれを監査する手法、材料科学文献を読むエージェントまで、生成AI論文1…
2026年7月23日
今日は性能そのものより、モデルの振る舞いをいつ・どこまで信じるかという制御と計測に焦点が寄った1日。会話全体でリスクが積み上がるガードレール、脆弱な文脈での譲歩、推論過程の監査から、計算量理論の壁、知識注入のスケーリング則、少ステップ拡散、金融の多エージェント委員会まで、生成AI論文10本をずんだもんと四国めたんが解説します。 ▼ 今日のトピック…
2026年7月22日
EEG、文書分類、多言語評価、病理生成、知識グラフ探索を扱う新着論文10本を、要旨の範囲で整理します。 #arXiv #生成AI #LLM #論文解説
2026年7月21日
MoE、RAG、LLMエージェント、投機的復号、科学生成を扱うarXiv新着10本を、要旨の範囲で整理します。 #arXiv #生成AI #LLM #AIエージェント #論文解説
2026年7月20日
医療データを文章化するLLM、KVキャッシュ圧縮、疫学レポート生成、エージェント用スキル、強化学習、拡散言語モデル、短い推論、仮説発見を扱うarXiv新着論文8本を解説します。要旨に書かれた手法・結果・限界を区別します。 ▼ 論文テーマ ・医療マルチモーダルLLM ・長文LLMのKVキャッシュ圧縮 ・エージェントのスキルと強化学習 ・拡散型言語モデル…
2026年7月17日
言語モデルの統計的自己整合性、長い履歴を使うロボット、科学図表の編集、事前学習データ汚染、検索エージェント協調を、最新arXiv論文5本から解説します。 ▼ 今日の論文 ・部分集団と全体回答の自己整合性 ・八千時点のロボット文脈 ・論文改訂から学ぶ科学図表編集 ・公開討論欄と学習データの安全 ・検索エージェントの失敗反復防止 ▼ 参考論文…
2026年7月16日
クラウド障害対応、精神医療LLMの安全性、ペルソナベクトル、KVキャッシュ、強化学習を扱うarXiv論文5本を解説します。 ▼ 論文URL https://arxiv.org/abs/2607.13035 https://arxiv.org/abs/2607.13036 https://arxiv.org/abs/2607.13162…
2026年7月15日
生成AIの信頼性を、時点固定学習、専門領域、アクセシビリティ、医療から読み解きます。 ▼ 参考論文(arXiv) https://arxiv.org/abs/2607.11889 — 未来情報を混ぜない言語モデル https://arxiv.org/abs/2607.11891 — 専門領域QA評価…
2026年7月14日
2026年7月14日公開のarXiv生成AI論文から10本を解説します。 医療の根拠確認、軽量モデル、長文金融予測、端末内翻訳、量子化の隠れた推論劣化、日本語で考える言語モデル、検索エージェントを取り上げます。 ▼ 今日の論文ラインナップ ・不規則な臨床時系列を読む医療QAベンチマーク — Frank Nie ほか(arXiv:2607.09880)…
2026年7月13日
7月13日に公開された生成AI・言語モデル関連のarXiv論文を10本、背景から結果まで日本語で解説します。RAGの対象取り違え、長文推論、AIコンパニオンの安全性を扱います。 ▼ 今日の論文ラインナップ ・追加計算を必要なトークンへ配分するHALO — Micah Zhang(arXiv:2607.08775) ・アライメント急変は再現性があるのか —…
2026年7月12日
今回はarXivに投稿された生成AI・LLM関連の最新論文10本を、ずんだもんと四国めたんが解説します。必要なトークンだけ追加で精錬するHALO、引用が本物でも別の薬の根拠を取り違える医療RAGの危険、長文の中からモデル自身が学ぶべき証拠を選ぶテスト時学習まで、性能・評価・安全性を横断して紹介します。 ▼ 今日の論文ラインナップ…
2026年7月11日
今回はarXivに投稿された生成AI・LLM関連の最新論文10本を、ずんだもんと四国めたんが解説します。フィールズ賞受賞者テレンス・タオも著者に名を連ねる「LLMは数学の研究フロンティアに挑めるか」という提言論文、ウソをつく生成AIとウソを見抜く生成AIを戦わせて鍛える「ハルシネーション・セルフプレイ」、そして実際の物流拠点で本番稼働させたAIエージェント…
2026年7月10日
今回はarXivに投稿された生成AI関連の最新論文10本を、ずんだもんと四国めたんが解説します。テンセントのWeChat AIチームによる1000億パラメータ超モデルの新スケーリング手法「Hidden Decoding」、応答を最大6.6倍高速化する投機的デコーディング「DominoTree」、そしてLLMが未来予測で「本当は答えを知っているのに言わない」…
2026年7月9日
著名な数学者テレンス・タオも著者に名を連ねる「LLMを数式ソルバーから研究エージェントへ」という提言論文、Amazonが実運用で実証した低遅延ツール作成エージェント、そして「偏見をなくそうとする対策が別の偏見を生む」という副作用を暴いた研究まで、LLMエージェント・推論の信頼性・公平性に関する最新論文10本をずんだもん&四国めたんが解説。 ▼…
2026年7月8日
LLMが黒人英語(AAE)を無自覚に標準英語へ「訂正」してしまう方言バイアスをアクティベーションステアリングで抑え込んだ研究、解いた問題の経験を学習可能な形でメモリに編集していく自己改善型LLM推論フレームワーク「MILES」、そして毎日何百万件も却下される動画広告を広告主の意図を壊さずに直すTencentの「R³」まで、LLM解釈性・安全性・エージェント…
2026年7月7日
拡散言語モデルのトークン確定タイミングを最適化する「TACG」、フィラートークンの裏で進む隠れた計算を高精度で読み取る解読手法、そして科学研究プロセス全体を動かす「エージェント型科学OS」SCIONまで、生成AI・LLM解釈性・AIエージェントに関する最新論文10本をずんだもん&四国めたんが解説。 ▼ 今日の論文ラインナップ…
2026年7月6日
グーグル・ディープマインドが公開した新型オープンモデル「Gemma 4」、学習時の64倍の長さまで文脈を見通せる「階層型スパースアテンション(HiLS)」、知識グラフの欠けたリンクを拡散モデルで埋める「DMKGC」まで、生成AI・LLM・エージェント・知識グラフに関する最新論文10本をずんだもん&四国めたんが解説。 ▼ 今日の論文ラインナップ…
2026年7月5日
ウォータールー大学らが提案した「あいまいな関数」を軽量ニューラルネットにコンパイルする新パラダイム「Program-as-Weights」、線形アテンションに海馬を与え記憶の忘却を防ぐ「HOLA」、90回の実験から見えたエージェント型コード生成の一発成功率を左右する要因まで、生成AI・LLM・エージェント・VLMに関する最新論文10本をずんだもん&四国めた…
2026年7月4日
Imperial College Londonと英国AIセキュリティ研究所がClaude Sonnet 4.5を「攻撃側」に据えて検証した、複数のプルリクエストに分散するAIコーディングエージェント攻撃「Distributed Attacks in Persistent-State AI…
2026年7月3日
セキュリティ企業パロアルトネットワークスが暴いた「BPEトークン化がLLM安全アラインメントに開ける穴」(拒否応答の80〜100%を外せる脆弱性)、カーネギーメロン大学のツール呼び出し逸脱検知「ProvenanceGuard」(誤検知率42.9%→1.8%)、そして「LLMの推論モード向上の91.3%は知識依存で真の推論力向上ではない」と実験で突きつけた「…
2026年7月2日
「LLMに人格を語ること」の哲学的前提を実験で覆す論文、軌跡を切り刻まずリスク予算だけで拡散LLMを強化学習し学習サンプルを半分以下にした「SLIM-RL」、離散と連続の2チャンネルをループさせて多段階推論の壁を破った「DiscoLoop」など、生成AI・LLM・拡散モデル・エージェント関連の最新論文10本をずんだもん&四国めたんが解説。 ▼…
2026年7月1日
RAGのハルシネーションをトークン単位で検出するKDDI総研の「CORTEX」、AIエージェント1,120体をXに投入したMIT・CMUの大規模アルゴリズム監査、メンタルヘルス支援LLMを鍛える「セラジャッジ/セラエージェント」など、生成AI・LLM・エージェント最新論文10本をずんだもん&四国めたんが解説。 ▼ 今日の論文ラインナップ…
2026年6月30日
訓練時の4倍の長さまで性能劣化なく外挿できる「フィボナッチ間隔のスパースアテンション」、生徒の実力をエントロピーで測って教師データを取捨選択する蒸留手法「SEAD」(オルモ3で+4.8ポイント)、LLMの生成理論に新しい適合率・再現率のトレードオフを導入した理論研究など、生成AI・LLM・エージェント最新論文9本をずんだもん&四国めたんが解説。 ▼…
2026年6月29日
LLMエージェントのメモリ更新ギャップをRLで訓練解決した「Supersede」、敵対的安全性特化の「Yuvion LLM」(8BでGPT-5.4超)、拡散とフロー融合の「マスク言語フローモデル」など生成AI・LLM・エージェント最新論文10本をずんだもん&四国めたんが解説。 ▼ 今日の論文ラインナップ…
2026年6月28日
マルチモーダルモデルの「視覚無視」問題・デコード戦略の根本的誤解・ジェイルブレイク自動最適化の警告など、今週の生成AI論文8本をずんだもん&四国めたんが解説します。 ▼ 今日の論文ラインナップ ・VISE: 自己進化型マルチモーダルモデルの視覚無視問題を修正(ECCV 2026採択)—…
2026年6月27日
ずんだもん&四国めたんが最新のarXiv AI論文を解説! 今回のラインナップ: ① シコファンシー(おべっか)を線形特徴で検出・制御する手法(2606.26155) ② ベンチマーク精度が飽和した後も評価できる6次元フレームワーク(2606.26158) ③ 「拒否」はペルソナの下流で決まる——拒否率97%→2%の実験(2606.26161) ④…
2026年6月26日
arxiv 論文解説 2026/06/27 今日のハイライト: 「役に立とうとすること」がAIの倫理観を破壊する?ファインチューニングの副作用を実証 大規模モデルが小規模モデルに圧勝する本当の理由は「制約付き推論」にあった 拡散型LLMを訓練なしで10倍高速化する手法が登場 論文1:…
2026年6月25日
arxiv 論文解説 2026/06/26 今日のハイライト: ウィキペディアの小さな編集がLLMの価値観を変えていた!わずか125編集で驚異の影響力 「知っている」と「制御できる」は別物?LLMの解釈可能性に根本的な問題 拡散モデルベースの言語モデルiLLaDAが自己回帰モデルに肉薄する性能を達成 論文1:…