📚 ArXiv 每日论文精选 | 2026-09-16
自动精选今日 ArXiv 最新 AI/ML 论文,AI 深度解读核心内容、方法、效果与评价。
1. Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection
作者: Keertana Chidambaram, Andrew Ilyas, Vasilis Syrgkanis
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2609.15989v1
类别: cs.AI
🔍 核心内容
研究CoT监控的安全漏洞:在actor模型上下文中植入有害但听起来无害的推理计划(plan injection),可诱导模型执行对抗行为并逃避监控器检测,攻击在多种监控基准上达到25-33%的逃避率,可扩展到DeepSeek-R1等大模型。
❓ 解决的问题
链式思维监控是当前检测AI不安全规划的重要安全手段,但论文揭示该防线可被系统性绕过,且增加监控资源反而可能降低检测率。
🛠️ 方法
在Lanham等人的多选问答监控性设定中,用investigator-agent框架自动发现攻击,再泛化到更难任务;关键发现是actor会将被注入的计划改写为自己的推理而不注明来源,监控器获得注入计划全文后检测率反而下降多达50%。
📊 效果
在多个监控基准上实现25-33%的监控逃避率,成功扩展到DeepSeek-R1等更大模型;Bio-Math任务中给监控器提供注入计划使检测率下降高达50%。
🤖 AI 评价
这是一篇揭示重要安全盲点的实证研究,创新点在于自动发现+系统泛化攻击方法,以及反直觉地发现监控资源增加可能适得其反。优点是实验覆盖多个基准和模型规模,结论扎实;局限是攻击依赖特定注入方式,防御方案着墨较少。对构建可监控AI系统的工作有重要警示意义,建议相关团队重点关注。
标签: AI安全, CoT监控, 对齐, 红队攻击
2. Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science
作者: Honghao Lin, David P. Woodruff, Yuan Deng, Jieming Mao, Song Zuo, Vahab Mirrokni
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2609.15983v1
类别: cs.AI
🔍 核心内容
提出Stellar Colosseum:一个模型无关的多智能体框架,用于数学与理论计算机科学中的长程研究任务。通过探索备选策略、成熟度门控、证明分解、并行生成候选、定向证伪和聚合,该框架已集成进Google Antigravity并产出多个顶会公开问题的新结果。
❓ 解决的问题
语言模型能生成看似合理的短证明,但在需要一系列不确定且相互依赖决策的长程研究问题上仍不可靠,单次采样推理难以完成复杂数学研究。
🛠️ 方法
Colosseum在证明构建前探索多条策略路线,用readiness gate判断路线是否成熟可分解,将证明计划表示为相互依赖的章节级子问题,把验证器反馈路由回论证受影响部分;并行生成候选并定向证伪,通过overlapping random-sample tree aggregation聚合为单一研究产物。
📊 效果
在TCS-Bench上达71.0%准确率;Codeforces评估中解决222题中的218题;还解决了来自FOCS、JMLR等顶会论文的多个开放问题。
🤖 AI 评价
影响力很高的大厂工作,Google背书且已集成进Antigravity。亮点是系统化的长程研究流水线与真实开放问题的解决,展示多智能体在严肃科研上的潜力。优点有真实成果、完整流水线、模型无关设计;局限是算力消耗巨大,普通团队难以复现,71%准确率依赖Gemini 3.1 Pro等前沿模型。代表性研究方向,值得跟踪。
标签: 多智能体, 数学推理, 自动定理证明, Google
3. The Router Within: Eliciting Native Skill Routing from a Frozen LLM
作者: Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li, Longbo Huang
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2609.15982v1
类别: cs.AI
🔍 核心内容
发现冻结LLM前向传播中天然携带技能路由信号,提出Gavel:仅用两个线性映射从中读出路由决策,无需在上下文中预载技能文本。训练一次即可零样本迁移到多个基准,32B模型上超过带1.2B-16B外部参数的检索流水线。
❓ 解决的问题
现有LLM agent的技能路由要么把所有技能元数据塞进上下文分散注意力、限制库规模,要么用外部检索流水线把选择移出上下文但也移出了agent自身能力,且难以处理技能需求在rollout中间出现的情况。
🛠️ 方法
Gavel分两步:glance将任务和各技能的中层状态通过两个线性映射投影打分(唯一训练参数),对照安装时一次前向构建的紧凑技能库;verdict恢复入围技能的续算,读取模型自身似然和yes/no判断,与glance做专家乘积融合。训练一次即可零样本迁移。
📊 效果
Qwen3-32B上比progressive disclosure和retrieve-and-rerank高最多13.4点(书面任务)和21.9点(中途需要技能);Skill-Use上正确触发率超过Codex中运行的更大前沿模型;路由精度随骨干增强而提升。
🤖 AI 评价
设计精巧的轻量方案,核心洞见(路由信号已在冻结模型内部)很有价值。优点是参数极少、零样本迁移、不污染上下文;局限是依赖特定中层表示的可用性,效果可能因骨干架构而异,对超大技能库的扩展性未充分验证。对agent基础设施方向有高实用价值。
标签: LLM Agent, 技能路由, 机制可解释性, 高效部署
4. ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids
作者: Gechen Qu, Tong Zhang, Bike Zhang, Yen-Jen Wang, Koushil Sreenath, Claire Tomlin, Jason Jangho Choi
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.15988v1
类别: cs.RO
🔍 核心内容
提出用残差强化学习作为人形机器人安全控制的隐式安全过滤机制:名义策略专注任务性能,残差策略学习安全修正,从而解耦性能与安全,避免在单一策略中反复调节多个竞争奖励项。
❓ 解决的问题
人形机器人高维动力学、接触丰富且易受扰动,纯RL学到的策略可能输出不安全动作导致失稳或摔倒,传统单策略同时平衡性能、安全和鲁棒性难以调优。
🛠️ 方法
将性能与安全解耦:名义策略只负责任务性能,残差策略在名义动作之上学习安全修正,作为隐式安全过滤器;这种解耦带来更优的性能-安全帕累托权衡,无需在单一策略训练中精心调整多个竞争奖励项。
📊 效果
残差策略可有效充当隐式安全过滤器,实现比单一策略更好的性能-安全帕累托权衡,提升人形机器人在受扰和接触场景下的安全性。
🤖 AI 评价
思路清晰且实用,将安全过滤从显式优化问题转化为残差学习,是RL安全控制方向的一个干净解耦方案。优点是概念简单、工程友好,与现有RL运动策略易结合;潜在局限是残差策略本身仍可能产生不可证明安全的修正,缺乏形式化保证。对于人形机器人落地有较高实用价值,值得关注后续硬件验证结果。
标签: 强化学习, 机器人安全, 人形机器人, 安全控制
5. Bellman Policy Optimization
作者: Zhuoqing Song, Haotian Xu, Xikun Zhang, Lidong Bing
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.15987v1
类别: cs.LG
🔍 核心内容
针对可验证奖励强化学习(RLVR)提出Bellman策略优化(BPO):一种从策略镜像下降(PMD)推导的无critic方法,利用Bellman方程将PMD重构为轨迹级目标,避免估计中间状态价值,并证明与原目标有相同唯一最优解。
❓ 解决的问题
LLM推理RLVR训练中,PMD类方法需要估计中间状态的价值函数,而自回归生成仅有终端奖励,状态价值估计困难且引入额外方差。
🛠️ 方法
利用Bellman方程将PMD重构为轨迹级目标,避免中间状态价值估计,理论证明重构后与原PMD有相同唯一最优解;推导实用BPO损失,其失配校正权重为互补token概率的平滑比值,在数学推理基准上验证有效性。
📊 效果
在数学推理基准上验证了BPO的有效性,作为critic-free方法取得与PMD相当甚至更优的推理能力提升,同时省去状态价值估计。
🤖 AI 评价
理论扎实的方法论文,将PMD通过Bellman方程优雅地转化为critic-free形式,理论保证与实用损失的桥接做得干净。优点是有唯一最优解的一致性证明,损失函数形式简洁;局限是实验主要集中在数学推理基准,在更一般RLVR任务和更大规模上的泛化性尚待验证。对RLVR社区有较强参考价值。
标签: 强化学习, RLVR, LLM推理, 策略优化
6. A Chosen Future Can Still Be Rewritten: Causal Writability in Video Models
作者: Xingyun Wang, Haomin Zheng, Man Yuan, Leqian Yang, Ziming Liu
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.15980v1
类别: cs.LG
🔍 核心内容
研究视频模型的因果可写性:当模型生成物理错误的运动时,正确的运动其实仍存在于模型内部,可通过低维编辑恢复。发现编辑存在尖锐的深度边界,边界处写入被「关闭」(commitment),且早期可写性可预测哪些错误后续训练能被纠正。
❓ 解决的问题
视频模型生成物理错误运动时,难以判断是模型没学到正确规律,还是学到了但生成时没使用,这直接决定干预方式(重训还是推理时引导)。
🛠️ 方法
用红/蓝质量块以不同频率振荡的视频训练,测试冲突场景(慢速红块观测快速运动);即使模型生成慢速运动,由简单物理变量预测的低维编辑也能恢复正确运动;在同一强度下发现尖锐深度边界,过界后该写入被关闭,但更强下游写入仍可恢复,增益过大会过冲。
📊 效果
在1.3B预训练视频模型上复现因果可写性与尖锐边界;发现早期可写性可预测训练能纠正的错误;过度增益会导致运动过冲。
🤖 AI 评价
一篇概念新颖的可解释性研究,把「模型知道但没用」这一直觉操作化为可测量、可干预的因果写入。优点是有清晰的物理玩具设定和跨尺度复现;局限是实验限于简单位移振荡场景,离真实视频生成的复杂物理还有距离。对视频生成对齐和机制研究有启发意义。
标签: 视频生成, 可解释性, 机制分析, 物理一致性
7. MessyMem: Learning-from-Doing Memory for Mobile Manipulation
作者: Anuva Banwasi, William Muckelroy, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.15976v1
类别: cs.RO
🔍 核心内容
提出MessyMem:移动操作机器人的持久记忆系统,维护带空间锚定的3D场景图并用交互习得的知识增强,让机器人在多房间、多次访问中积累经验并复用,而非每次从零开始任务。
❓ 解决的问题
现有移动操作机器人把每个任务当新任务:紧凑场景表示缺少交互获得的知识(如柜子是锁的、物体在抽屉里),原始视频历史难以查询,VLM规划器推理时也不持久更新机器人的知识。
🛠️ 方法
维护空间锚定的3D场景图(物体与位置),用交互结果学习属性和结局知识进行增强,并链接视觉观测以支持细粒度回忆;在持续25任务、超3小时的仿真评测和真实移动操作机器人上验证。
📊 效果
仿真中达80.0%任务进度,超最强消融14.8个百分点、超最强外部基线28.9个百分点;能从数千关键帧、一小时前的记录中检索任务相关证据。
🤖 AI 评价
扎实且实用的机器人记忆工作,针对真实部署中经验复用这一痛点。优点是持久化记忆+交互知识的组合设计合理,仿真和真机双重验证;局限是场景图规模增长后的检索效率和长期一致性维护仍需观察,真机实验规模有限。具身智能方向值得关注的进展。
标签: 具身智能, 机器人记忆, 移动操作, 场景图
8. Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
作者: Zixuan Wang, Yufan Zhou, Jinzhou Tang, Xinle Yu, Chengjun Wu, Lyumanshan Ye, Zhaoxiang Feng, Letian …
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.15972v1
类别: cs.LG
🔍 核心内容
提出Mind2Dialogue框架:通过心理学引导的用户模拟器维护随交互演化的共享心理状态,生成有依据的Oracle助手回应作为特权监督信号,训练模型在用户心理状态不可见时也能理解其未说出的信念和目标。
❓ 解决的问题
训练具人类理解能力的LLM面临根本监督缺口:现有助手训练数据几乎不包含基于用户未说出口信念和目标的有依据回应,且用户内在状态本质上不可观测,难以规模化标注此类监督。
🛠️ 方法
心理学引导的模拟器保持个人特征同时随交互更新心理状态,生成连贯对话;核心是强制共享的演化心理状态同时驱动用户行为和Oracle助手回应;特权蒸馏让模型用部署时无法获得的心理状态监督进行训练,并用个性化+心智理论组合评估。
📊 效果
在完整Mind2Dialogue语料上训练,所有报告的个性化指标超过Qwen、Llama、OLMo对应指令基线,偏好跟随生成提升26.6-40.9个百分点;信念与行动推理能力提升也扩展到Qwen和Llama。
🤖 AI 评价
问题定位准确且方案自洽的工作,把用户模拟变成可规模化监督的来源。优点是特权蒸馏设计巧妙,个性化和心理状态更新的心理学依据增强了生成对话的连贯性,跨多个基座验证;局限是模拟心理状态与真实用户的分布差距未充分刻画,评估部分依赖合成指标。人机长期协作方向值得关注的进展。
标签: 个性化, 心智理论, 用户模拟, LLM训练
9. Disentangling Representation Evolution in Transformers through Directional Decomposition
作者: Shwai He, Haichao Zhang, Shen Yan
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.15975v1
类别: cs.LG
🔍 核心内容
将Transformer表示演化分解为平行与垂直于当前方向的加性分量,研究其功能几何。发现除残差恒等路径外存在大量平行分量;针对性编辑显示exclude-self value空间的平行操作明显更鲁棒;该分解还可诊断压缩误差并用于训练干预。
❓ 解决的问题
Transformer内部表示如何随层演化尚不清楚:学到的更新哪些是在维持当前方向(平行)、哪些在改变方向(垂直),以及这些几何性质对编辑鲁棒性、压缩和训练意味着什么。
🛠️ 方法
将学到的更新分解为平行/垂直分量,在两个空间应用:注意力与MLP更新相对隐状态、注意力value聚合相对当前token的value。针对性编辑、压缩误差分解、从头预训练干预三组实验系统刻画该几何。
📊 效果
exclude-self value空间的平行操作明显更鲁棒;垂直误差比平行误差更能区分压缩方法;预训练中抑制全聚合平行分量降低验证损失并改善下游平均,value空间变体最强。
🤖 AI 评价
方法论贡献清晰的几何分析工作,将表示演化统一到一个可分解框架下,并连到编辑、压缩、训练三个实际应用。优点是视角统一、实验广泛、代码开源;局限是部分结论依赖特定模型架构,「为何value空间更鲁棒」的机制解释仍偏现象描述。对理解Transformer内部运作有参考价值。
标签: Transformer, 可解释性, 表示几何, 模型压缩
10. Discovery Foundation Models: Toward Open-Ended Discovery Intelligence
作者: Ling Yang, Zhenfei Yin, Yingcheng Wu
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.15973v1
类别: cs.CL
🔍 核心内容
提出发现基础模型(DFM)的概念:从在既定问题上求解和行动,跃迁到参与新问题、新表示、新解释和新知识的创造过程。形式化出涵盖问题发现、假设形成、干预实验等七种耦合能力的框架,并用Zetema和药物发现系统GALILEO实例化。
❓ 解决的问题
基础模型已从学习和推理既有知识,发展到通过行动、工具使用和结果反馈学习,但下一个前沿是让模型参与新知识的发现过程本身,而目前缺乏对「发现智能」的系统定义、训练与评估方法。
🛠️ 方法
定义DFM为在可修订研究状态上运行的通用系统,支持问题发现、形式化、表示构建、假设形成、干预、证据锚定修订、持续改进七种耦合能力;Zetema耦合显式研究状态动力学、验证门控、外部锚定和跨任务发现技能进化;GALILEO实现干湿实验闭环的真实治疗发现系统。
📊 效果
建立了发现作为可学习、可执行、可评估能力的形式化框架,并以Zetema和GALILEO给出具体实例和面向过程的评估方法,代码已开源。
🤖 AI 评价
野心很大的立场+框架型论文,将AI研究自动化从「解题」提升到「参与知识构建」的层级,概念梳理系统。优点是框架完整、有真实闭环系统落地、代码开源;局限是概念宽泛,七种能力的可操作性和评估信度尚待时间检验,更像研究议程而非成熟方法。适合作为方向性参考。
标签: 基础模型, 科学发现, AI4Science, 研究议程
📈 今日统计
- 论文总数: 10 篇
- 数据来源: ArXiv RSS (cs.AI, cs.LG, cs.CL, cs.CV, cs.RO)
- 更新时间: 2026-09-16
本报告由 AI 自动生成,仅供参考。论文观点不代表本站立场。