📚 ArXiv 每日论文精选 | 2026-06-28
自动精选今日 ArXiv 最新 AI/ML 论文,AI 深度解读核心内容、方法、效果与评价。
1. Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards
作者: Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakka…
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2606.27376v1
类别: cs.CV
🔍 核心内容
提出一个自进化训练框架,让统一的多模态大模型仅通过无标注图像自主提升视觉理解和图像生成能力。框架内部分为三个角色:Proposer生成视觉问题、Solver回答并评估、Generator合成图像。训练仅使用自推导的一致性信号,无需人工标注或外部奖励模型。
❓ 解决的问题
现有统一多模态模型在视觉理解和图像生成方面仍依赖人工标注、偏好标签或外部奖励模型进行后训练监督。如何在仅使用无标注图像的情况下,让模型自主提升两种能力?
🛠️ 方法
设计三个内部角色(Proposer/Solver/Generator)的自进化框架,引入Solver Token Entropy (STE)作为基于token级预测不确定性的连续难度信号。图像生成采用多尺度内部评估,结合问答保真度评分与循环一致性描述。
📊 效果
在BLIP3o、BAGEL和VARGPT-v1.1三种架构上验证,BAGEL在MMMU上获得+3.5%绝对提升,GenEval图像生成从82%提升到85%。在八个理解指标上均持续改进基线模型。
🤖 AI 评价
这是一篇非常创新的自监督多模态学习工作。核心亮点是完全不依赖外部监督,仅靠模型自身的一致性和熵信号实现进化。多角色设计和跨架构验证增强了方法的通用性。STE设计巧妙,解决了样本级一致性不可靠时的学习稳定性问题。实际应用价值很高,但训练成本可能较高。
标签: 多模态学习, 自进化, 自监督, 视觉理解, 图像生成
2. Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
作者: Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Kh…
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2606.27373v1
类别: cs.CV
🔍 核心内容
提出VISE(视觉不变性自进化)框架,解决现有自进化多模态模型中’视觉欠条件化’问题——模型依赖语言先验而非视觉内容进行生成。通过几何不变性奖励(空间一致性)和语义不变性奖励(证据无关生成惩罚)直接正则化模型的视觉条件化策略。
❓ 解决的问题
现有自进化LMMs通过多角色自 play 和自一致性奖励优化答案一致性,但无法确保解码器关注视觉内容,导致’视觉欠条件化’失败模式:解码器依赖语言先验而非图像,在图像描述和视觉问答中表现不佳。
🛠️ 方法
VISE在单模型中运行,无需专家角色、外部奖励模型或标注。引入两种互补的不变性奖励:几何不变性奖励在已知变换下强制空间一致性;语义不变性奖励在预测区域被扰动时要求模型识别证据缺失,惩罚证据无关生成。
📊 效果
以Qwen3-VL-2B为基线,VISE在COCO上获得+16.85 CIDEr,TextCaps上+19.66 CIDEr,减少5.0 Chair-I点物体幻觉。在18个基准上验证,跨四个模型家族和规模泛化。
🤖 AI 评价
这篇论文精准定位了自进化LMMs的关键问题——视觉欠条件化,并提出了简洁有效的解决方案。不变性奖励设计优雅,无需额外模型或标注。实验结果非常令人印象深刻,CIDEr提升幅度巨大。跨模型家族的泛化性证明了方法的普适性。这是自监督多模态学习领域的重要进展。
标签: 多模态模型, 自进化, 视觉理解, 自监督, 不变性学习
3. Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
作者: Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-A…
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2606.27369v1
类别: cs.LG
🔍 核心内容
提出RiVER框架,在无需真实答案的情况下训练LLM进行基于分数的优化任务。使用确定性执行反馈作为连续值监督,通过实例级比较进行校准奖励塑形,强调顶级排名解算器同时保留其他有效解的有界反馈。解决了群体相对RL中连续奖励的尺度主导和频率主导问题。
❓ 解决的问题
基于可验证奖励的RL训练LLM通常依赖真实答案分配奖励,限制了其在未知真实解任务中的应用。如何在无真实解的基于分数优化任务上有效训练LLM?
🛠️ 方法
RiVER使用校准奖励塑形:实例级比较解决尺度主导(未校准分数幅度扭曲策略更新)和频率主导(重复采样的次优解超过稀有强候选)问题。在12个AtCoder启发式竞赛任务上训练。
📊 效果
RiVER在ALE-Bench上提升Qwen3-8B和GLM-Z1-9B-0414的评分排名8.9%和9.4%。更重要的是,尽管仅在无真实解的分数任务上训练,仍在LiveCodeBench和USACO等精确解基准上分别获得2.4%和3.5%的绝对平均提升。
🤖 AI 评价
这是RL训练LLM的重要突破。核心贡献是证明无真实解的分数优化任务结合适当奖励校准,可作为通用编码能力的有效训练环境。 RiVER的校准奖励塑形设计精妙,解决了GRPO在连续奖励中的两个关键问题。跨基准的泛化结果尤其令人信服,说明分数优化任务学习的技能可以迁移到精确解任务。对开源RL训练流程有重大价值。
标签: 强化学习, LLM训练, 奖励校准, 代码生成, 无监督
4. PhysiFormer: Learning to Simulate Mechanics in World Space
作者: Yiming Chen, Yushi Lan, Andrea Vedaldi
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2606.27364v1
类别: cs.CV
🔍 核心内容
提出PhysiFormer,一种用于物理合理3D物体运动的扩散Transformer。与在视图相关像素空间操作的视频世界模型不同,PhysiFormer将物体表示为世界坐标中的3D网格。给定初始顶点位置、速度及材料类型(刚性或弹性),模型采样未来顶点轨迹。通过在时间、空间和物体上分解注意力实现高效计算,支持排列不变的多物体推理。
❓ 解决的问题
现有视频世界模型在视图相关的像素空间操作,缺乏物理一致性和几何感知。神经物理方法通常依赖特定潜空间或显式强制执行刚性和因果性,限制了通用性和物理合理性。
🛠️ 方法
将顶点轨迹预测建模为世界坐标中的单一去噪扩散过程,无需刚性或因果性的归纳偏置。注意力在时间、空间和物体上分解,实现排列不变的多物体推理,无需显式物体编码。概率公式捕获学习动态的不确定性。
📊 效果
在10万+模拟轨迹上训练,生成刚性和弹性力学,泛化到混合材料设置、未见过的真实世界几何和更大物体数量。在轨迹准确性、刚性保持和动量物理一致性方面显著优于自回归基线。
🤖 AI 评价
PhysiFormer是世界模型领域的重要进展。直接在三维世界坐标中进行扩散建模,避免了像素空间的视角依赖问题,概念优雅且实用。时间-空间-物体分解注意力设计高效,多物体推理无需显式编码是亮点。实验验证全面,包括刚性、弹性、混合材料和真实世界几何。对机器人、图形学和物理设计应用前景广阔。缺点是训练数据规模(10万轨迹)可能限制了复杂场景的表现。
标签: 世界模型, 物理模拟, 扩散Transformer, 3D运动, 机器人
5. DanceOPD: On-Policy Generative Field Distillation
作者: Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdon…
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2606.27377v1
类别: cs.LG
🔍 核心内容
提出DanceOPD框架,通过在线策略生成场蒸馏技术,让流匹配模型能够同时掌握文本生成图像、局部编辑和全局编辑等多种能力。将每个能力源定义为共享流状态空间上的速度场,学生模型从自身 rollout 状态查询专家能力场进行学习,还能吸收如CFG等操作符定义场。
❓ 解决的问题
现代图像生成模型需要统一多种能力(T2I、局部编辑、全局编辑),但这些能力往往相互冲突。编辑会损害T2I性能,全局与局部编辑相互干扰,如何有效组合这些能力成为训练核心挑战。
🛠️ 方法
采用在线策略生成场蒸馏框架,将每个样本路由到一个能力场,查询低噪声学生诱导状态,用简单速度MSE目标训练。定义每个能力源为共享流状态空间上的速度场,学生从自身rollout状态查询场来组合专家能力。
📊 效果
在T2I、编辑、真实感场吸收和CFG吸收等全面实验中,方法改善了多能力组合效果,增强目标能力的同时保持锚定生成质量,为流匹配模型中的生成场蒸馏建立了实用路径。
🤖 AI 评价
这是一个非常实用且优雅的解决方案。将多种生成能力统一到场蒸馏框架中,避免了传统多任务学习中的冲突问题。方法简洁(仅需MSE目标),且能吸收CFG等操作符,具有很强的扩展性。缺点是实验覆盖范围可以更广泛,但总体是一篇高质量的生成模型训练方法论文。
标签: 图像生成, 流匹配, 知识蒸馏, 多任务学习
6. Scalable Behavior Cloning with Open Data, Training, and Evaluation
作者: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, J…
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2606.27375v1
类别: cs.RO
🔍 核心内容
推出ABC——完全开源的机器人操作行为克隆栈,包含ABC-130K数据集(3500小时、13万条片段、195项任务),以及开源硬件、训练基础设施和仿真管道。提供协同训练方案实现仿真与现实评估的相关性,支持DiT和VLA模型架构对比。
❓ 解决的问题
机器人行为克隆领域缺乏大规模开源数据集和标准化工具链,研究人员难以在平等基础上进行比较和复现。现有数据集规模有限,且缺少从仿真到现实的可靠迁移方案。
🛠️ 方法
构建完整的开源生态系统:ABC-130K大规模遥操作数据集、400小时仿真遥操作数据、可访问的硬件设置、训练基础设施和仿真管道。提供协同训练方案,在真实世界评估前通过仿真进行模型设计和训练决策的消融。
📊 效果
策略成功执行复杂灵巧任务如盒子折叠和从钱包中提取信用卡。对比了DiT和VLA常见架构选择,为社区建立行为克隆的基础研究工具。
🤖 AI 评价
这是一项非常有价值的基础设施贡献工作。开源完整的数据集和工具链对机器人学习社区意义重大,能显著降低研究门槛。13万条片段的规模令人印象深刻。缺点是创新性更多体现在工程而非算法层面,但实用价值极高。对推动机器人模仿学习的标准化和可复现性有关键作用。
标签: 机器人学习, 行为克隆, 开源数据集, 模仿学习
7. World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays
作者: Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2606.27374v1
类别: cs.CV
🔍 核心内容
基于世界动作模型(WAMs)的生成能力,提出REGEN持续模仿学习框架。通过合成伪回放轨迹,让机器人策略无需存储原始人类演示即可复 rehearse 先前任务。在持续适应过程中,REGEN递归查询WAM合成伪回放轨迹,条件仅依赖于先前任务指令和当前任务观察。
❓ 解决的问题
机器人在持续学习新任务时面临灾难性遗忘问题。传统方法需要存储所有历史演示数据用于回放,但存储成本高且隐私敏感。如何利用世界模型的生成能力实现无需存储演示的持续学习?
🛠️ 方法
提出REGEN框架,利用WAM生成未来视觉观察的能力,合成伪回放轨迹。在持续适应期间递归查询WAM,仅基于先前任务指令和当前任务观察生成回放数据。无需存储原始人类演示。
📊 效果
在仿真和真实世界操作环境中,REGEN相比顺序微调减少灾难性遗忘高达50%,性能接近需要真实回放数据的特权经验回放方法。识别出长程视觉退化和动作-观察不一致是生成回放的主要瓶颈。
🤖 AI 评价
这是一个将世界模型与持续学习巧妙结合的实用工作。REGEN解决了机器人学习中存储演示数据的痛点,概念简洁优雅。50%的遗忘减少是显著的改进。论文还对生成回放的限制因素进行了深入分析,具有启发性。缺点是依赖WAM的生成质量,在复杂长程任务中可能受限。
标签: 持续学习, 世界模型, 机器人学习, 灾难性遗忘
8. Don’t Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance
作者: Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2606.27371v1
类别: cs.CV
🔍 核心内容
提出一种高效、无需训练的自引导机制,通过特征自引导缓解预训练流模型在同条件生成多样本时的多样性崩溃问题。在批次生成期间分散流模型的内部特征,并引入流形正则化步骤将这些分散特征投影回数据流形,确保多样生成同时不牺牲与输入条件的对齐。
❓ 解决的问题
最先进的流模型在相同条件下生成多个样本时存在多样性崩溃问题——生成样本趋于相似。现有方法要么通过潜空间引导(效果有限),要么依赖外部奖励模型(推理开销大)。如何在不增加显著开销的情况下提升多样性?
🛠️ 方法
提出无需训练的特征自引导机制:在批次生成期间用特征自引导分散流模型内部特征;引入流形正则化步骤将分散特征投影回数据流形。作为即插即用模块集成到预训练流模型,仅增加边际推理成本。
📊 效果
在多步和少步文本到图像、深度到图像和参考图像生成的条件流模型上,显著改善多样性同时保持保真度。无需额外奖励模型,仅增加边际推理开销。
🤖 AI 评价
这是一篇非常实用的即插即用增强方案。特征自引导+流形正则化的组合简洁有效,解决了流模型实际部署中的多样性问题。无需训练是最大优势,可以直接应用到现有模型。实验覆盖了多种条件生成任务,验证全面。缺点是增益幅度可能因模型而异,且对少步模型的效果需要更多验证。
标签: 流模型, 多样性生成, 特征引导, 图像生成
9. Autoregressive Boltzmann Generators
作者: Danyal Rehman, Charlie B. Tan, Yoshua Bengio, Avishek Joey Bose, Alexander Tong
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2606.27361v1
类别: cs.AI
🔍 核心内容
提出自回归玻尔兹曼生成器(ArBG),一种新颖的自回归建模框架,用于统计物理中分子系统的热力学平衡采样。ArBG突破了传统基于流式玻尔兹曼生成器受可逆性约束限制的问题,利用LLM中有效的架构实现增强可扩展性。引入Robin——1.32亿参数可迁移模型,在8残基系统上零样本能量误差降低60%以上。
❓ 解决的问题
分子系统的热力学平衡高效采样是统计物理的核心挑战。现有玻尔兹曼生成器主要依赖标准化流,但受限于严格的可逆性约束(离散时间)或计算昂贵的似然(连续时间),表达能力和可扩展性受限。
🛠️ 方法
ArBG脱离流式范式,采用自回归建模:规避流的拓扑约束,实现顺序推理时间干预,利用LLM架构实现增强可扩展性。结合生成模型与精确似然和重要性采样校正。
📊 效果
在所有基准上显著优于流式模型,尤其在10残基Chignolin等大型肽系统上。Robin模型在8残基系统上零样本能量误差E-W2降低60%以上,超越先前最优水平。
🤖 AI 评价
这是将自回归架构引入分子物理模拟的创新工作。ArBG成功突破了标准化流的可逆性瓶颈,在大型肽系统上取得显著改进。Yoshua Bengio的参与增加了方法可信度。1.32亿参数可迁移模型Robin展现了跨系统泛化能力。对药物发现、蛋白质设计等领域有重要应用价值。缺点是自回归采样的序列性可能限制推理速度,但论文未详细讨论此问题。
标签: 分子模拟, 自回归模型, 统计物理, 玻尔兹曼生成器, 蛋白质
10. DnA: Denoising Attention for Visual Tasks
作者: Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2606.27372v1
类别: cs.CV
🔍 核心内容
提出去噪注意力(DnA)机制,解决标准softmax多头注意力中的噪声注意力模式问题。DnA使用正查询识别正确类别的图像特征,负查询识别相关但无关的特征,然后将这些交互投影到两个具有较大主角度数的不同子空间中,促进子空间分离和判别能力。
❓ 解决的问题
标准softmax激活在多头注意力中会产生噪声注意力模式,稀释相关特征并降低性能。如何设计一种能显式去噪的注意力机制,提升视觉感知任务的特征聚焦能力?
🛠️ 方法
设计DnA机制:正查询识别正确类别特征,负查询识别相关但无关特征,将交互投影到两个主角度数较大的不同子空间中。促进子空间分离,增强判别性。
📊 效果
使用ViT-B backbone在ImageNet-1K上获得0.8%的绝对增益。在视频理解(视频Transformer提升1.8%,视频LLM提升0.5%)等多个视觉理解任务上均显示改进。大量实证分析验证了子空间交互和去噪效果的设计选择。
🤖 AI 评价
DnA是一个简洁而有效的注意力改进。正负查询分离和子空间投影的想法直观且有理论支撑。实验覆盖分类、视频理解等多个任务,验证充分。增益幅度适中但稳定。作为即插即用模块,实用性强。缺点是相比标准注意力有一定计算开销,且增益在部分任务上相对温和。
标签: 注意力机制, 视觉Transformer, 去噪, 图像分类
📈 今日统计
- 论文总数: 10 篇
- 数据来源: ArXiv RSS (cs.AI, cs.LG, cs.CL, cs.CV, cs.RO)
- 更新时间: 2026-06-28
本报告由 AI 自动生成,仅供参考。论文观点不代表本站立场。