ArXiv 每日论文精选 | 2026-07-12

📚 ArXiv 每日论文精选 | 2026-07-12

自动精选今日 ArXiv 最新 AI/ML 论文,AI 深度解读核心内容、方法、效果与评价。


1. UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

作者: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2607.08768v1
类别: cs.CL

🔍 核心内容

提出UniClawBench,首个基于能力的主动智能体基准测试,围绕五项基础能力(技能使用、探索、长上下文推理、多模态理解、跨平台协调)设计400个双语真实世界任务。

❓ 解决的问题

现有基准难以有效评估主动智能体,依赖沙箱环境和单轮评估范式;场景化任务分类将多种能力混合,难以识别失败根本原因。

🛠️ 方法

基于五项基础能力设计400个任务;在实时Docker容器中使用细粒度逐步完成检查点评估;设计闭环评估策略(执行器、隐藏监督器、用户智能体)模拟真实多轮人类反馈;在多种智能体框架下评估模型。

📊 效果

全面比较揭示了基础模型能力和智能体框架设计如何共同塑造真实环境性能,为智能体研究提供了重要洞察。

🤖 AI 评价

UniClawBench是智能体评估领域的重要贡献。从能力驱动而非场景驱动的任务设计,以及闭环多轮评估策略,都是设计上的亮点。400个真实世界任务覆盖全面,为后续研究提供了宝贵资源。对理解和改进主动智能体具有重要指导意义。

标签: 智能体, 基准测试, 大语言模型, 多模态


2. Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

作者: Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan W…
评分: ⭐⭐⭐⭐ (9/10)
链接: http://arxiv.org/abs/2607.08758v1
类别: cs.AI

🔍 核心内容

提出IdeaGene-Bench(IG-Bench),一个用于科学谱系推理和谱系驱动想法生成的基准。基于IdeaGene框架,将论文表示为最小类型化的Idea Genome对象,通过GenomeDiff记录六种进化动态。

❓ 解决的问题

科学思想很少从空白页开始,它们继承机制、修复已知限制并重组前人工作。现有基准很少评估AI系统是否能理解这种继承结构。

🛠️ 方法

包含1,961个黄金谱系轨迹、1,085个Idea Genome对象和920个GenomeDiff记录,覆盖10个科学领域。IG-Exam测试谱系推理(42任务类型,1,029实例);IG-Arena使用谱系条件PES分数评估生成。

📊 效果

14个LLM科学家系统中最强者在谱系推理上仅达27.3%精确准确率。结构化谱系上下文重新排序系统表现而非均匀帮助。

🤖 AI 评价

IG-Bench是AI for Science领域的开创性基准。将科学思想演进类比为基因组的思路非常有启发性。然而,最强系统仅27.3%的准确率表明这是一个极具挑战性的问题,同时也说明当前大模型在理解科学思想演进结构方面仍有巨大提升空间。该基准对科学智能体研究具有重要推动作用。

标签: 科学智能体, 基准测试, AI for Science, 谱系推理


3. Wat3R: Underwater 3D Geometry Learning without Annotations

作者: Jiangwei Ren, Xingyu Jiang, Zijie Song, Wei Xu, Hongkai Lin, Dingkang Liang, Xiang Bai
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08772v1
类别: cs.CV

🔍 核心内容

提出Wat3R,一种跨域半监督学习框架,将空气中的3D重建模型适应到水下场景。无需任何标注的水下数据,仅通过未标注的水下视频即可学习鲁棒的几何表示。构建了Water3D数据集用于评估。

❓ 解决的问题

水下环境3D几何估计面临光衰减、散射和缺乏高质量3D标注数据的挑战。现有方法依赖大规模密集标注,在水下环境中不切实际。

🛠️ 方法

采用教师-学生架构进行跨域半监督学习,利用丰富的未标注水下视频学习几何表示。设计了跨视角一致性损失,利用其他视角的几何线索补偿当前视角因水衰减和散射导致的信息退化。

📊 效果

在6.1M参数下,Wat3R在水下多视图深度估计和点云重建方面均优于当前最先进方法,实现了实时推理。

🤖 AI 评价

该工作填补了水下3D重建领域的重要空白,无需水下标注数据即可实现跨域适应,具有很强的实用价值。教师-学生架构结合跨视角一致性损失的设计巧妙,Water3D数据集为该领域提供了重要的评估基准。创新性强,应用前景广阔。

标签: 3D重建, 水下视觉, 半监督学习, 计算机视觉


4. ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device

作者: Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08771v1
类别: cs.CV

🔍 核心内容

提出ZipDepth,一个轻量级单目深度估计网络,通过高效的可重参数化编码器-解码器架构和大规模知识蒸馏,将基础模型的零样本泛化能力压缩到仅有6.1M参数的小模型中。

❓ 解决的问题

基础模型在单目深度估计上虽有强大零样本泛化能力,但计算需求过高,无法在嵌入式和移动设备上运行。轻量级替代方案多为单域自监督范式,在域迁移下表现不佳。

🛠️ 方法

结合可重参数化编码器-解码器架构与大规模知识蒸馏,在大型多域训练集上从基础模型蒸馏知识。仅6.1M参数,可在服务器GPU到功耗受限设备上实时运行。

📊 效果

在五个基准上实现了轻量级模型中最佳的零样本精度与部署效率权衡,在多个量上性能逼近参数量50倍大的基础模型。

🤖 AI 评价

ZipDepth在模型压缩和知识蒸馏方面做出了显著贡献,成功将基础模型的能力迁移到轻量级架构。6.1M参数实现实时推理是该工作的重要亮点,对移动和嵌入式设备应用具有重要意义。是一个实用价值很高的工程化研究。

标签: 深度估计, 知识蒸馏, 模型压缩, 零样本学习


5. LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

作者: Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08770v1
类别: cs.CV

🔍 核心内容

提出LongE2V,利用预训练视频扩散先验联合处理事件驱动的视频重建、预测和帧插值三大任务。通过微调基础视频模型,实现高数据效率和卓越感知质量。

❓ 解决的问题

从稀疏事件流恢复高质量视频具有挑战性。回归方法常模糊纹理,现有生成模型在长序列稳定性方面表现不佳。

🛠️ 方法

引入自回归展开和自适应上下文切换来缓解超长序列的时间漂移;提出重编码对齐与交叉残差校正确保帧插值时的双向一致性;事件体素密度增强确保不同传感器分辨率下的鲁棒性。

📊 效果

在真实世界基准上,LongE2V在所有三项任务中均超越最先进方法,展现出卓越的时间一致性和零样本泛化能力。

🤖 AI 评价

LongE2V是事件相机领域的重要进展,首次利用预训练视频扩散模型统一处理三大相关任务。自回归展开和自适应上下文切换等技术创新有效解决了长序列稳定性问题。事件相机在机器人和自动驾驶中有重要应用,该工作具有较好的实用价值。

标签: 事件相机, 视频扩散模型, 视频生成, 帧插值


6. Geometry and Gradient-based Partitioning for Panoramic Outdoor Reconstruction

作者: Weijian Chen, Weibo Yao, Yuhang Zhang, Xiaolin Tang, Guo Wang, Weijun Zhang, Xitong Gao, Yihao Chen,…
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08769v1
类别: cs.CV

🔍 核心内容

提出PanoLOG,一个用于大规模全景3DGS重建的两阶段粗到精框架,包含几何和梯度分区策略(G2PS)。构建了Pano360,首个大规模全景户外场景重建基准。

❓ 解决的问题

将3D高斯泼溅(3DGS)扩展到大规模户外场景在数据采集和计算上都成本高昂。全景图像虽能减少采集工作量,但全向可见性使现有基于局部相机视锥的分区策略失效。

🛠️ 方法

全局粗阶段利用天空球建模和全景单目深度监督获取可靠几何;精修阶段G2PS通过视差驱动不确定性构建自适应边界体积,并通过梯度重要性评分分配相机。

📊 效果

G2PS在保持可扩展块并行训练的同时,实现了最先进的渲染质量。首个大规模全景户外重建基准Pano360已公开。

🤖 AI 评价

PanoLOG是3DGS在大规模场景应用的重要推进。几何与梯度分区策略巧妙地解决了全景图像全向可见性带来的分区难题。Pano360基准的构建对整个领域具有重要价值。该方法在渲染质量和训练效率之间取得了良好平衡。

标签: 3D高斯泼溅, 全景重建, 3DGS, 计算机视觉


7. OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

作者: Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08766v1
类别: cs.CV

🔍 核心内容

提出OPSD-V,一种用于少步自回归视频扩散模型的在线策略自蒸馏范式。通过引入真实长视频数据作为时间上下文,提供密集轨迹级监督,减少长序列自回归展开时的误差累积。

❓ 解决的问题

现有少步AR视频生成器虽能低延迟生成长视频,但在长序列自回归展开中仍存在误差累积和运动动态减弱的问题。

🛠️ 方法

学生模型遵循推理时展开,基于自身生成的KV缓存生成每个块;教师模型在相同去噪状态评估,但使用更清晰的AR一致性时间缓存,用真实视频上下文替换旧历史。提供密集去噪级修正目标,不改变采样器或推理缓存机制。

📊 效果

在视觉质量、运动动态和VBenchLong分数上持续改进。用户研究显示在66%的情况下优于基础模型(排除平局为82.5%)。

🤖 AI 评价

OPSD-V是视频生成领域的重要技术贡献。在线策略自蒸馏的想法新颖,有效解决了长序列视频生成中的误差累积问题。保持原始推理路径不变的情况下提升质量,是其关键优势。该工作对高效长视频生成具有重要意义,但用户研究规模较小(仅10人)。

标签: 视频生成, 自蒸馏, 扩散模型, 自回归模型


8. Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

作者: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08765v1
类别: cs.CV

🔍 核心内容

提出Canvas360,一个用于上下文全景生成的两阶段框架,结合几何感知预训练和下游任务微调。构建Canvas360Dataset包含100万个高质量配对全景样本。

❓ 解决的问题

全景图像生成缺乏大规模高质量训练数据,且现有方法在几何一致性和全局连贯性方面表现不佳。上下文全景生成任务(风格迁移、修复、扩展、编辑)缺乏统一框架。

🛠️ 方法

通过并行深度生成、速度循环填充和相似性损失正则化增强文本到全景生成;基于学习到的几何感知表示,通过token级拼接支持多样化下游任务。

📊 效果

在全景图像保真度上取得显著提升,尤其在全景特定FAED指标上表现突出,在报告的定量评估中达到竞争或领先水平。

🤖 AI 评价

Canvas360在全景生成领域做出了扎实贡献。几何感知预训练策略有效解决了全景图像特有的几何一致性问题。100万样本数据集和统一的多任务框架都是实用价值很高的成果。对VR/AR内容生成等应用场景具有直接意义。

标签: 全景图像生成, 几何感知, 图像生成, 计算机视觉


9. OpenCoF: Learning to Reason Through Video Generation

作者: Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2607.08763v1
类别: cs.AI

🔍 核心内容

提出OpenCoF框架,包含OpenCoF-17K推理视频数据集(覆盖11个任务家族)和Wan-CoF微调模型,探索视频生成模型通过时间连接帧进行链式帧(CoF)推理的能力。

❓ 解决的问题

现有视频生成器主要训练于通用视频语料,缺乏对链式帧推理的多样化监督和专门设计。推理能力是大模型的核心能力,视频生成提供了不同于思维链(CoT)的推理路径。

🛠️ 方法

构建11个任务家族的推理视频数据集;微调Wan2.2-I2V-A14B模型为Wan-CoF;探索视觉和文本推理token机制,分别捕获低层视觉线索和高层语义先验。

📊 效果

在四个视频推理基准上,Wan-CoF较基线有显著提升。注意力分析表明推理token在模型深度、去噪步、空间和时间维度上都有贡献。

🤖 AI 评价

OpenCoF为视频生成与推理的交叉领域开辟了新方向。链式帧推理的概念新颖,将视频生成从单纯内容生成提升到推理工具层面。OpenCoF-17K数据集是该领域的重要资源。但实验规模和基准数量仍可扩展,推理token的设计空间仍有探索余地。

标签: 视频推理, 链式帧推理, 视频生成, 多模态推理


10. Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling

作者: Yiwei Zhou
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2607.08757v1
类别: cs.LG

🔍 核心内容

从理论上证明扩散模型中,前向边缘分布上的分数匹配误差小并不能保证数值稳定性。构造了平滑分数场,前向误差任意小,但欧拉-丸山离散化在概率收敛的同时所有正矩发散。

❓ 解决的问题

分数匹配控制前向边缘下的平均误差,但离散化逆向采样器沿自身轨迹评估学习到的分数。小的前向边缘误差是否能保证数值稳定性尚不清楚。

🛠️ 方法

构造具有任意小前向边缘L2误差的平滑分数场;证明逆向过程非爆炸、各阶矩存在、路径空间总变距离可任意接近精确过程,但离散化端点在每个W_p距离下发散。对紧支撑数据给出正结果:将去噪器投影到已知有界凸集可保持逐点精度。

📊 效果

小DiT网络实验显示罕见数值轨迹上的大幅增长及去噪器投影的抑制作用。证明在有限神经网络架构中同样可发生这种失效。

🤖 AI 评价

这是一篇理论深度很强的扩散模型分析论文,揭示了分数匹配与数值稳定性之间的重要理论鸿沟。对扩散模型的理论理解和实际部署都有重要启示。去噪器投影的正结果为实际应用提供了保障。然而,该工作偏重理论分析,对实际模型的改进建议有限。

标签: 扩散模型, 理论分析, 数值稳定性, 分数匹配


📈 今日统计

  • 论文总数: 10 篇
  • 数据来源: ArXiv RSS (cs.AI, cs.LG, cs.CL, cs.CV, cs.RO)
  • 更新时间: 2026-07-12

本报告由 AI 自动生成,仅供参考。论文观点不代表本站立场。