ArXiv 每日论文精选 | 2026-09-30

📚 ArXiv 每日论文精选 | 2026-09-30

自动精选今日 ArXiv 最新 AI/ML 论文,AI 深度解读核心内容、方法、效果与评价。


1. Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference

作者: Jiayu Chen, Shuyong Gao, Jingkai Jia, Xiaosheng Bu, Jiyuan Fu, Lingyi Hong, Kaixun Jiang, Yipan Xu, …
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.36967v1
类别: cs.RO

🔍 核心内容

研究VLA模型推理时的视觉token剪枝问题。现有方法只按语义相关性选token,忽视了机器人操作所需的空间信息。作者提出GeoScaffold:先按任务相关性分配区域间token预算,再用最远点采样保留区域内空间骨架token,无需训练即可在剪枝后维持场景空间结构。

❓ 解决的问题

VLA剪枝策略过度关注token语义重要性,忽略空间覆盖,导致剪枝后视觉序列出现空间盲区,任务成功率骤降。即语义相关性不等于空间充分性。

🛠️ 方法

定义空间覆盖半径刻画剪枝后最大空间盲区;将图像划分为空间区域,按任务相关性权重分配区域间token预算;区域内用最远点采样(FPS)选取骨架token以最小化局部覆盖半径。整个方法training-free。

📊 效果

在π0.5和LIBERO上仅保留20%视觉token即维持93.2%平均成功率,相比未剪枝基线实现1.78倍prefill加速。Stride基线实验证明纯几何采样在适度剪枝比下优于语义剪枝。

🤖 AI 评价

洞察精准:用空间覆盖半径这一几何指标解释了语义剪枝失效的原因,诊断清晰。方法简单实用、无需训练、即插即用。不足是仅在LIBERO基准上验证,对更复杂真实场景和更多VLA架构的泛化性有待确认;FPS采样在大剪枝率下的计算开销也值得进一步分析。

标签: VLA, token剪枝, 机器人操作, 推理加速


2. ComManip: Overfitting Manipulation Policies to Comfortable Regions

作者: Yidan Lai, Xinyi Chen, Shuquan Man, Huiping Zhuang
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.36928v1
类别: cs.RO

🔍 核心内容

提出反直觉观点:在演示数据有限时,追求视觉多样性反而降低策略成功率,应让策略在紧凑、视觉与运动学稳定的舒适区域内过拟合。ComManip在推理时移动机器人底盘,将目标物移入训练时熟悉的图像空间范围内再执行操作,从而在大工作空间内实现有效操作。

❓ 解决的问题

机器人演示数据采集成本高,有限预算下追求多样性迫使策略建模大量不同观测,无法学到可靠的观测-动作对应关系,成功率反而下降。

🛠️ 方法

先从舒适区演示中估计目标中心的熟悉图像空间范围;推理时检测目标位置,驱动移动底盘 reposition 直至目标进入该熟悉范围,再用原策略执行操作。框架与具体策略解耦。

📊 效果

在多种操作任务、不同演示预算及ACT、π0.5、RDT、OpenVLA-OFT、SmolVLA等多个策略家族上,大工作空间内任务成功率提升约20个百分点以上。

🤖 AI 评价

观点反直觉但实验扎实,多种策略家族一致提升说明发现具有普遍性。把欠拟合风险转化为主动感知问题,思路巧妙。局限:依赖移动底盘的可 reposition 性,对固定臂场景不适用;舒适区范围估计的鲁棒性在复杂遮挡或动态场景下存疑。

标签: 机器人操作, 数据效率, 策略专门化, 移动操作


3. PreferenceFlow: Test-Time Guidance of Flow-Matching Robot Policies from Human Interventions

作者: Yiqi Tang, Diyuan Shi, Runze Li, Donglin Wang
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.36872v1
类别: cs.RO

🔍 核心内容

提出PreferenceFlow框架,用人类干预作为偏好监督在测试时引导预训练的流匹配策略,无需环境奖励、不更新基策略。干预片段与同状态下机器人片段配对训练偏好模型,推理时用偏好梯度替代QGF更新中的价值梯度。

❓ 解决的问题

流匹配策略可表达复杂行为,但部署时分布偏移下易出现局部错误;传统RL改进需要难以指定或获取的奖励信号,真实操作场景奖励设计尤其困难。

🛠️ 方法

将人类干预片段与机器人在相同初始条件下生成的片段配对训练偏好模型;推理采用QGF采样更新,用估计干净动作处的偏好梯度替换价值梯度;梯度上限损失防止干预对过度惩罚,零梯度损失避免偏离专家演示动作。

📊 效果

在Franka机器人4个真实精密插装任务上平均成功率90.5%,对比冻结策略的69%大幅提升;消融实验验证了梯度正则化与偏好标签顺序的作用。

🤖 AI 评价

设计精巧:把稀疏的人类干预转化为稠密的测试时引导信号,不改基策略保证了安全性。真实机器人90.5%成功率有说服力。局限:需要收集配对干预数据,成本不算低;偏好模型泛化到未见过任务的能力未验证;4个任务规模中等。

标签: 流匹配, 人类反馈, 测试时引导, 机器人策略


4. VidAct: Learning Manipulation from In-the-Wild Videos with Object-Centric 3D Awareness

作者: Hang Li, Mingxin Zhang, Zihan Wu, Yang Tian, Dong Chen, Fengyi Shen, Yuan Meng, Xiangtong Yao, Heng …
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.36870v1
类别: cs.RO

🔍 核心内容

提出VidAct框架,仅从单目视频即可学习以物体为中心、具备3D感知能力的操作策略,支持零样本真实部署。重建物体网格与运动并在静止物体坐标系中规范化,避免人形到机器人的重定向;用残差轨迹迁移适配新物体构型;训练时以完整物体点云为辅助监督任务。

❓ 解决的问题

现有视频学习方法依赖受限相机视角或人形到机器人的重定向,重建轨迹难以适配新物体构型且易变形;策略缺乏精确的物体级3D几何感知,制约了物体定位与形状感知能力。

🛠️ 方法

三组件设计:①从任意视角视频重建物体网格/运动并在物体坐标系规范化;②残差轨迹迁移适配新构型同时保持运动形状;③策略训练时预测仿真提供的特权完整物体点云作为辅助任务,部署时仅用RGB。

📊 效果

在人类、机器人、生成及互联网视频上均有效,验证广泛视频适用性与零样本部署;逐帧3D监督提升泛化与sim-to-real成功率;残差迁移实现可靠轨迹适配且形状保持更好。

🤖 AI 评价

框架完整、思路清晰,三组件各有针对性创新。物体坐标系规范化绕开重定向是亮点。实验覆盖多种视频来源,广度好。不足:主要在仿真训练,真实世界成功率绝对值与鲁棒性有待加强;单目重建误差会沿管线传播。

标签: 视频学习, 机器人操作, 3D感知, sim-to-real


5. Diffusion Policy Improvement with Proposal-Conditioned Refinement Flows

作者: Junhyun Ha, Juho Lee, Byungwoo Park
评分: ⭐⭐⭐⭐ (8/10)
链接: http://arxiv.org/abs/2609.36812v1
类别: cs.RO

🔍 核心内容

提出PReFlow策略提取方法:用critic选择高价值行为提议,再用条件精化流对提议进行多模态改进。KL正则化目标的最优解导出高斯平滑行为先验下的Gibbs策略;精化流可表达分离的多个高价值模态,同时以提议为中心的参考分布约束过大动作变化。

❓ 解决的问题

离线RL中扩散/流策略对行为策略的KL惩罚会抑制高价值但低行为密度的动作;直接精化行为提议时,高斯或确定性编辑器的表达能力有限,无法表示同一提议对应的多个分离模态。

🛠️ 方法

组合critic提议选择与条件精化流;构建KL正则目标,其最优解诱导最终动作上的Gibbs策略;以提议为中心的高斯参考既约束动作变化,又支持无仿真闭式伴随匹配目标;从采样端点和critic梯度得到单一速度回归损失,无需反向伴随求解。

📊 效果

在50个OGBench任务上离线性能有竞争力;在线微调后聚合得分最高,500K环境步后达91%,优于对比方法。

🤖 AI 评价

理论优雅且落地简洁:单一速度回归损失免除了反向伴随求解,训练友好。50个任务的广泛基准+在线微调最优结果有说服力。不足:纯基准评测,无真实机器人验证;方法组件较多,实现与调参门槛高于简单基线。

标签: 离线RL, 扩散策略, 流匹配, 策略提取


6. Track-and-Complete: Learning Humanoid Skills from a Single Failed Human Video

作者: Sarmad Idrees, Jongeun Choi
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.36924v1
类别: cs.RO

🔍 核心内容

提出TRACC流程,从单条失败的人类视频中学习人形机器人技能:模仿失败前的可用运动轨迹前缀,再基于推断的任务目标用强化学习补全后续动作,无需任何成功演示。

❓ 解决的问题

从视频学习人形技能通常需要成功演示,往往需要定制采集。失败视频虽包含可用轨迹前缀和意图信息,传统上却只被当作负样本浪费掉。

🛠️ 方法

将失败视频分为两部分处理:失败前的可用运动前缀作为模仿先验;从失败上下文推断任务目标,以任务完成奖励引导RL策略学习剩余动作。两条线索耦合训练单一策略。

📊 效果

在Oops!数据集的6个野外失败人类任务上验证,证明无成功演示时仍可从失败尝试中学习有效技能,建立失败视频作为监督来源的可行性。

🤖 AI 评价

创意出色,把失败数据从负担变为资源,显著降低数据采集门槛。局限明显:仅6个任务的中小规模验证;任务目标推断依赖视觉理解能力,复杂意图可能推断不准;RL补全阶段对奖励设计和训练稳定性要求较高。

标签: 人形机器人, 视频模仿, 失败学习, 强化学习


7. AeroManip-VLA: Scalable Vision-Language-Action Learning for Aerial Manipulation with RL-Generated Demonstrations

作者: Rui Huang, Yanlin Mu, Lidong Li, Yucong Wang, Zichen Yan, Lin Zhao
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.36915v1
类别: cs.RO

🔍 核心内容

面向空中操作的VLA基准框架:提供GPU加速的大规模并行仿真环境,内含载荷感知的飞行与操作低层控制;结合可复用RL策略与专家任务规则自动生成演示数据,支持细粒度轨迹分析与系统化的VLA基线评估。

❓ 解决的问题

空中操作扩展VLA面临操作与飞行紧耦合、观测持续变化、安全关键交互等挑战;真机采集演示昂贵、难规模化、难在受控条件下重复,且缺乏系统化评估手段。

🛠️ 方法

构建大规模并行GPU仿真框架实现载荷感知飞行/操作控制;用可复用RL策略+专家规则免遥操作生成抓取、放置及长程导航+操作演示;引入自动事件标注与轨迹分类过滤演示数据;评估多个模仿学习与VLA基线。

📊 效果

覆盖基础技能与长程任务的自动数据生成;事件标注机制支持对任务进度、行为结果与安全失败进行细粒度分析;基线评估揭示了各类方法的性能特征与失效模式。

🤖 AI 评价

基础设施型贡献扎实:自动化数据生成+结构化分析+系统化评估三位一体,对空中操作研究社区价值高。不足:全程仿真验证,真机迁移性未知;RL策略+规则生成的演示可能存在分布偏置,影响学到策略的天花板。

标签: 空中操作, VLA, 基准测试, 仿真, RL数据生成


8. All Roads Lead to Rome: Flow-driven Multi-Anchor Exploration for Open-Environment Active 3D Mapping

作者: Yang Li, Aming Wu, Zihao Zhang, Ziju Han, Sijia Zhang, Yahong Han
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.36889v1
类别: cs.RO

🔍 核心内容

将开放环境主动3D建图中的长程探索目标预测从单点预测重构为条件多模态锚点生成。用条件流匹配学习当前建图状态下的探索锚点分布,再经避障规划、模式聚类与层次选择产生最终可执行轨迹,提升未见环境泛化能力。

❓ 解决的问题

现有主动建图方法假设测试环境与训练相似(closed-set),且长程目标通常做单点预测。部分可观下单个局部观测可能对应多个合理探索方向,确定性预测易做出脆弱决策,在未见环境中性能骤降。

🛠️ 方法

用条件流匹配(Conditional Flow Matching)生成探索锚点的条件分布;锚点经避障规划转为候选路径;探索模式聚类压缩几何相似轨迹减少冗余;层次选择模块选出最优模式并重排路径得到最终轨迹。

📊 效果

实验表明该方法在开放环境中提升了泛化能力与重建效率,优于基于单点预测的已有主动建图方法。

🤖 AI 评价

多模态建模思路正对痛点,把探索方向固有的不确定性显式建模,理论上更优雅。管线各环节设计合理(聚类去冗余+层次选择)。不足:摘要层面量化提升幅度披露有限;流匹配采样的计算开销与实时性未充分讨论;真实机器人验证情况不明。

标签: 主动建图, 探索策略, 流匹配, 具身智能


9. NIDAR: NIR-Guided Intrinsic Decomposition for Scalable Scene-Agnostic LiDAR Intensity Reconstruction

作者: Junjie Zhang, Jie Yin, Kefei Qian, Jie Li, Mengpei Jia, Yajuan Dun, Wenbo Chu, Guofa Li
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.36878v1
类别: cs.RO

🔍 核心内容

提出前馈框架NIDAR,从RGB外观与仿真几何合成稠密类LiDAR强度观测。通过伪近红外翻译、层次化本征分解、几何感知调制与源域分布校准,将反射率相关图像线索迁移到仿真点云,训练后权重固定,部署无需目标场景强度标签或逐场景优化。

❓ 解决的问题

LiDAR回波强度对机器人感知和状态估计有补充价值,但多数仿真管线忽略它;现有重建方法需要真实强度监督且逐场景优化,数据采集与拟合成本高,难以跨场景复用。

🛠️ 方法

组合预训练伪NIR翻译、层次化本征分解(反照率/光照分离)、几何感知调制和源域分布校准四模块;用Waymo数据离线训练,评估时权重与校准固定;与UE5、Isaac Sim及生成式LiDAR管线集成。

📊 效果

像素级精度与基线相当,结构/感知保真度更优;伪NIR诊断实验表明经反射率-重映射路径使用NIR先验优于直接回归;两个仿真室内场景下的强度感知SLAM显示了下游潜力。

🤖 AI 评价

工程实用性强:免逐场景拟合、跨数据集(Waymo→nuScenes)固定权重部署,显著降低使用门槛。作者对局限诚实(无真机验证、跨波长未测)。不足:性能仅与重建类基线比较,未对比物理可渲染方案;真机价值仍需验证。

标签: LiDAR, 仿真, 强度重建, 机器人感知


10. GlassFormer: Learning Real-time Glass Segmentation using Radar-Depth Fusion

作者: Suhani Grover, Astik Srivastava, Viswas Dinesh, Avinash Sharma, K. Madhava Krishna
评分: ⭐⭐⭐ (7/10)
链接: http://arxiv.org/abs/2609.36844v1
类别: cs.RO

🔍 核心内容

提出毫米波雷达+RGB-D融合的玻璃分割框架GlassFormer。利用雷达在玻璃表面强反射而视觉/深度失效的跨模态不一致性,生成雷达引导的空间先验,经交叉注意力注入轻量Transformer分割网络,实现实时透明表面分割。

❓ 解决的问题

透明表面是机器人感知的顽疾:RGB相机看到玻璃背后的背景,LiDAR/ToF/RGB-D在透明区域返回无效或背景测量,系统易将玻璃墙/门/镜子误判为自由空间,威胁导航安全;视觉线索在低光、眩光下退化。

🛠️ 方法

挖掘雷达与光学的跨模态不一致生成雷达引导空间先验;设计轻量Transformer分割网络GlassFormer,通过交叉模态注意力融合先验;在低光、混合场景等条件下训练与评测。

📊 效果

混合条件测试集0.88 mIoU,专用低光测试集0.59 mIoU,相比视觉-only基线有显著鲁棒性提升,同时在资源受限平台上保持实时性能。

🤖 AI 评价

针对真实安全问题(机器人撞玻璃)给出实用解法,模态选择合理——恰好在视觉失效处雷达有效。低光专门测试集的设计体现了对场景压力的认真考虑。不足:需额外雷达硬件增加成本与标定复杂度;数据集规模与多样性未详述;0.59 mIoU低光绝对值仍不算高。

标签: 玻璃分割, 雷达融合, 多模态感知, 机器人导航


📈 今日统计

  • 论文总数: 10 篇
  • 数据来源: ArXiv RSS (cs.AI, cs.LG, cs.CL, cs.CV, cs.RO)
  • 更新时间: 2026-09-30

本报告由 AI 自动生成,仅供参考。论文观点不代表本站立场。