AI 每日资讯 — 2026-07-31

AI 每日资讯 — 2026-07-31 🔥 HuggingFace 每日论文 1. TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Hengyi Xie, Chenfei Yao, Xianjin Wu 本文提出TurboVLA,一种面向实时机器人操作的轻量级视觉-语言-动作(VLA)模型。针对现有LLM-centric V→L→A范式计算与显存开销大的问题,TurboVLA重构为直接的V+L→A映射:采用独立编码器分别处理视觉与语言输入,通过轻量级双向跨模态交互融合特征,并以紧凑解码器预测连续动作片段。在LIBERO基准上,TurboVLA仅用0.2B参数即实现97.7%平均成功率,单帧推理延迟31.2 ms,显存占用仅0.9 GB(RTX 4090),性能媲美或超越更大规模模型,为高效VLA建模提供了新范式。 PDF · arXiv · 代码 · 项目 | ❤️ 117 2. HumanCLAW: Can Vision-Language Models Act Through a Body? Siyao Li, Jiawei Gu, Shuai Liu 本文提出HumanCLAW评估框架,旨在解耦视觉语言模型(VLM)的高层动作决策与底层运动执行,以独立衡量其具身动作智能。该框架将VLM输出的原子技能指令实时映射为具有真实物理效应(如重力、碰撞)的全身连续运动,从而排除运动控制误差干扰,聚焦评估模型对自身身体状态与环境交互的时序判断能力。基于此构建了含1218个长视野、第一人称“寻找-导航-交互”任务的HumanCLAW-Bench基准,在41个室内场景中评测9种主流VLM,最高成功率仅16.8%。实验表明,识别能力并非瓶颈,核心缺陷在于具身自我意识缺失——模型无法持续追踪自身位姿、目标到达状态及障碍接触情况。 PDF · arXiv · 代码 · 项目 | ❤️ 64...

七月 31, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-07-30

七月 30, 2026 · 0 分钟 · Pan

AI 每日资讯 — 2026-07-29

AI 每日资讯 — 2026-07-29 🔥 HuggingFace 每日论文 1. Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation Bingnan Li, Haozhe Wang, Haozhong Xiong 本文针对基于策略的扩散模型蒸馏(OPD)在分类器自由引导(CFG)下的失效问题展开研究,指出现有方法采用的引导速度匹配目标存在分支级欠定性:正负分支误差可相互抵消,导致优化方向失准。当教师模型的负分支隐含学生不可访问的特权信息时,引发“负分支不对称”(NBA)现象,损害正向预测精度。为此,作者提出正向-方向匹配(PDM)目标,分别约束正向预测与CFG条件方向。实验表明,PDM在密集到稀疏视频控制任务中显著提升鲁棒性与泛化能力,缓解对推理引导尺度的敏感性。 PDF · arXiv · 代码 · 项目 | ❤️ 60 2. Data Pyramid for Embodied Manipulation Yifan Ye, Yankai Fu, Yaoxu Lv 本文提出“数据金字塔”框架,系统梳理具身操作学习中的五类互补数据源:真实机器人数据、UMI风格数据、主/客观视角数据、仿真数据及通用视觉-语言数据。该框架以可扩展性与机器人对齐性为轴心,从数据质量、多样性、可复用性与物理保真度四维度刻画各源特性。通过分析当前具身基础模型的数据配比策略,揭示不同数据组合与感知、推理、规划、动作生成及世界建模等能力的关联性。最后指出六大开放挑战,包括大规模触觉数据构建、失败-恢复数据采集、可扩展采集管线开发、跨形态动作对齐、主视角数据赋能灵巧操作,以及面向机器人学习的原理性数据配方设计。 PDF · arXiv · 代码 · 项目 | ❤️ 29 3. The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation Tianyi Men, Zhuoran Jin, Kang Liu...

七月 29, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-28

AI 每日资讯 — 2026-07-28 🔥 HuggingFace 每日论文 1. Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills Siyuan Huang, Pengyu Cheng, Haotian Liu 本文针对大语言模型(LLM)自演化训练中任务多样性与验证可靠性难以兼顾的根本矛盾,提出技能自博弈(Skill Self-Play, Skill-SP)框架。该方法以可验证、场景特异的“技能”为基本单元,通过动态技能路由平衡深度执行与开放探索;框架包含命题者、求解者与动态技能控制器三模块,在强化学习驱动下协同进化:命题者基于采样技能生成挑战性任务,求解者探索能力边界,技能控制器依据执行反馈持续更新并扩展技能库。在工具调用与复杂推理基准上的实验表明,Skill-SP显著提升模型性能上限,展现出强健的自主进化能力。 PDF · arXiv · 代码 | ❤️ 26 2. Scaling Native Multimodal Pre-Training From Scratch Haoyuan Wu, Aoqi Wu, Hai Wang 本文系统研究了从零开始的原生多模态预训练(Native Multimodal Pre-Training)的可扩展性规律。针对现有工作缺乏对计算预算约束下模型规模与数据量协同缩放机制的定量刻画,作者提出基于Transformer的视觉-语言联合训练框架,发现目标损失服从可预测的计算定律,且最优模型参数量与token数均呈幂律缩放。关键发现包括:语言任务的资源分配规律对多模态数据比例不敏感,而多模态任务则高度依赖数据构成——文本主导的数据混合仅在大模型尺度下具备计算效率,促使最优资源配置向更大模型容量倾斜。通过建模数据组成对缩放指数的影响,进一步推导出指导高效训练的配置前沿。 PDF · arXiv | ❤️ 13 3. IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation Varun Gumma, Navonil Majumder, Soumitra Sinhahajari...

七月 28, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-27

AI 每日资讯 — 2026-07-27 🔥 HuggingFace 每日论文 1. Visual Contrastive Self-Distillation Yijun Liang, Yunjie Tian, Yijiang Li 本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦无需特权答案或显式视觉证据的新型在线策略自蒸馏方法。VCSD通过在相同提示与响应前缀下,利用EMA教师模型分别基于原始图像和内容擦除图像生成两个词元分布,以二者对数概率差构建视觉内容敏感的对比信号,进而锐化教师在原始图像下的预测分布,并将其作为全分布目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上均显著超越现有OPSD方法:以Qwen3-VL为例,2B/4B/8B参数模型在七基准平均准确率分别提升4.77%/1.86%/3.75%。 PDF · arXiv · 代码 · 项目 | ❤️ 43 2. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Junsong Chen, Jincheng Yu, Yitong Li 本文提出SANA-Video 2.0,一种基于混合线性-Softmax注意力机制的高效视频扩散Transformer,在5B与14B参数规模下统一架构实现单卡生成最高720p高质量视频。其核心创新包括:(1)混合注意力机制,以3:1比例融合门控线性注意力(O(N)复杂度)与周期性门控Softmax锚点,兼顾计算效率与全秩token交互;(2)块级注意力残差(AttnRes),将完成块的表征注入后续线性层,提升深层有效秩约12%;(3)端到端从头训练策略,结合降分辨率代理实验确定25% Softmax占比为最优权衡。在H100单卡上,40步采样下480p视频VBench达84.30(耗时13.2s),720p/60s推理速度较全Softmax基线快3.2倍,且随视频长度增长优势扩大;配合Sol-Engine全栈优化后,整体延迟显著降低。 PDF · arXiv · 项目 | ❤️ 26 3. Self-Supervised Learning of Structured Dynamics from Videos Lukas Knobel, Andrew Zisserman, Yuki M....

七月 27, 2026 · 3 分钟 · Pan