AI 每日资讯 — 2026-07-31
AI 每日资讯 — 2026-07-31 🔥 HuggingFace 每日论文 1. TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Hengyi Xie, Chenfei Yao, Xianjin Wu 本文提出TurboVLA,一种面向实时机器人操作的轻量级视觉-语言-动作(VLA)模型。针对现有LLM-centric V→L→A范式计算与显存开销大的问题,TurboVLA重构为直接的V+L→A映射:采用独立编码器分别处理视觉与语言输入,通过轻量级双向跨模态交互融合特征,并以紧凑解码器预测连续动作片段。在LIBERO基准上,TurboVLA仅用0.2B参数即实现97.7%平均成功率,单帧推理延迟31.2 ms,显存占用仅0.9 GB(RTX 4090),性能媲美或超越更大规模模型,为高效VLA建模提供了新范式。 PDF · arXiv · 代码 · 项目 | ❤️ 117 2. HumanCLAW: Can Vision-Language Models Act Through a Body? Siyao Li, Jiawei Gu, Shuai Liu 本文提出HumanCLAW评估框架,旨在解耦视觉语言模型(VLM)的高层动作决策与底层运动执行,以独立衡量其具身动作智能。该框架将VLM输出的原子技能指令实时映射为具有真实物理效应(如重力、碰撞)的全身连续运动,从而排除运动控制误差干扰,聚焦评估模型对自身身体状态与环境交互的时序判断能力。基于此构建了含1218个长视野、第一人称“寻找-导航-交互”任务的HumanCLAW-Bench基准,在41个室内场景中评测9种主流VLM,最高成功率仅16.8%。实验表明,识别能力并非瓶颈,核心缺陷在于具身自我意识缺失——模型无法持续追踪自身位姿、目标到达状态及障碍接触情况。 PDF · arXiv · 代码 · 项目 | ❤️ 64...