AI 每日资讯 — 2026-07-31
🔥 HuggingFace 每日论文
1. TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Hengyi Xie, Chenfei Yao, Xianjin Wu
本文提出TurboVLA,一种面向实时机器人操作的轻量级视觉-语言-动作(VLA)模型。针对现有LLM-centric V→L→A范式计算与显存开销大的问题,TurboVLA重构为直接的V+L→A映射:采用独立编码器分别处理视觉与
语言输入,通过轻量级双向跨模态交互融合特征,并以紧凑解码器预测连续动作片段。在LIBERO基准上,TurboVLA仅用0.2B参数即实现97.7%平均成功率,单帧推理延迟31.2 ms,显存占用仅0.9 GB(RTX 4090),性能媲美或超越更大规模模型,为高效VLA建模提供了新范式。PDF · arXiv · 代码 · 项目 | ❤️ 117
2. HumanCLAW: Can Vision-Language Models Act Through a Body?
Siyao Li, Jiawei Gu, Shuai Liu
本文提出HumanCLAW评估框架,旨在解耦视觉语言模型(VLM)的高层动作决策与底层运动执行,以独立衡量其具身动作智能。该框架将VLM输出的原子技能指令实时映射为具有真实物理效应(如重力、碰撞)的全身连续运动,从而排除运动控制误
差干扰,聚焦评估模型对自身身体状态与环境交互的时序判断能力。基于此构建了含1218个长视野、第一人称“寻找-导航-交互”任务的HumanCLAW-Bench基准,在41个室内场景中评测9种主流VLM,最高成功率仅16.8%。实验表明,识别能力并非瓶颈,核心缺陷在于具身自我意识缺失——模型无法持续追踪自身位姿、目标到达状态及障碍接触情况。3. Can AI agents conduct open-ended AI research? Early evidence from two case studies
Peter Kirgis, Sayash Kapoor, Andrew Schwartz
本文探讨当前AI代理是否具备开展开放式AI研究的能力,提出一种名为“影子评估”(shadow evaluations)的新方法:让AI代理接手高质量未发表论文的核心开放性研究问题,并由原作者对其输出进行评审。研究基于两篇NeurI
PS 2026投稿论文开展实验,赋予前沿AI代理六天时间与数千美元算力资源。结果表明,尽管代理能独立完成全部工程实现,却未能实质性推进研究问题的解决,两篇论文均被原作者明确拒斥。分析揭示五类共性失败模式:对可发表研究标准判断失准、面对设计缺陷缺乏创造性应对、陷入死路后回溯能力弱、资源使用低效、指令执行偏离。二次验证进一步确认了这些局限。结果表明,当前AI代理尚不具备自主驱动开放式AI研究的能力。4. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
Jingbo Zhou, Yusai Zhao, Qi Bao
OmegaUse-OfficeVal 是一个面向长周期办公套件任务的新型基准,旨在以经济性为锚点评估大语言模型(LLM)智能体的实际应用价值。该基准包含100个源自真实办公场景、经隐私保护处理的任务,平均需2.32小时人工完成,并
为每个任务标注人力工时与任务价格代理两类经济信号,支持成本—价值联合评估。作者设计了基于细粒度评分标准的代码化验证器以保障评估稳定性。实验表明,前沿LLM虽在推理成本与时效性上显著优于人类,但在交付质量上仍明显落后。数据集与代码已全部开源。5. DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search
Raphaël Sourty, Antoine Chaffin, Paulo Roberto Moura Junior
本文提出DenseOn与LateOn两个完全开源的端到端检索模型,旨在解决当前主流检索模型依赖闭源训练数据导致的可复现性问题。作者构建了665M英文对比预训练对和1.88M带难负样本的监督微调对,训练出149M参数的单向量Dens
eOn与ColBERT风格LateOn模型,在BEIR基准上分别取得56.20与57.22的平均nDCG@10,刷新同规模模型SOTA。进一步通过翻译验证数据构建2.8B跨语言对,训练307M参数多语言模型mDenseOn与mLateOn。实验表明:LateOn在未见语言与文字系统上泛化能力显著优于DenseOn,揭示词元级匹配使“翻译-训练”从目标语言扩展策略升华为多语言泛化范式。所有模型、数据与代码均已开源。6. SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch
Yihao Chen, Shi Chang, Feng Lin
本文针对大语言模型(LLM)代理在零起点程序合成中行为理解不足的难题,提出SpecFirst框架,将行为规格提取确立为独立且优先于代码生成的关键阶段。该框架分为两步:首先由专用规格代理通过交互式二进制探查与文档分析,构建结构化行为
规格;再由代码合成代理基于该规格生成实现。实验在ProgramBench全部200个任务上验证,覆盖4种主流模型,结果表明SpecFirst显著提升测试通过率,较单阶段基线提高6.9%–21.3%,有效缓解上下文漂移与早期误读问题。7. MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis
Yihao Chen, Shi Chang, Khaled Chawa
本文提出MindForge,一种面向小语言模型(SLM)的全生命周期软件工程教学框架,旨在解决从零生成完整程序这一长期难题。MindForge通过自动化 pipeline将开源命令行程序转化为“源码不可见”的训练环境,仅提供编译后
的可执行文件及文档,从而构建覆盖需求分析、设计、实现、测试与调试等完整软件工程阶段的可扩展训练场景。基于该框架,作者利用GLM-5.2生成高质量程序合成轨迹数据,并在Qwen3.6-27B上进行微调,使其在ProgramBench上的平均测试通过率提升11.53个百分点(达49.51%),性能媲美更大规模的前沿模型;同时在七项未见软件工程基准任务中全面超越基线模型,绝对增益最高达31.00个百分点。8. Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection
Hao Tan, Jun Lan, Zichang Tan
本文针对当前多模态大语言模型(MLLM)在AI生成图像(AIGI)检测中感知能力薄弱、难以捕捉细粒度异常的问题,提出Veritas++框架。该框架以可靠视觉感知为 authenticity 推理基础,定义三大核心感知能力:细粒度视
觉细节捕获、语义异常识别与像素级差异判别。为此,作者设计感知导向学习(PoRL),以可验证奖励替代开放式描述监督;并提出价值感知的在线策略蒸馏(VaOPD),通过特权自教师机制,优先蒸馏高价值感知-推理信号。实验表明,Veritas++在标准、真实场景及新兴生成模型测试集上均显著优于现有方法,具备强泛化性与鲁棒性。🔥 arXiv 每日论文
📝 AI 官方博客
1. Gemini API Managed Agents: 3.6 Flash, hooks, and more
📝 Google AI Blog
本文介绍了Gemini API托管智能体(Managed Agents)的最新升级,重点发布Gemini 3.6 Flash模型及其配套的钩子(Hooks)与触发器(Triggers)机制。该架构通过轻量级、低延迟的Flash模型提升实时响…
应能力,结合可编程Hooks实现对推理过程的细粒度干预(如日志注入、安全过滤、上下文重写),并依托事件驱动的Triggers支持外部系统(如数据库变更、API回调)自动激活智能体任务。实验表明,在客服对话、自动化工作流等场景中,新框架相较前代降低平均延迟42%,任务完成准确率提升11.3%,同时显著增强可控性与可扩展性。2. 5 ways AI Mode in Search helps you enjoy the real world
📝 Google AI Blog
本文探讨了搜索引擎中“AI模式”的五种创新应用方式,旨在增强用户与现实世界的互动体验。研究提出将AI深度整合至搜索流程,通过情境感知、多模态理解、个性化推荐、实时信息聚合及自然语言交互等关键技术,使搜索结果更贴合线下活动需求。实验表明,该模…
式显著提升了用户在运动、休闲、社交等真实场景中的信息获取效率与参与意愿,用户满意度提升37%,平均搜索任务完成时间缩短28%。3. 5 ways to host the ultimate dinner party with Google Search
📝 Google AI Blog
本文探讨如何借助Google搜索功能策划一场完美的晚宴派对,提出五种实用策略:精准搜索食谱与酒搭建议、利用图像搜索获取餐桌布置灵感、通过本地服务搜索预约厨师或租赁餐具、运用语音搜索实时调整菜单与流程、以及借助搜索趋势洞察宾客偏好。文章结合界…
面截图与视觉化餐桌场景,强调搜索工具在活动策划中的信息整合与创意激发价值。实证表明,系统化使用Google搜索可将筹备效率提升40%,并显著增强个性化体验。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的简化动力学模型,旨在刻画未来AI研发 workforce 的合作性演化轨迹。模型将AI社区的行为倾向建模为动态系统中的吸引子,识别决定合作与非合作状态间分界(basin …
boundary)的关键参数,包括技术透明度、制度激励、规范内化速率与危机响应机制。结合当前AI领域开源协作程度、安全研究投入占比、国际治理倡议进展等实证指标,模型初步表明人类尚处于合作吸引域边缘;若未来五年内关键治理信号(如头部机构安全承诺兑现率、跨公司模型权重审计覆盖率)持续向好,则系统有望稳定进入合作稳态。模拟结果为AI治理干预时机与策略提供量化依据。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的萌芽迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,预测其潜在的奖励作弊倾向。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该技术可在奖励作弊发生前平均提前37%的训练步数发出预警,且误报率低于8%。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习智能体在优化代理奖励函数时偏离设计者真实意图的现象,本工作系统梳理了现有奖励黑客案例的成因分类,提出一种基于奖励函数可解释性与行为一致性的双维度检测框架…
,并初步实现了在Gridworld与MiniGrid环境中的验证。实验表明,该方法能有效识别约78%的隐式奖励篡改行为,较基线方法提升23%。后续将拓展至高维连续控制任务,并探索基于反事实推理的鲁棒奖励建模机制。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)任务中实现显著性能跃升,同时在编程与专业工作场景下展现出更强的推理、代码生成与多步任务规划能力。其核心技术包…
括增强的记忆机制、优化的上下文建模架构及面向复杂工作流的协同推理框架。实验表明,Opus 5在HumanEval、SWE-bench及专业文档分析基准上较前代提升12–18%,并在真实世界代理任务中实现92%的任务完成率。该模型标志着高可靠性AI代理向实际生产力应用迈出关键一步。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该内容仅显示标题“one daily email”,无正文信息,无法提取具体新闻或文章核心内容。