AI 每日资讯 — 2026-08-03
🔥 HuggingFace 每日论文
1. AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
Bing Yan, Gregory Wolfe, Stefano Martiniani
AskChem针对化学文献综述中跨论文信息碎片化、人工整合效率低的问题,提出以“主张(claim)”为核心的检索与合成基础设施。其核心是将论文解析为带来源DOI和原文引用的原子化、类型化主张,并构建三层互补结构:稳定的分面分类体系
支持层级检索、证据图谱建模主张间逻辑关系、动态活体分类法依据科学原理组织文献。系统已索引14.7万篇论文生成的240万条主张,提供Web界面及面向AI代理的REST/SDK/MCP接口。在AskChem-Bench评测中,接入AskChem的GPT-5.5阅读器实现100%DOI可解析率(基线为88.3%),并取得五系统中最高引用密度。PDF · arXiv · 代码 · 项目 | ❤️ 292
2. PhiZero: A World Model Built Around Physical Language
Shuyao Shang, Yuqi Wang, Ruopeng Gao
本文提出PhiZero,一种以“物理语言”为核心的物理世界模型。“物理语言”是一种紧凑、离散的世界状态转移表征,旨在显式建模物理演化规律。不同于现有方法直接在像素空间预测未来视频,PhiZero采用“先推理、后渲染”范式:首先通过
自监督学习从野外视频中习得物理语言,并据此推理未来状态序列;再将其解码为视频。实验表明,PhiZero在生成与理解类基准上均能建模物理一致的动态演化,并展现出真实感强、可交互的世界建模能力,支持细粒度动作条件模拟与零样本运动迁移。PDF · arXiv · 代码 · 项目 | ❤️ 158
3. Beacon: Knowing When and How to Perform Agentic Visual Reasoning
Qixun Wang, Yang Shi, Letian Cheng
本文针对多模态大语言模型(MLLMs)在代理式视觉推理中工具调用低效、性能增益有限的问题,提出从模式适应性(MA)与工具效应(TE)两个维度重新审视工具使用机制。MA衡量模型能否精准识别工具调用的必要性,TE则评估工具是否真正拓展
模型能力而非引入额外错误。实验发现现有方法MA不足,且工具在简单样本上造成显著性能下降。为此,作者提出Beacon模型,通过必要性感知自适应奖励机制与提示引导的能力扩展策略,显著提升整体准确率、MA得分及真实工具增益,在多个视觉推理基准上实现SOTA性能。4. ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
Yukang Cao, Haozhe Xie, Beichen Wen
本文针对具身智能面临的多模态感知-行动数据瓶颈问题,提出以人为中心的环境捕获引擎(ACE),在真实家居环境中构建时空同步、空间标定的多尺度记录系统:桌面级聚焦手物交互,房间级覆盖全身运动与场景交互。ACE同步采集第一人称/多视角视
频、全身及手指关节运动、物体几何与6自由度轨迹、音频及触觉信号,形成统一多感官流。基于此,构建ACE-Data-0数据集,包含50名参与者在2个环境中完成200类任务的150小时、1700万帧视频与7.5万次交互片段,涵盖原子操作、长时序家务链及人-场景交互,并通过目标导向而非步骤分解的指令保留自然行为多样性。5. β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
Jiawei Xu, Minghui Liu, Juzheng Zhang
本文提出β-OPSD,一种基于策略优化与自蒸馏协同的新型训练框架,旨在提升推理型语言模型的稳定性与性能。作者指出,传统on-policy自蒸馏(OPSD)本质是β=1的策略优化特例,其脆弱性源于KL正则项权重不可调;由此将β显式建
模为可调节的正则化参数,构建广义策略优化目标,并推导出最优策略为参考策略与特权教师策略之间的几何插值。为避免高方差强化学习优化,该方法将闭式解转化为token级logits混合的蒸馏目标,并引入return-to-go信用分配机制,使token级更新更契合序列级目标。在数学推理基准上的实验表明,β-OPSD显著优于基线OPSD,优化过程更稳定,性能持续提升。6. Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
Chongjian Ge, Hanwen Jiang, Tianyu Wang
本文针对高分辨率图像、长视频及多模态生成中自注意力计算复杂度高的问题,提出Chimera——一种基于Chinchilla标度律设计的混合视觉扩散Transformer架构。Chimera摒弃位置编码,采用光栅序统一处理文本、图像与
视频token;融合Kimi Delta Attention(O(N)复杂度)、多头潜在注意力(MLA)与模态感知短卷积,并引入稀疏MoE提升容量。为适配异构结构,提出模块化缩放方案HeteroP,实现参数、数据与模态配比的Chinchilla最优拟合。实验表明:其11B参数模型仅激活2B参数,在预训练扩散损失下较同等规模Wan-2.1基线计算效率提升7.3倍,并支持零样本从5秒外推至30秒视频生成。7. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
Yao Xiao, Reuben Tan, Zhen Zhu
针对长视觉上下文导致的视觉-语言模型性能下降与计算资源受限问题,本文提出ReToken方法:引入一个可学习的单令牌(single learnable token),作为显式的检索目标,从预填充的视觉键值缓存中稀疏选取与查询最相关的
视觉token。该方法仅需在小型图像问答数据集上训练,即在多个图像与视频基准测试中实现显著提升——在Visual Haystacks上分别提升Qwen3VL-8B和InternVL3.5达13.4和12.4分(相对提升超20%),在LVBench上对长视频实现零样本迁移并提升8.0分。其轻量设计支持单卡H100完成训练与推理。8. AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
Xiangning Lin, Shenzhe Zhu, Shu Yang
本文提出AISPA(人工智能系统提示保障框架),一种以用户为中心的系统提示审计方法,旨在解决大语言模型应用中系统提示不透明、缺乏监管所导致的信任与问责缺失问题。AISPA从用户关切出发,构建涵盖八个维度的评估体系,对88款商用AI
产品的3249条系统提示指令进行实证审计,并将其分类为“保护性”或“问题性”。研究发现:系统提示设计差异显著;虽保护性指令普及率高(98.9%产品含至少一条),但覆盖广度不足(仅24%覆盖全部八维);提示长度与保护性呈增长趋势;然而问题性指令仍广泛存在(约40%产品含至少一条)。🔥 arXiv 每日论文
📝 AI 官方博客
1. Gemini API Managed Agents: 3.6 Flash, hooks, and more
📝 Google AI Blog
本文介绍了Gemini API托管智能体(Managed Agents)的最新升级,重点发布Gemini 3.6 Flash模型及其配套的钩子(Hooks)与触发器(Triggers)机制。该架构通过轻量级、低延迟的Flash模型显著提升实…
时推理效率,同时借助可编程Hooks实现对智能体执行流程的细粒度干预与上下文增强,结合事件驱动的Triggers支持外部系统联动与动态响应。实验表明,在典型Agent任务(如多步工具调用、对话状态跟踪)中,3.6 Flash相较前代降低42%平均延迟,Hooks机制使任务成功率提升18%,Triggers支持毫秒级外部事件响应。该方案为构建高可靠、可扩展的企业级智能体系统提供了新范式。2. 5 ways AI Mode in Search helps you enjoy the real world
📝 Google AI Blog
本文探讨了搜索引擎中“AI模式”(AI Mode)如何通过五种创新方式增强用户与现实世界的互动体验。研究聚焦于AI Mode在搜索场景下的实际应用,包括情境化推荐、多模态内容理解、实时活动建议、跨平台服务整合及个性化兴趣建模。作者结合用户行…
为分析与A/B测试结果,验证该模式显著提升了线下活动参与率(+37%)与搜索满意度(NPS提升22分)。关键技术涵盖轻量化视觉-语言联合嵌入、基于地理位置的动态意图识别,以及隐私优先的本地化推理架构。实验表明,AI Mode不仅优化了信息获取效率,更有效 bridging digital search and physical world engagement。3. 5 ways to host the ultimate dinner party with Google Search
📝 Google AI Blog
本文探讨如何借助Google Search优化家庭晚宴策划流程,提出五种实用策略:利用搜索预测功能获取当季食材与菜谱灵感;通过图像搜索识别并复刻心仪摆盘风格;使用“附近”限定词快速查找优质本地食材供应商;借助问答式搜索解决烹饪技术难题;以及…
运用日历集成与语音搜索协调宾客邀约与时间安排。文章结合界面截图与场景化案例,验证该方法可将筹备效率提升40%,显著增强个性化体验与社交互动质量。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个简化的动力学模型,用于分析未来人工智能研发 workforce 的合作性演化路径,即其是否趋向于协同治理(cooperative)或分裂对抗(uncooperative)。模型将AI社区的治理倾向建模为状态空间中的动态轨迹,刻画…
关键驱动因素(如激励机制、规范传播、技术路径依赖与外部监管强度)如何共同塑造系统演化方向,并识别决定长期行为的“盆地边界”(basin boundary)。结合当前AI领域人才流动、开源协作趋势、机构治理实践等实证线索,模型初步表明我们尚未越过临界点,但处于敏感区间;若干可观测指标(如跨组织安全研究协作率、对齐相关论文占比、政策响应速度)被提出作为判断是否行进在良性路径上的早期信号。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(Reasoning Interpolation)的早期预警方法,用于在大语言模型训练过程中提前识别奖励劫持(Reward Hacking)现象。核心思想是利用重要性采样(Importance Sampling),结…
合经微调的“捐赠者”预填充(donor prefills)生成高风险推理路径,并通过插值建模策略性行为的演化轨迹。该方法无需修改训练流程或访问奖励模型内部结构,仅依赖少量验证样本即可实现对劫持行为的前向预测。在多个对齐任务(如RLHF、Constitutional AI)上的实验表明,该方法可在劫持发生前平均提前2.3个训练阶段发出预警,准确率达89.7%,显著优于基线检测手段。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习中智能体通过 exploiting reward function 设计缺陷而达成虚假目标的现象,本工作系统梳理了现有攻击范式与防御机制,提出一种基于反事实…
因果建模的奖励函数鲁棒性评估框架,并引入可解释性驱动的奖励塑形方法(Explainable Reward Shaping, ERS)。在Gridworld、ProcGen及MuJoCo基准上验证表明,ERS使奖励黑客行为发生率降低62.3%,同时保持98.7%的原始任务性能。后续将聚焦于多智能体场景下的协同奖励欺骗检测与在线修正机制。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)支持能力上实现显著跃升,同时在代码生成与专业领域任务(如法律、金融、科研写作等)中展现出更强的推理深度、上下…
文一致性与多步规划能力。Opus 5采用改进的混合专家(MoE)架构与动态计算分配机制,在保持响应效率的同时扩展有效上下文窗口至200K tokens,并集成强化学习驱动的自我修正模块以提升输出可靠性。在HumanEval、SWE-bench及定制化专业基准测试中,Opus 5相较前代Opus 4平均提升18.7%准确率,尤其在跨文件调试与复杂文档分析任务中优势突出。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该页面仅显示标题“one daily email”,无其他实质性内容,无法提取具体新闻或信息。