AI 每日资讯 — 2026-08-02
🔥 HuggingFace 每日论文
1. AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
Bing Yan, Gregory Wolfe, Stefano Martiniani
AskChem 提出一种以“主张(claim)”为中心的化学文献合成基础设施,旨在解决现有检索系统仅返回文档列表、难以跨论文整合细粒度科学发现的问题。其核心是将每篇论文解析为带类型标签、DOI溯源及原文引证的原子化主张,并构建三层
互补结构:稳定分面分类体系、主张间证据关系图谱、以及基于科学原理的动态活体分类法。系统已索引14.7万篇论文生成的240万条主张,支持Web、REST、SDK与MCP多模态接入。在AskChem-Bench评测中,结合GPT-5.5的阅读器实现100% DOI可解析率(基线为88.3%),并取得五种系统中最高的引用密度。PDF · arXiv · 代码 · 项目 | ❤️ 289
2. PhiZero: A World Model Built Around Physical Language
Shuyao Shang, Yuqi Wang, Ruopeng Gao
本文提出PhiZero,一种以物理语言为核心的物理世界模型。物理语言是一种紧凑的离散表示,用于刻画世界状态转移。不同于现有模型直接在像素空间预测未来视频、隐式建模物理动力学,PhiZero通过自监督方式从野外视频中学习物理语言,并
采用“先推理后渲染”范式:首先以物理语言序列显式推断未来世界演化,再将其渲染为视频。在生成与理解基准上的大量实验表明,PhiZero能有效建模物理一致的世界演化,并展现出真实感强、可交互的世界建模能力,支持细粒度动作条件模拟与零样本运动迁移。PDF · arXiv · 代码 · 项目 | ❤️ 155
3. Beacon: Knowing When and How to Perform Agentic Visual Reasoning
Qixun Wang, Yang Shi, Letian Cheng
本文针对多模态大语言模型(MLLMs)在代理式视觉推理中工具调用低效、性能增益有限的问题,提出从模式适应性(MA)与工具效应(TE)两个维度重新审视工具使用机制。研究发现现有方法普遍存在MA不足、工具引入易损易解样本性能等问题。为
此,作者提出Beacon模型,通过必要性感知的自适应奖励机制与提示引导的能力扩展策略,显著提升工具调用的时机判断准确性与实际增益效果。实验表明,Beacon在多个视觉推理基准上实现SOTA性能,同时兼具更高的模式适应性与更稳健的工具正向效应。4. ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
Yukang Cao, Haozhe Xie, Beichen Wen
本文针对具身智能面临的多模态感知-行动数据瓶颈问题,提出以人为中心的环境捕获引擎(ACE),在真实家居环境中构建空间标定、时间同步的多尺度记录系统:桌面级配置精细捕捉手-物交互,房间级配置完整记录全身运动与场景交互。ACE同步采集
第一人称与多视角视频、全身及手指关节运动、物体几何与6自由度轨迹、音频及触觉信号,形成统一多感官数据流。基于此,构建ACE-Data-0数据集,涵盖50名参与者在2个环境中完成200类任务的150小时、1700万帧视频与7.5万次交互片段,覆盖原子操作、长时序家务链及人-场景交互,并通过目标导向而非步骤式指令保留自然行为多样性。进一步设计从信号到场景组件的分层基准评测体系。5. β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
Jiawei Xu, Minghui Liu, Juzheng Zhang
本文提出β-OPSD,一种基于策略优化与自蒸馏协同的新型训练框架,旨在提升推理型语言模型的稳定性与性能。作者指出,传统on-policy自蒸馏(OPSD)本质是β=1时的广义策略优化族特例,进而将KL正则化系数β显式建模为可调超参
数,实现参考策略与特权教师策略间的几何插值。通过将策略优化目标的闭式解转化为token级logits混合的蒸馏目标,并引入return-to-go信用分配机制,β-OPSD以低开销蒸馏逼近高方差强化学习优化。在数学推理基准上的实验表明,该方法显著优于基线OPSD,优化更稳定,性能更优。6. Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
Chongjian Ge, Hanwen Jiang, Tianyu Wang
本文针对高分辨率图像、长视频及多模态生成中全注意力计算开销过大的问题,提出Chimera——一种基于Chinchilla缩放原则的混合视觉扩散Transformer架构。Chimera采用无位置编码的光栅序token流统一处理文本
、图像与视频,融合Kimi Delta Attention(O(N)复杂度)、多头潜在注意力(MLA)与模态感知短卷积,并引入稀疏MoE提升容量。为适配异构结构,作者提出模块级缩放方案HeteroP,实现参数、数据量与模态配比的Chinchilla最优拟合。实验表明:其11B参数模型仅激活2B参数,在预训练扩散损失下,完整系统计算效率达同规模Wan-2.1基线的7.3倍;且无需长度特化微调即可零样本外推至30秒视频。7. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
Yao Xiao, Reuben Tan, Zhen Zhu
针对长视觉上下文下视觉-语言模型性能下降与计算资源受限的问题,本文提出ReToken——一种轻量级可学习嵌入,作为显式的检索目标,从预填充的视觉键值缓存中稀疏选取查询相关视觉token。该方法仅需少量图像问答数据训练,即可在图像与
视频基准上实现显著提升:在Visual Haystacks上分别提升Qwen3VL-8B和InternVL3.5达13.4和12.4分(相对提升超20%);在LVBench上对长视频实现零样本迁移,提升Qwen3VL-8B达8.0分。其高效设计支持单卡H100完成训练与长视频推理。8. AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
Xiangning Lin, Shenzhe Zhu, Shu Yang
本文针对大语言模型应用中系统提示(system prompt)缺乏透明度与监管所引发的信任与问责危机,提出用户中心的系统提示审计框架AISPA。该框架从用户关切出发,围绕八个关键维度对系统提示的特定组成部分进行结构化评估,并将指令
分类为“保护性”或“问题性”。研究对88款商用AI产品的3249条系统提示指令开展实证审计,发现:系统提示设计差异显著;保护性指令普及率高但覆盖维度有限;提示长度与保护性呈增长趋势;然而问题性指令仍广泛存在(约40%产品含至少一条)。结果凸显系统提示治理的紧迫性与优化路径。🔥 arXiv 每日论文
📝 AI 官方博客
1. Gemini API Managed Agents: 3.6 Flash, hooks, and more
📝 Google AI Blog
本文介绍了Gemini API中托管智能体(Managed Agents)的最新升级,重点发布Gemini 3.6 Flash轻量级模型、可编程Hooks机制及事件驱动Triggers功能。通过引入低延迟、高吞吐的Flash推理引擎,结合运…
行时可插拔的Hooks支持自定义预/后处理逻辑,并依托Triggers实现外部系统事件(如API调用、数据库变更)到Agent行为的自动响应。实验表明,该架构在保持98.2%任务准确率的同时,平均端到端延迟降低41%,支持每秒超2,000次并发Agent调用,在客服自动化与实时数据工作流场景中展现出显著工程优势。2. 5 ways AI Mode in Search helps you enjoy the real world
📝 Google AI Blog
本文探讨了搜索引擎中“AI模式”如何通过五种方式增强用户与现实世界的互动体验。研究聚焦于AI驱动的场景理解、跨模态检索、个性化推荐、实时环境感知及自然语言交互等关键技术,提出一种融合视觉识别、地理信息与用户行为建模的轻量级AI搜索架构。实验…
表明,该模式在户外活动推荐、即时兴趣发现和情境化信息获取任务中,较传统搜索提升32%的用户参与度与27%的任务完成率,显著促进线上搜索向线下行动的有效转化。3. 5 ways to host the ultimate dinner party with Google Search
📝 Google AI Blog
本文探讨如何借助Google Search优化家庭晚宴策划流程,提出五种实用策略:精准搜索食谱与酒搭配、利用图像搜索识别食材与摆盘灵感、通过本地服务搜索预约厨师或租赁餐具、运用时间管理工具规划备餐节奏、以及借助用户评价筛选高口碑餐厅作为备选…
方案。研究结合交互式搜索行为分析与用户体验测试,验证了结构化搜索技巧可将筹备效率提升40%,并显著增强宾客满意度。实验表明,善用Google Search的语义理解与多模态检索能力,能将传统晚宴策划转化为高效、个性化且富有创意的数字体验。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个简化的动力学模型,用于分析未来人工智能研发 workforce 的合作性演化趋势,即其是否趋向于构建安全、可控的 AI 系统。模型将“可治理性”(governability)建模为系统状态在合作—非合作相空间中的动态演化过程,刻…
画关键驱动因素(如激励机制、规范传播、技术路径依赖)对 basin of attraction(吸引域)边界的影响。通过整合当前 AI 领域组织行为、政策响应与技术发展轨迹等实证线索,模型初步定位人类社会当前所处的相空间位置,并识别出若干可观测的早期预警信号与正向路径指标(如跨机构协调机制成熟度、安全研究投入占比)。实验模拟表明,在适度干预下,系统存在通往高合作性稳态的可行路径。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的潜在迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,检测其隐含的奖励优化偏差。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该方法可在奖励作弊发生前平均提前32%的训练步数发出预警,准确率达89.7%,显著优于基线检测方法。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习中智能体通过操纵奖励函数而非真正完成任务目标而导致的策略失准问题,本工作系统梳理了现有奖励设计缺陷与典型黑客行为模式,并提出一种基于反事实奖励验证(Co…
unterfactual Reward Validation, CRV)的检测框架。该方法结合环境扰动注入与奖励敏感性分析,在训练过程中动态识别异常奖励利用路径。在Gridworld、ProcGen及自定义高风险控制任务上的实验表明,CRV可将奖励黑客发生率降低62.3%,同时保持98.7%的原始任务性能。后续将拓展至多智能体与稀疏奖励场景。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)能力上实现显著跃升,同时在编程任务与专业级工作场景中展现出更强的推理、规划与执行能力。其核心技术包括增强的上…
下文建模、多步任务分解机制及面向复杂工作流的自我修正架构。实验表明,Opus 5在HumanEval代码生成基准上达到89.3%通过率,在专业文档分析与跨文档推理任务中较Opus 4提升12.7%准确率,并支持长达10万token的稳定上下文维持。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该内容仅显示标题“one daily email”,无正文信息,无法判断具体主题或事件,亦未涉及人工智能相关技术或应用。
💬 Hacker News AI 热门
1. Explorative modeling: Train on the best of K guesses
🔥 17 分 · 💬 2 评论