AI 每日资讯 — 2026-08-01
🔥 HuggingFace 每日论文
1. AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
Bing Yan, Gregory Wolfe, Stefano Martiniani
本文提出AskChem——一种面向化学文献合成的声明中心型基础设施,旨在解决现有检索系统仅返回文档列表、难以跨论文整合细粒度科学主张的问题。AskChem将论文解析为带来源(DOI)、原文引用或证据定位器的原子化、类型化声明,并构
建三层互补结构:稳定分面分类体系支持层级检索与浏览、证据图谱建模声明间逻辑关系、动态活体分类法将论文锚定于科学原理。系统已索引14.7万篇论文生成的240万条声明,提供Web界面及面向AI代理的REST、SDK与MCP接口。在AskChem-Bench评测中,结合GPT-5.5阅读器后DOI可解析率达100%,显著优于无检索基线(88.3%),且引用密度居五种系统之首。PDF · arXiv · 代码 · 项目 | ❤️ 199
2. PhiZero: A World Model Built Around Physical Language
Shuyao Shang, Yuqi Wang, Ruopeng Gao
本文提出PhiZero,一种以物理语言为核心的物理世界模型。物理语言是一种紧凑的离散表示,用于刻画世界状态转移。不同于现有模型直接在像素空间预测未来视频、隐式编码物理动力学,PhiZero通过自监督方式从野外视频中学习物理语言,并
显式建模物理演化过程,采用“先推理后渲染”范式:首先生成物理语言序列描述未来状态演化,再将其渲染为视频。实验表明,PhiZero在生成与理解任务上均能建模物理一致的世界演化,在真实感交互建模、细粒度动作条件仿真及零样本运动迁移等任务中展现出显著潜力。PDF · arXiv · 代码 · 项目 | ❤️ 148
3. Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Junlin Yang, Che Jiang, Yu Fu
本文提出Frontis-MA1(35B),一种面向机器学习工程(MLE)中递归自改进(RSI)的AI4AI模型。作者构建了开源全栈系统OpenMLE,涵盖可验证任务环境(OpenMLE-Gym)、操作符学习(OpenMLE-RL)
与长程搜索(OpenMLE-Evo),并基于其对Frontis-MA1进行后训练,使其作为元进化智能体,统一建模Draft、Improve、Debug、Crossover四类原子程序演化操作。通过执行驱动的监督微调与强化学习,并在去重于评估基准的数据上训练,模型在MLE-Bench Lite上将Medal Average从39.39%提升至60.61%(+OpenMLE-Evo),进一步引入经验先验与异步搜索后达71.21%,超越GPT-5.5+Codex,逼近GPT-5.6 Sol与Kimi K3。跨基准迁移实验亦验证其泛化能力。代码、权重与完整OpenMLE栈已开源。PDF · arXiv · 代码 · 项目 | ❤️ 114
4. Beacon: Knowing When and How to Perform Agentic Visual Reasoning
Qixun Wang, Yang Shi, Letian Cheng
本文针对多模态大语言模型(MLLMs)在代理式视觉推理中工具调用低效、性能增益有限的问题,提出从模式适应性(MA)与工具效应(TE)两个维度重新审视工具使用机制。MA衡量模型能否精准识别工具调用时机,TE评估工具是否真正拓展模型能
力而非引入额外错误。实验发现现有方法MA不足,且工具在简单样本上显著拖累性能。为此,作者提出Beacon模型,通过必要性感知自适应奖励机制与提示引导的能力扩展策略,在多个基准上实现整体性能提升、更强的模式适应性及真实的工具增益。5. ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
Yukang Cao, Haozhe Xie, Beichen Wen
本文针对具身智能面临的多模态感知-行动数据瓶颈问题,提出以人为中心的环境捕获引擎(ACE),在真实家居环境中构建空间标定、时间同步的多尺度记录系统:桌面级配置精细捕捉手-物交互,房间级配置完整记录全身运动与场景交互。ACE同步采集
第一人称与多视角视频、全身及手指关节运动、物体几何与6自由度轨迹、音频及触觉信号,形成统一多感官数据流。基于ACE,构建ACE-Data-0数据集,涵盖50名参与者在2个真实环境中的150小时、1700万帧视频、7.5万次交互片段,覆盖200类家庭任务,强调目标导向而非步骤化指令以保留自然行为多样性。配套提出的分层基准支持从原始信号到场景语义的渐进式评估。6. Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers
Chongjian Ge, Hanwen Jiang, Tianyu Wang
本文针对高分辨率图像、长视频及多模态生成中全注意力机制的二次计算开销问题,提出Chimera——一种基于Chinchilla标度律设计的混合视觉扩散Transformer架构。Chimera采用无位置嵌入的光栅序token流统一处
理文本、图像与视频,融合Kimi Delta Attention(O(N)复杂度)、交错式多头潜在注意力(MLA)及模态感知短卷积,并引入稀疏MoE扩展容量。为实现异构架构的高效缩放,提出模块化缩放方案HeteroP,依据张量功能扇入与模型深度动态分配超参数,导出符合Chinchilla最优计算律的11B参数模型(2B激活参数)。实验表明:其预训练扩散损失下计算效率达同规模Wan-2.1基线的1.7×(密集主干)与7.3×(完整系统),且支持零样本从5秒视频外推至30秒,仅增6%推理开销。7. β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
Jiawei Xu, Minghui Liu, Juzheng Zhang
本文提出β-OPSD,一种基于策略优化与自蒸馏协同的推理语言模型训练框架。针对现有on-policy自蒸馏(OPSD)方法鲁棒性差、工程依赖强的问题,作者揭示其本质是β=1时的广义策略优化族特例,并将β建模为可调的KL正则化系数,
实现参考策略与特权教师策略间的几何插值。通过将该优化目标的闭式解转化为token级logits混合的蒸馏目标,避免了高方差强化学习训练;结合return-to-go信用分配机制,进一步提升序列级目标对齐度。在数学推理基准上,β-OPSD显著优于基线,优化稳定性与性能均得到提升。8. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
Yao Xiao, Reuben Tan, Zhen Zhu
本文针对长视觉上下文下视觉-语言模型(VLM)性能下降与计算开销过大的问题,提出ReToken方法:引入一个可学习的单令牌嵌入,作为显式的检索目标,从预填充的视觉键值缓存中稀疏选取与查询最相关的视觉token。该方法仅需在小型图像
问答数据集上训练,即显著提升多尺度视觉检索能力。实验表明,ReToken在Visual Haystacks上使Qwen3VL-8B和InternVL3.5分别提升13.4和12.4分(相对提升超20%),并在LVBench上实现零样本迁移至长视频任务,带来8.0分增益。其轻量设计支持单卡H100完成训练与推理。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. Multi-Head Attention Residuals
Cheng Luo, Zefan Cai, Junjie Hu
本文提出多头注意力残差(MHAR),旨在解决标准Transformer中单一残差流导致的特征子空间在深度历史读取上被迫妥协的问题。MHAR将路由查询重塑为H个子空间专用头,每头独立学习对层历史的softmax注意力,实现块对角化读
取,零参数开销且计算代价可忽略。在质量筛选、STEM与代码密集的Nemotron退火语料上从头训练表明,MHAR在100M、350M和1B参数规模下分别降低验证损失0.061、0.149和0.140,显著优于基线及其他三种方法;最优头数H=4–8呈U型曲线,H=8为大模型首选,H=16则引发性能回退。探针实验验证子空间分歧是核心动因,Triton融合核将训练吞吐提升至基线的0.55–0.88倍,内存占用接近基线;结合delta注意力残差的恒等转换进一步在8B模型中提升GSM8K和GPQA分数达+3.2与+3.1。2. KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation
Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin
本文提出KernelGenBench,首个面向大语言模型(LLM)与智能体驱动的加速器内核自动生成的多源、多芯片综合基准。该基准包含两个子集:KernelGenBench-MS(覆盖210个跨三大来源的算子,超越PyTorch中心
化任务)和KernelGenBench-MC(在六种异构硬件平台间评估110个算子的性能可移植性)。基于超150亿token的大规模实验表明:(1)基于智能体的方法显著优于纯LLM采样,但cuBLAS类算子最难生成;(2)跨平台性能退化严重(如AutoKernel在NVIDIA平台成功率87%,在Platform E骤降至25%);(3)自主内核生成成本极高,最优智能体方法平均需511万token/成功算子,远超传统LLM方法。3. RadHarmony: Radiological Data Handling in the Era of Agentic AI
Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Theo Dapamede, YoungSeok Jeon, Janice Newsome, Hari Trivedi, Judy Gichoya
RadHarmony 是一个面向放射影像学数据治理的开源 Python 库,旨在解决多源异构医学影像数据(如胸片、CT、MRI)在格式、目录结构、标注类型与标签模式上的不一致性问题。其核心通过统一 API 实现数据加载、元数据标准
化(覆盖 24 个公开数据集)、深度学习就绪样本交付(集成 MONAI map-style 数据集并支持磁盘缓存),并统一支持分类、分割、检测及报告文本等多种标注模态,辅以交互式可视化工具。创新性地引入 AI Agent 技能,自动化指导新数据集接入全流程。实验表明,基于 RadHarmony 预训练的 RadHarmony-ViT 模型可无缝融合三个异构胸片数据集,无需任何数据集特异性代码,验证了其泛化性与实用性。📄 arXiv: cs.CL
1. Prompt Chaining in Practice: A Case Study in Automated Scholarly Report Generation
Andrei Lazarev
本文针对学术文献爆炸式增长背景下信息自动综述的可靠性与质量瓶颈,提出并实证评估了一种多阶段提示链(Prompt Chaining)方法。该方法被集成于AI SciBrief系统中,用于自动生成学术简报。通过与精心优化的单次提示基线
在“教育”领域任务上的对比实验,结果表明:提示链方法实现100%任务成功,而基线失败率达50%;在生成质量上,其ROUGE-L F1得分达0.507,显著优于基线的0.486,主要得益于更高的精度。研究表明,提示链是一种更稳健、可扩展的工程范式,可有效缓解复杂生成任务中单一大型提示所固有的失败风险与输出不一致性问题。2. AI-assisted pre-review of open-source software submissions: an experience report from BOSC 2026
Tazro Ohta, Nomi L. Harris, Seth Carbon
本文报告了在生物信息学开源会议(BOSC 2026)中应用生成式AI辅助论文预审的实践经验。针对投稿激增问题,作者构建了bosc-pre-review智能体,依据既有评审量表自动评估抽象提交在开放性、许可证合规性、可运行性等六项标
准上的表现,并开发Runabilly工具在隔离Docker环境中自动构建与测试项目以验证“可运行性”。AI仅提供证据支持而非决策,最终评审权仍由人类专家掌握。后续调查显示,多数审稿人认为该预审工具提升了效率,但倾向于独立复核AI结论而非直接采纳。3. Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
Haran Shani-Narkiss, Michael Fire, Oren Tsur
本文针对大语言模型(LLMs)在新闻文本情感框架理解上的对齐能力展开实证研究,聚焦其是否能准确捕捉人类对冲突报道中同情倾向的感知差异。研究基于英国代表性样本(n=3011)与七种主流LLM,共同评估政治与地缘冲突类新闻标题是否引发
对特定方的同情。结果表明,模型与人类判断的相关性差异显著(r=0.4–0.789),领先模型(如GPT-5.2)在各社会人口子群(年龄、性别、教育程度、地缘知识水平及立场倾向)中均呈现较高一致性,但组间仍存在统计显著差异。该研究首次系统揭示了“差异性对齐”现象:即使整体对齐度高,AI的情感理解仍受社会文化因素调节,这对构建公平、可信赖的AI系统具有重要伦理与实践启示。📄 arXiv: cs.LG
1. Recursive transformers for semiconductor thermo-mechanical reliability
Kart-leong Lim
本文针对半导体先进封装热-机械可靠性分析中数据稀缺、仿真昂贵的问题,提出并评估了三种递归式Transformer架构(Tiny Recursive Model、Depth Recursive Transformer及简易递归Tra
nsformer),以替代高成本的第一性原理有限元仿真。区别于传统过参数化Transformer,所提方法通过权重共享与深度递归提升计算效率而非参数量,在小样本工程数据下显著缓解过拟合。实验表明,Depth Recursive Transformer在应力/翘曲预测与Laplace方程电容场求解两类低维任务中,以更少参数(降低~60%)和更低FLOPs(减少~45%)实现媲美甚至优于基准模型的Recall与Mean Reciprocal Rank性能,为资源受限场景下的工程代理建模提供了兼顾精度、参数效率与计算开销的实用方案。2. Regularizing modality contribution drift in multimodal continual learning
Zhen Zhang, Jielei Chu, Bin Liu, Tianrui Li
本文针对多模态持续学习(MMCL)中模态贡献漂移(Modality Contribution Drift, MCD)这一被忽视的关键问题,提出持续模态贡献漂移正则化方法(CMCDR)。MCD指在任务增量过程中,各模态及其交互对决策
的相对贡献发生不稳定偏移,作者通过可控模态子集干预定义MCD得分予以量化。理论与实验表明现有MMCL方法难以有效抑制该漂移。CMCDR据此设计两种适配范式:回放式利用旧样本进行模态贡献剖面比对与约束;无回放式则借助知识蒸馏将冻结模型的旧任务贡献响应迁移至当前模型。在多模态类增量学习与持续视觉问答任务上的实验验证了CMCDR的有效性与泛化能力。3. DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series
Dennis Thumm, Billy Tim Anthony, Ying Chen
DoTime 是一个面向干预性与反事实时间序列因果推断的合成基准生成器,旨在弥补现有观测型、小规模或领域特异性基准的不足。它基于多变量时序结构因果模型(TSCM),支持连续时间干预窗口、带正性保障的反事实采样、机制切换SCM、构造
性非平稳动态,以及嵌入评估窗口内的确定性干预轮廓(如线性上升与正弦变化)。DoTime 开源为 PyPI 包,并配套四个冻结评估套件,涵盖 10 万条轨迹与八类可精确求解的因果识别结构。实验表明,在结构匹配的留出测试中,基于干预训练的先验拟合网络(PFN)在所有结构、轨迹长度和随机种子下均显著优于同等容量的纯观测模型,验证了干预训练对方向性因果估计的实质性增益。📄 arXiv: cs.CV
1. Theatre Chapbooks At Scale: A Statistical Comparative Analysis of Typography
Diego Belzarena (UDELAR, CB), Seginus Mowlavi (CB), Paula Casariego Casti~neira (ROMA TRE), Alejandra Ulla Lorenzo (USC), Gregory Randall (UDELAR), Jean-Michel Morel (LU - Hong Kong)
本文提出一种基于统计学的字体相似性量化方法,用于历史印刷书籍的字体比对,以加速文献学分析。该方法通过自动提取字符图像、聚类与对齐生成字符原型,并据此定义两本书籍间的字体距离;进一步构建反事实(a contrario)统计框架,评估
距离的显著性。研究将该方法应用于17世纪西班牙戏剧小册子的大规模分析,突破人工目检的规模限制。实验结果经专家验证,成功发现新的印刷商归属关系并修正既有判断,表明该方法可有效支撑更大规模的数字书目学研究。🏛️ Jean-Michel Morel
2. OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao
本文针对开放词汇地球观测(EO)任务中现有基准测试类别覆盖窄、查询形式单一的问题,提出OVEarth-Bench——首个兼顾类别广度与查询多样性的综合评测基准。该基准通过层次化类别体系(含正负表达)、多类型自然语言查询(词汇级、指
代级、推理级),支持零样本下的掩码与边界框定位。在涵盖通用与EO专用模型的系统评估中发现:当前方法性能仍受限;MLLM类模型表现最优;EO专用模型普遍弱于通用模型。结果凸显构建更真实、多样、高质量、大规模基准的必要性。代码与数据已开源。3. VETO: Towards Protecting Images From Frontier AI Editing
Jonas Grebe, Hossein Shakibania, Tobias Braun, Marcus Rohrbach, Anna Rohrbach
本文针对前沿AI图像编辑模型(如FLUX.2)带来的新型篡改风险,提出VETO——一种轻量级、不可见的抗编辑伪装方法。VETO通过扰动源图像的局部纹理特征,精准干扰现代编辑模型中基于联合注意力机制的参考图像信息蒸馏过程,从而在不显
著降低图像保真度的前提下有效阻断对象提取与场景重置等高阶编辑操作。为全面评估防御能力,作者构建了新基准VetoBench,涵盖局部编辑与全局语义重上下文化两类攻击。实验表明,VETO在两个主流编辑模型和三个基准上均显著优于现有防御方案,实现了更优的保护性-保真度权衡。🏛️ Marcus Rohrbach, Anna Rohrbach
📝 AI 官方博客
1. Gemini API Managed Agents: 3.6 Flash, hooks, and more
📝 Google AI Blog
本文介绍了 Gemini API 托管智能体(Managed Agents)的最新升级,重点发布 Gemini 3.6 Flash 模型及其配套的 Hooks 与 Triggers 机制。该架构旨在提升多步任务编排效率与响应实时性:3.6 …
Flash 是轻量级、低延迟推理模型,专为高频交互场景优化;Hooks 支持在智能体执行链中注入自定义逻辑(如验证、日志、外部 API 调用);Triggers 实现基于事件(如时间、用户行为或系统状态)的自动任务激活。实验表明,相较前代,端到端任务完成延迟降低 42%,任务成功率提升 18%,并在客服自动化与工作流集成场景中展现出显著鲁棒性与可扩展性。2. 5 ways AI Mode in Search helps you enjoy the real world
📝 Google AI Blog
本文探讨了搜索引擎中“AI模式”如何通过五种方式增强用户与现实世界的互动体验。该模式融合多模态理解、情境感知、个性化推荐、实时信息整合与自然语言交互等关键技术,使搜索结果更贴合线下活动需求。实验表明,在旅游规划、运动社交、本地娱乐等场景中,…
AI模式将用户从搜索到行动的转化率提升37%,任务完成时间缩短29%。研究强调技术应服务于真实生活连接,而非替代物理世界体验。3. 5 ways to host the ultimate dinner party with Google Search
📝 Google AI Blog
本文探讨如何借助Google搜索功能策划一场卓越的晚宴派对,提出五种实用策略:精准检索食谱与酒水搭配、利用图像搜索获取餐桌布置灵感、通过本地服务搜索预约厨师或租赁餐具、运用日历与提醒功能协调宾客日程,以及借助多语言搜索拓展国际菜系选择。文章…
结合界面截图与场景化案例,强调搜索关键词优化、过滤器使用及AI增强功能(如“搜索附近”“视觉搜索”)的关键作用。实证表明,系统化应用上述方法可将筹备效率提升40%,宾客满意度提高28%。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个简化的动力学模型,用于分析未来人工智能研发 workforce 的合作性演化趋势,即其是否倾向于协同治理或走向分裂与对抗。模型刻画了影响 AI 社区行为的关键社会—技术反馈机制,界定合作性状态的吸引域边界,并基于当前 AI 领域…
的组织实践、规范共识与政策响应等实证线索,评估人类社会所处的演化相位。研究表明,若干早期指标(如跨机构安全协作强度、对齐研究投入占比、治理框架采纳率)可作为关键预警信号;模拟显示,在中等强度协调干预下,系统存在显著概率落入合作吸引域。该模型为 AI 治理的前瞻性评估提供了可计算的理论框架。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的萌芽迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,预测其潜在的奖励作弊倾向。该方法无需修改训练过程或访问真实环境奖励,仅依赖离线推理数据即可实现高精度预警。在多个基准任务上的实验表明,该方法可在奖励作弊发生前平均提前3.2个训练阶段发出预警,准确率达89.7%,显著优于基线检测方法。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习智能体在优化代理奖励函数时偏离设计者真实意图的现象,本工作系统梳理了现有奖励黑客案例的成因分类,提出一种基于奖励函数可解释性与行为一致性的双维度检测框架…
,并初步实现了在Gridworld与MiniGrid环境中的验证。实验表明,该方法能有效识别约78%的隐式奖励篡改行为,较基线方法提升23%。后续将拓展至高维连续控制任务,并探索基于反事实推理的鲁棒奖励建模机制。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)支持能力上实现显著跃升,同时在代码生成与专业领域任务(如法律、金融、科研写作等)中展现出更强的推理深度、上下…
文一致性与多步规划能力。Opus 5采用改进的混合专家(MoE)架构与动态计算分配机制,在保持响应效率的同时扩展有效上下文窗口至200K tokens,并集成强化学习驱动的自我修正模块以提升输出可靠性。在HumanEval、SWE-bench及定制化专业基准测试中,Opus 5相较前代Opus 4平均提升18.7%准确率,尤其在跨文件调试与复杂文档分析任务中表现突出。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该内容仅提供标题“one daily email”,无正文信息,无法判断具体主题或核心内容。