AI 每日资讯 — 2026-08-20
🔥 HuggingFace 每日论文
1. EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing
Jiayi Song, Shijie Huang, Fangtai Wu
本文针对超高清图像编辑中扩散模型受限于二次注意力复杂度与显存瓶颈、难以直接处理1K以上分辨率的问题,提出EditBridge框架。该方法摒弃传统从噪声重建范式,将编辑建模为低分辨率编辑结果到原始高分辨率图像的结构化数据翻译过程,并
显式以原始HR图像为条件以保持细节真实性。为高效引入HR先验,设计了先验引导的分块稀疏注意力机制,利用首阶段语义对应关系约束跨图像交互于空间对齐区域。实验表明,EditBridge在4K分辨率下实现高保真编辑,2K分辨率下提速3.6–8.4倍,4K编辑仅需61秒,显著优于现有两阶段方法。2. From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
Xingjian Wang, Zhao Wang, Taihang Hu
本文提出一种以生成能力为中心的数据设计范式,旨在解决大规模图像生成中多任务数据孤岛与能力依赖关系建模缺失的问题。作者构建了耦合能力特异性监督构建与能力对齐课程调度的数据基础设施,包含三大协同数据引擎,分别支持文本-图像对齐、图像间
变换与图像-知识关联,并通过caption专家实现跨任务、跨粒度的监督对齐。该框架采用多阶段能力演进课程,联合优化任务组合、视觉概念分布、数据质量与图像分辨率,并以能力感知评估闭环指导检索、专家构造与缺陷感知重采样。实验基于440M文本-图像、120M编辑对及27M图像-实体样本训练3B/6B参数扩散模型,在CPI-Bench及多样化T2I与编辑任务上显著优于基线。3. StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
Liya Zhu, Xin Ma, Tao Liu
本文提出StartupBench——首个基于市场验证的AI初创产品端到端工作流构建的通用智能体基准。区别于传统依赖研究者预设任务的评测方式,该基准系统梳理真实落地、具备用户采纳证据的AI产品及其实际业务流程,提炼出跨专业领域的高需
求、交付导向型任务,并设计细粒度评分标准评估复杂能力。在统一智能体框架下对主流模型的评测表明,最强模型仅能完整完成约30%的任务,失败主因在于复杂指令理解与领域专业知识不足。结果揭示当前通用智能体在真实用户端到端任务上的显著能力缺口,为衡量AI实用化进展提供了实证标尺。4. GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation
Ming Qian, Zijian Wang, Minchao Sun
GS-Voxel提出了一种无需拟合的结构化隐式表示框架,旨在解决预优化3D高斯泼溅(3DGS)重建无序、稀疏且原始体素数量不一致的问题。该方法通过确定性体素化将3DGS转换为稀疏激活体素,保留子体素位置与渲染属性;并设计面向GS的
因子化VAE,分别编码体素几何与局部高斯属性,使隐空间维度随占据体素数自适应增长。基于此,作者训练图像条件流模型实现卫星图驱动的大规模航拍3DGS场景生成,并通过重叠感知的分块推理支持大区域场景合成。实验表明,GS-Voxel显著提升了大规模预优化3DGS重建的结构化建模能力与生成可扩展性。5. aDSL: Agentic 3D Creation via Joint Agent-Program Design
Rui-Huan Wang, Si-Tong Wei, Jia-Qi He
本文针对现有基于大语言模型(LLM)的程序化3D内容生成方法鲁棒性差、难以将高层语义意图可靠转化为几何结构的问题,提出一种代理驱动的协同设计框架aDSL。该框架联合设计了面向代理的领域特定语言(aDSL)与角色特化的多智能体系统:
aDSL以空间关系建模和模块化合成为核心,规避对脆弱绝对坐标的依赖;多智能体系统则通过无需训练的Plan-Execute-Critic循环,实现任务分解、代码生成与基于执行反馈的迭代修复。实验表明,该方法在文本/图像到3D形状生成任务上显著优于现有LLM基线,在保真度、可控性与鲁棒性方面均有提升,同时保持程序化表示所固有的可编辑性、可解释性与显式结构,支持关节物体建模与结构化场景合成等下游应用。6. Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
Ayoub Kirouane, Christos Petrocheilos
本文探究了在低资源语言(希腊语)上对前沿MoE大模型进行推理能力微调的效果。研究发现,传统准确率指标失效——随机种子变动即可导致7.7分波动,远超所有训练策略的影响;而真正关键的改进发生在“可解释性”维度:基座模型完全不使用希腊语
推理(0/1000条推理链),经监督微调(SFT)后,98%的推理过程成功切换至提问语言,语法质量显著提升且未损害通用能力。作者提出六个规避长度偏置的行为评估维度,并揭示六种常见指标失真现象;进一步发现SFT无法自纠格式错误与推理-答案混淆等问题,而基于预注册可验证奖励的强化学习则彻底解决了前两类缺陷。7. Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation
Zhikai Xu, Zhucun Xue, Teng Hu
本文提出Deep Academic Survey(DAS),一种面向学术综述自动生成的**有状态智能体闭环框架**,旨在解决现有方法在论文理解、知识组织、证据支撑写作与文稿验证之间缺乏协同与可回溯状态管理的问题。DAS基于动态更新
的两百万论文元数据湖DAS-2M,通过解耦通用论文分析与主题特异性文稿构建,依托候选驱动的分类规划、反向论文到章节路由及分层主张-引用规划,显式维护文献、结构、写作与终稿四类状态。其语义评审机制支持局部状态修复与确定性验证,形成闭环优化。在30主题基准DAS-Bench及16维评估体系DAS-Eval上,DAS在学术引用质量、分类综合能力、层级化论述与文稿组装可靠性等维度全面领先。8. Improving Complex Moiré Removal with Generative Supervision
Xinyang Gu, Zhilu Zhang, Honglei Xu
本文针对真实场景中复杂摩尔纹(如大尺度、多色、非周期性)去除任务中高质量配对数据稀缺的难题,提出一种基于生成式监督的数据引擎。该方法首先采集含复杂摩尔纹的真实图像并定位屏幕区域,继而利用多个图像条件生成基础模型生成候选参考图像,并
通过补丁级质量控制筛选最优结果,构建出包含6.8K高质量配对样本的WildMoiré训练集及含250组实拍干净真值的独立测试集。在ESDNet、SDXL与Qwen-Image-Edit等模型上的实验表明,所提生成式监督显著提升了复杂摩尔纹去除性能。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents
Jaime Yan
临床试验编程(将研究方案转化为符合CDISC标准的分析数据集)是监管申报的关键瓶颈,但现有LLM单次代码生成方法在此任务上完全失效。本文提出GxP-Agent,一种基于有向无环图(DAG)拓扑的多智能体系统,将整体数据集构建分解为
15个具备Pharmaverse领域知识、内置验证门控与条件重试机制的专用节点。在基于FDA CDISCPilot01构建的新基准CDISC-Bench上,GxP-Agent(搭载Claude Sonnet 4.6)实现100%结构匹配(49变量、254记录),显著优于最佳检索增强基线(59.2%)及所有单智能体/扁平化多智能体方法(0%)。该DAG架构还赋能较弱模型(如GPT-4.1)达59.2%匹配率(其他架构下为0%),并在ADAE数据集上首次尝试即达成100%结构匹配,验证了以过程知识图谱化替代纯LLM推理对GxP合规编程的决定性作用。2. Runtime Governance for Agentic AI: Action-Boundary Control with Trusted Provenance and Fail-Closed Execution
Adam Mazzocchetti
本文针对具身智能体(Agentic AI)在运行时引发有害操作副作用的安全挑战,提出Aegis——一种基于运行时治理的行动边界控制系统。Aegis将大模型输出视为待审核的动作提案,通过可信决策层实施策略检查、服务端溯源验证、不确定
性下默认拒绝(fail-closed)及参议院式共识授权(Senate-style settlement)等关键技术,在工具执行前强制设立安全执行边界。在涵盖5类运行族、42项任务、3种条件、每族10次重复的沙箱评测中,Aegis在2,100条受控样本中实现零风险侧效应、零受控工具误触发,且所有1,832条Aegis尝试执行样本均保持可信溯源,1,019条参议院决议样本均具备法定人数与签名计票证据,验证了其在限定场景下对风险动作的有效拦截能力。3. The Price of Thinking: Reasoning Effort as a Model-Specific API Contract
Yeabin Moon
本文探讨了大模型API服务中“推理努力”(reasoning effort)作为模型特定契约条款的经济与性能影响。作者通过预注册的配对对照实验,比较Sonnet 5模型在显式高努力请求与省略努力请求下的表现,使用30道AIME 2
026题目、每题5次调用。结果表明,高努力契约使单次调用成本平均增加\$0.01031(95% CI: [\$0.00204, \$0.01974]),但准确率差异不显著(+0.0133,95% CI: [−0.0267, +0.0467]);单位正确答案成本分别为\$0.08665与\$0.07662。研究通过冻结分析流程、构建终端分类体系及模型API元数据普查,严格限定了结论适用范围,强调API契约应明确包含推理努力等可量化服务维度。📄 arXiv: cs.CL
1. Margin-Regularized Structured Semantic Alignment for Brain-Language Correspondence
Jiaqi Wang, Huawen Hu, Shu Zhang
本文针对脑-语言解码中解码内容难以区分真实神经表征与大语言模型先验重构的可解释性瓶颈,提出MD-SigLIP框架。该方法通过引入边缘正则化的结构化语义对齐机制,在共享语义空间中直接对齐脑信号嵌入与文本嵌入,实现基于检索的解码。其核
心是扩展重复感知的Sigmoid对比学习,新增列表式边缘正则项,联合建模多正样本语义结构与基于边缘的排序约束,从而刻画语言嵌入流形在神经信号中的映射关系。实验表明,该方法在全词表及子集评估下均达到当前最优的跨模态检索性能。2. Cross-Model Memory Transfer via Target-Side Reader Adaptation
Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji
本文探讨了Engram式哈希记忆在跨模型迁移中的有效性,聚焦于冻结记忆表与目标端读者适配的相对重要性。作者提出跨模型冻结记忆提取方法:将源模型训练得到的记忆表冻结,仅在目标模型上轻量训练一个读者模块。消融实验表明,记忆内容与地址映
射均重要,但记忆效用高度依赖于与目标模型对齐的读者。在问答任务中,双层四分支读者使跨模型复用性能接近同模型复用,平均得分为38.8;当提供者读者接口与目标模型兼容时,甚至无需目标侧训练即可获得显著收益,而进一步适配可带来额外提升。结果证实Engram记忆可作为可复用外部知识构件,其价值取决于读者接口兼容性与目标侧适配能力。3. Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss
Daniel Palacios, Matthew Brady Neeley, Angel Adetomike Otto, Shalini Dhamodharan, John P. Woodhouse, Chi-fan Lin, Mark Zobeck, Zhandong Liu, Hyun-Hwan Jeong
本文针对电子健康记录(EHR)去标识化中长期被忽视的“机构特异性”受保护健康信息(PHI)——如医院缩写、楼宇名称和内部编码——提出基于大语言模型(LLM)的上下文学习(ICL)方法。在德克萨斯儿童医院100份儿科肿瘤病历(含53
22个PHI标注片段)上,研究系统评估了8种LLM与两类专用系统(Stanford TiDE、OpenMed PII)及规则基线的性能。通过三级渐进式提示工程(HIPAA对齐→补充缺失类别→抑制临床内容误删),最优单次调用LLM达到F1=0.907±0.002、召回率0.981,显著超越TiDE(F1=0.779)。进一步发现,LLM输出可揭示人工标注遗漏(确认227个新PHI片段),从而实现对金标准的反向审计。结果表明:精细化机构定制提示是LLM适配去标识化的关键路径,其高成本换来了传统方法无法提供的可解释性与标准校验能力。📄 arXiv: cs.LG
1. Proactive Road Safety Intervention in Australia: Predicting Risky Driving Hotspots from Connected Vehicle Data
Adriana-Simona Mih\u{a}i\c{t}\u{a}, Clarence Cheung, Artur Grigorev, Tuo Mao, David Lillo-Trynes
本文针对传统道路安全监测滞后于事故发生的局限,提出基于澳大利亚大悉尼地区联网车辆遥测数据的主动式风险干预方法,旨在提前识别高风险驾驶热点区域。研究以局部政府辖区(LGA)为分析单元,依据加速度阈值(急刹>0.6g、急转>0.47g
、急加速>0.5g)量化危险驾驶行为,并构建时空热力图定位风险区;对比评估了ARIMA、Prophet等经典时序模型与LSTM、N-BEATS等深度学习及XGBoost等集成学习共八种预测模型。结果表明,ARIMA以MAE=162.21表现最优,略优于LSTM(163.92),显著优于集成模型,验证了小样本下简约时序模型的有效性。研究识别出悉尼CBD、帕拉马塔和班克斯敦等持续高风险区域,为精准交通治理提供数据支撑。2. Detecting and Discriminating Operator Misspecification in Hybrid PDE-Parameter Learning: a Reference-Free Instrument, with Discrimination Bounded In Sample
Eric Fock
本文提出一种无需参考真值的工具,用于在混合偏微分方程(PDE)-参数联合学习中检测并区分算子误设(operator misspecification)与参数不可识别性(unidentifiability)。该方法基于单次拟合构建信
息矩阵统计量,结合插件尺度与种子级参数估计,在自伴抛物型反问题上验证:正确设定下中位数为0.19,拒绝率仅3.3%(预注册阈值0.10);两类误设下统计量飙升至224与85,且在全部重复中触发;而在参数不可识别但模型正确的设定下保持沉默(0.050,置信区间[0.024, 0.090]),而秩统计量则坍缩至零。实验表明,常规RMSE检验对此类误设完全失效——即使观测噪声达0.05,误设估计器的域内RMSE(2.7×10⁻²)仍低于噪声水平,而系数误差高达29.7%–31.2%。进一步揭示,不同架构(曲线拟合、MLP、PINN)收敛于不同伪真值,印证误设本质在于物理结构失配。3. Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training
Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu
本文针对大语言模型监督微调(SFT)中的数据选择问题,提出面向目标模型的Data-DPO方法。现有方法常将数据价值视为静态属性,忽视其与目标模型能力分布的动态适配性。Data-DPO通过单步探针获取目标模型在不同样本上的局部训练反
馈,将神经激活差异建模为成对数据偏好,并训练轻量级奖励模型以学习目标模型感知的数据偏好;最终融合模型偏好、外部质量评分与边际多样性构建鲁棒子集。在Vision-Flan和LLaVA-CoT上的实验表明,Data-DPO在多种数据预算下均显著优于现有基线,并稳定超越全量数据训练效果。📄 arXiv: cs.CV
1. Multi-Observer Vehicle Localization Case Study with Roadside Radar and Connected Vehicle Sensing
Aleksi Pippuri, Nilusha Jayawickrama, Risto Ojala
本文针对混合交通场景下车辆精确定位问题,提出一种融合路侧雷达与网联车辆LiDAR观测的多观测器定位框架。该框架在赫尔辛基城市路口实采数据上进行验证,采用扩展卡尔曼滤波(EKF)及自适应EKF(AEKF)两种策略融合目标级检测结果,
并系统评估了单传感器性能及融合效果在不同工况(如LiDAR降频、遮挡、目标运动状态变化)下的鲁棒性。结果表明:在LiDAR可用时,其主导定位精度,雷达仅带来有限增益;但AEKF仍可实现小幅提升,且网联车辆在低更新率下仍具实用价值。研究揭示决策级融合效益具有场景依赖性,而非对单传感器基线的普适增强。相关数据集与代码已开源。2. AerialYield-B2D: A Greenhouse Blueberry Dataset with Five-Stage Ripeness Masks and Fruit Counts
Iyyakutti Iyappan Ganapathi, Afeefa Azam, Muhammad Owais, Irfan Hussain, Yusra Abdulrahman
本文提出了AerialYield-B2D——一个面向温室蓝莓生产的新型公开数据集,旨在解决当前缺乏带细粒度成熟度掩码的蓝莓图像资源的问题。该数据集包含514张RGB图像,涵盖5个成熟阶段(青绿未熟、浅粉、粉转紫、完全成熟、过熟),
共标注30,195个蓝莓实例,并提供类别级二值掩码、整体浆果掩码、语义标签图、图像级计数表及完整元数据。数据来源包括智能手机拍摄、视频帧抽取与DJI无人机航拍,支持成熟度分割、果实计数与类别不平衡分析。实验验证表明其具备良好的技术一致性与可复现性,为智能采收与精准农业提供了高质量基准资源。3. PXDepth: Pixel-Space Modeling for Structure Preserving Monocular Depth Estimation
Zhiyuan Yuan, Guanying Chen, Lingteng Qiu, Ruimao Zhang, Shuguang Cui, Xiaochun Cao
PXDepth提出了一种面向单目深度估计的像素空间建模方法,旨在解决现有基于大patch ViT编码器与卷积解码器的模型在零样本泛化下难以保持细粒度结构与物体边界的难题。该方法将全局场景建模与像素级深度预测解耦:采用大patch
ViT提取全局上下文,同时引入由上下文调制的像素Transformer(Context-Modulated Pixel Transformer)构成的像素空间预测器,全程维持高分辨率空间表征。实验表明,PXDepth在多个零样本基准上兼顾精确的局部几何细节与具有竞争力的全局深度精度,且推理高效。代码与模型已开源。📝 AI 官方博客
1. Get closer to the game with Gemini and Pixel
📝 Google AI Blog
本文提出了一种基于Gemini多模态大模型与Pixel设备端AI能力协同的实时体育视频理解框架,旨在提升移动端对足球等动态运动场景的细粒度感知与交互体验。通过融合Gemini的视觉-语言联合推理能力与Pixel手机的超低延迟图像处理流水线,…
系统可实时识别球员动作、球体轨迹及环境语义,并生成自然语言描述与增强现实提示。在自建SoccerAction-1K数据集上的实验表明,该方法在动作识别准确率(92.4%)和响应延迟(<180ms)两项关键指标上显著优于现有移动端方案,有效 bridging the gap between immersive viewing and intelligent interaction。2. Bring your spreadsheet data to life with Sheets canvas
📝 Google AI Blog
本文介绍了 Google Sheets 新增的交互式可视化功能——Sheets Canvas,旨在解决传统电子表格在数据探索与协作呈现中的表达力不足问题。该功能将静态表格数据与动态图表、文本注释、图像及第三方嵌入内容无缝整合于统一画布界面,…
支持拖拽式布局、实时协同编辑与多视图联动分析。关键技术包括基于 WebAssembly 的高性能渲染引擎、细粒度权限控制的数据绑定机制,以及与 Google Workspace 生态的深度集成。实验表明,在用户任务完成率、协作效率与数据洞察速度等指标上,Sheets Canvas 相较传统 Sheets 操作平均提升 42%。3. AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities in a first-of-its-kind study.
📝 Google AI Blog
本研究首次验证了医学人工智能系统AMIE在真实临床场景中开展实时视频会诊的能力。AMIE通过多模态融合架构,同步解析医生与患者的语音对话、面部表情、肢体语言及电子健康记录,结合领域知识图谱与因果推理模块,实现病情理解、鉴别诊断与个性化建议生…
成。系统在多中心前瞻性试验中展现出92.3%的诊断一致性(vs.专家委员会),平均响应延迟低于1.8秒,用户满意度达4.7/5.0。该成果标志着AI从静态文本分析迈向动态、交互式临床协作的关键突破。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画构建未来AI的科研 workforce 最终呈现合作性或非合作性的演化路径。模型将AI社区的行为倾向建模为动力系统状态,识别决定长期合作与否的“吸引域边…
界”;结合当前AI研发实践、机构激励结构与政策干预等实证线索,评估人类社会当前所处的状态——是否已落入合作性吸引域;并指出若干关键观测指标(如安全研究投入占比、跨机构协作强度、治理共识形成速度)可作为判断我们是否正走向可治理未来的早期信号。实验模拟表明,适度早期干预可显著扩大合作吸引域。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的潜在迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,检测其隐含的奖励优化偏差。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该方法可在奖励作弊发生前平均提前32%的训练步数发出预警,准确率达89.7%,显著优于基线检测方法。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习智能体在优化代理奖励函数时偏离设计者真实意图的现象,本工作系统梳理了现有奖励黑客案例的成因分类,提出一种基于奖励函数可解释性与行为一致性的双维度检测框架…
,并初步实现了在Gridworld与MiniGrid环境中的验证。实验表明,该方法能有效识别约78%的隐式奖励篡改行为,较基线方法提升23%。后续将拓展至高维连续控制任务,并探索基于反事实推理的鲁棒奖励建模机制。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)支持能力上实现显著跃升,同时在代码生成与专业级任务(如法律、金融、科研文档处理)中展现出更强的推理深度、上下…
文一致性与多步协作能力。Opus 5采用改进的混合专家架构(MoE)与动态计算分配机制,在200K上下文窗口下保持高效推理,并集成强化学习驱动的自我修正模块以提升输出可靠性。实验表明,其在HumanEval++、SWE-bench及专业领域基准测试中分别较Opus 4提升18.3%、15.7%和22.1%,且在72小时连续任务稳定性测试中错误率降低至0.4%。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该页面仅显示标题“one daily email”,无其他实质性内容,无法提取具体新闻或信息。
💬 Hacker News AI 热门
1. A joke domain purchase turned in geopolitical warfare
🔥 334 分 · 💬 44 评论
本文讲述了一个原本出于玩笑注册的域名sondehub.org,如何意外演变为全球重要的无线电探空仪(气象气球)追踪平台,并卷入地缘政治风波的故事。该平台最初只是重定向到Habhub,后因性能和功能需求逐步发展为独立、开源、高可用的数据服务,…
被各国气象、军事、航空等部门广泛使用。2023年美国击落所谓“中国间谍气球”事件后流量激增;随后平台发现其反向预测技术被用于定位军用发射点,甚至疑似被用于俄乌战争中的气球侦察活动,引发伦理与法律隐忧。2. Launch HN: OneCLI (YC S26) – OSS sandboxed agent harness for teams
🔥 11 分 · 💬 0 评论