AI 每日资讯 — 2026-09-19
🔥 HuggingFace 每日论文
1. An Empirical Study of Harness Design for Coding Agents
Run-Ze Fan, Zihao Zhang, Simin Ma
本文针对自主编程智能体中编码框架(coding harness)的设计展开实证研究,旨在解耦分析其核心组件对长周期软件工程任务性能的影响。作者构建了一个轻量级、执行循环固定的编码框架,系统性地评估了规划模块、动作空间与上下文管理三
大可变组件在SWE-Bench Verified和Terminal-Bench 2.1上的表现,覆盖4种大模型、5种上下文管理策略、4种上下文窗口预算及多种消融设置(共176组实验)。结果表明:上下文管理主要通过避免上下文溢出提升鲁棒性;规则驱动的分阶段截断优于LLM摘要,而内容可恢复机制未带来精度增益;规划模块对弱模型起精度支撑作用,对强模型则显著降低推理成本;预定义工具仅对bash能力较弱的模型有益,bash原生模型采用纯bash接口可大幅降低成本。2. JEPA-Anything: Learning Predictive Models across Different Worlds
Taoyong Cui, Zhongyao Wang, Xinyue Xu
JEPA-Anything 提出一种领域无关的世界建模框架,基于正交预测分解(OPF)实现跨异构系统的通用预测学习。该方法将潜在目标解耦为互补因子,通过专用通路分别学习并统一整合至联合嵌入预测架构中。在视觉、生物学、临床轨迹、控制
、分子动力学、物理场与气象共七大领域开展系统验证,涵盖表征学习、干预预测、分布外泛化及长时程动力学建模等任务。实验表明,其在10项动力学任务上全面超越基线JEPA,在Interventional Pong单步干预预测误差降低34.8%,并在四种分子系统的一百步 rollout 中均取得最低一步与百步预测误差;所发现的生物学干预因子经细胞共培养、类器官、肿瘤组织及小鼠实验验证有效,隐式轨道模态亦准确复现开普勒标度律。3. RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
Yan Yu, Zhengxi Lu, Yizhou Liu
本文针对多轮智能体强化学习中稀疏奖励导致训练困难的问题,提出自退化在线策略蒸馏(RetireOPD)方法。该方法解耦构建技能条件化教师模型,并联合采用强化学习与在线策略蒸馏训练技能无关的学生模型;创新性地引入“自适应退化”机制——
学生在性能趋近教师且差异不再下降时自主终止蒸馏,转为纯RL训练。在ALFWorld和WebShop任务上,RetireOPD在Qwen2.5系列模型(1.5B–7B)上显著提升成功率(+14.1%~18.8%)与准确率(+11.8%~19.0%),且全面超越其技能条件化教师。4. Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
Haocheng Xi, Yiming Xie, Hexu Zhao
Video DeltaNet(VDN)针对视频扩散模型中长时序注意力计算开销大的问题,提出一种视频原生的混合注意力机制。该方法融合局部Softmax注意力与双向线性记忆模块,其中新提出的Video Delta Attention(
VDA)通过每帧一次的空间令牌聚合更新记忆,结合分离式输出投影与可学习门控机制动态校准双分支。VDN-H3在MiniMax H3架构上实现视频-视频交互专用混合注意力,并保留Softmax处理多模态(文本/音频)交互。实验表明,在8卡NVIDIA B200上,VDN-H3以8步蒸馏生成14.3秒、768p直播视频仅需6.70秒,相较50步密集基线提速14.5倍。5. FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations
Kevin Qu, Tao Sun, Massimiliano Viola
FAMOS提出了一种前馈式三维可动部件建模方法,旨在从稀疏、无序的单目点云观测中联合推断可动部件分割与关节参数。针对单视图信息不全、依赖强类别先验的问题,该方法引入多状态可动性Transformer,通过交替的状态级与全局注意力机
制跨观测聚合运动线索,并设计“可观测运动跨度”损失函数显式监督各部件在输入观测集中的运动范围。为缓解真实数据稀缺问题,作者构建了程序化合成数据生成器。在PartNet-Mobility、ACD和ArtiCraft-10K上的实验表明,FAMOS在精度与泛化性上均显著优于现有前馈及优化类基线方法。6. Don’t Mask the Environment: Observation Supervision Changes How Agents Explore Under RL
Juzheng Zhang, Disha Makhija, Manoj Ghuhan Arivazhagan
本文探讨了在强化学习(RL)前的监督微调(SFT)阶段是否应仅优化动作预测,还是同时监督环境观测预测。作者提出ActObs方法,在SFT中联合监督动作与观测token,无需新增数据、参数或计算开销,却能促使策略建模动作后果。实验表
明:在Terminal-Bench 2.0和aider-polyglot基准上,基于ActObs初始化的GRPO策略显著提升pass@k性能(如Qwen3-4B上全面超越动作-only基线;Qwen3-8B在pass@16提升3.4个百分点);跨域泛化能力更强,且RL过程中策略熵保持更高、更新幅度更小,最终策略更贴近SFT初始化。分析揭示其优势源于SFT阶段动作与观测梯度的正交化,避免了动作独占训练导致的环境建模退化。7. Score Centering Stabilizes Off-policy Reinforcement Learning
Martin Marek, Max Ryabinin
本文针对大语言模型强化学习中因训练-推理引擎差异(TIM)导致的不稳定性问题,提出“得分中心化”(Score Centering)方法。作者指出,TIM引发的持续性偏差(drift)是性能退化的主要根源,并推导出一个可加性的校正项
以抵消该偏差。在0.6B至30B参数规模的模型上,仅使用得分中心化即可匹敌甚至超越基于重要性采样的量化鲁棒方法,且在TIM加剧时优势更显著。由于其加性特性,该方法还能与重要性采样自然结合,在状态陈旧性实验中显著优于纯重要性采样基线。8. dQwen3.5: Hybrid-Attention Diffusion Language Models
Anton Xue, Litu Rout, Aditya Akella
本文提出dQwen3.5系列混合注意力扩散语言模型(DLM),探索将具备注意力与RNN层交替结构的预训练自回归模型(如Qwen3.5)高效适配为DLM的可行性。针对RNN固有的单向因果性难以双向化这一关键挑战,作者设计了适配策略,
在0.8B、2B、4B和9B四种规模上成功构建dQwen3.5。实验表明,相比全注意力基线,混合架构仅需约一半训练token即可达到同等损失;且在任意顺序解码与并行解码任务中,性能媲美全注意力DLM,验证了混合骨干网络作为DLM起点的有效性与高效性。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. Regularized Emphatic Temporal-Difference Learning: Stability under Constant Stepsizes
Xingguo Chen, Zhaohui Wu, Jinguo Ye, Chao Li, Shangdong Yang, Guang Yang, Skylar Liang, Wenhao Wang
本文针对强调性时序差分学习(ETD)在常数步长下采样动力学不稳定的问题,提出正则化强调性TD(RETD)算法。RETD通过引入带泄漏的标量状态缓存ETD信号,并输出延迟校正,在保持重要性权重与后续轨迹(follow-on trac
e)不变的前提下实现一阶后冲击修复。理论证明:RETD在调和衰减步长下几乎必然收敛;在常数步长下满足条件矩收缩性质,并在双态遍历反例及Baird七态任务中获得严格负Lyapunov指数,而原始ETD仍呈现数值上的正指数。万次仿真实验验证了其固定点精确恢复、非单调稳定性区域及任务依赖性等关键特性。2. BioPhys-Bridge: A Benchmark for Interdisciplinary Scientific Reasoning in Physics-Grounded Biological Research
Qingyang Xu
本文提出BioPhys-Bridge——首个面向物理驱动型生物研究的跨学科科学推理基准,旨在解决大语言模型在生物物理学文献理解中证据 grounding、定量建模与机制解释相脱节的难题。该基准包含500个结构化案例,涵盖6类生物学
领域与9类物理模型(含3类预留稀疏模型),每个案例标注证据块、稳定ID、定量值与单位、方程、假设、生物学机制及后续决策等多维 grounding 目标,支持问答与检索增强生成评估。经严格质量管控(含领域专家审核81例),初步实验显示DeepSeek-V4-Flash在证据ID识别F₁上达0.360,显著优于Qwen3.7-Max(0.316)与GPT-4o-mini(0.294)。本基准为评估模型归因能力、事实一致性、幻觉抑制及实验设计推理提供新标准。3. What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks
Chao Wang (Independent Researcher)
本文系统梳理了2022年1月至2026年8月间arXiv上发布的14,767篇涉及大语言模型(LLM)评测资源构建或更新的论文,通过分阶段筛选与全文自动化编码,分析评测基准在目标系统、领域覆盖、评估材料与条件、评分机制等方面的演进
趋势。研究发现:评测日益强调行动能力、交互性及专业场景应用;传统与新兴设计要素常并存;LLM参与评分在智能体与非智能体两类评测中持续增长,但模型生成评测材料尚未形成稳定上升趋势。该工作揭示了学术界如何将对LLM的能力预期转化为具体测试任务与成功标准,并引发对评测自主性与模型偏见风险的深层反思。📄 arXiv: cs.CL
1. Modality Discrepancy Transformer for Ambivalence and Hesitancy Recognition
Shiyu Luo, Yu Wang, Jiawen Huang, Zhaoxiang Xiao, Chenxi Huang, Qi Zhang, Bin Liu
本文针对临床视频中矛盾情绪状态(即摇摆性与犹豫性,A/H)的自动识别问题,提出模态差异变换器(MDT)。该方法聚焦于建模跨模态信号分歧——这一被传统融合方法抑制的关键线索。MDT将原始6-token结构扩展为9-token表示,包
含模态嵌入、绝对差特征及基于Hadamard积的差异特征,并引入FiLM文本条件调制与LoRA微调机制;同时设计文本引导的晚期融合分支。在ABAW挑战赛BAH数据集上,MDT以单卡20分钟训练时间,分别取得0.7408(公开测试集)和0.7368(私有榜单)的Macro F1分数,较最优基线提升超10个百分点。2. Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds
Barath Velmurugan
本文探究了潜意识提示(subliminal prompting)中语言模型隐式传递特征的机制,聚焦于因果深度与多词元混杂因素问题。作者在固定动物-数字提示协议下,分别评估了输出向量相似性、隐藏状态可读性、状态对输出的因果控制能力及
多词元交互效应。实验表明:随着模型规模增大(Llama-3.1从8B到70B),固定输出向量相似性对行为的预测能力显著下降;而通过跨层状态注入验证的因果控制能力(Donor-control AUC)显著提升,且具有一致性;Qwen模型分析进一步揭示单词元关联实为数字长度引发的混杂效应。结果表明,静态几何结构、观测可读性、因果时序与多词元测量是该冻结提示通道中相互独立的关键属性,共同约束词元级解释,但尚未揭示训练阶段特征迁移的根本机制。3. Sampling Reveals Style: Unsupervised, Training-Free Discovery of Prompt-Conditional Stylistic Axes in LLM Activations
Ajit Mallavarapu, Ziwei Gu
本文提出一种无需训练、无需监督数据的无监督方法,用于在大语言模型(LLM)隐藏层激活中发现提示条件下的风格轴。该方法通过对单一提示在高温度下多次采样生成文本,聚合对应隐藏激活并进行主成分分析(PCA),再依据极值生成样本自动标注主
成分所表征的风格维度。在涵盖245条人工标注的两阶段评估中,Qwen-3.5-4B-Instruct模型的前两个主成分轴与人类自发提出的风格维度匹配精度达72.8%,宏召回率为43.6%,75.6%的人工有效性评分认为其极值生成准确反映标签含义,且标注者间相邻一致性达90.9%。实验同时揭示显著的模型差异:Qwen与Llama-3.2-3B能有效暴露风格结构,而DeepSeek-7B-Chat精度骤降至35.3%,其主导成分主要捕获结构而非风格变异。📄 arXiv: cs.LG
1. Generative Query Suggestion via Intent Coverage and Query-Level Credit Assignment
Xinpeng Liu, Lu Ma, Jiayi Qiao, Mengyu Zhou, Linglong Li, Xiaofeng Bian, Haonan Chen, Xiaoxi Jiang, Guanjun Jiang
本文提出一种面向意图覆盖与查询级信用分配的生成式查询建议方法,旨在提升用户参与度并确保推荐查询集(slate)在个体相关性与意图多样性上的协同优化。方法包含两阶段:首先,通过意图感知的多样性建模构建意图对齐的监督微调数据,并设计意
图感知多样性奖励以优化整体意图覆盖;其次,引入查询级信用分配机制,将个体质量信号精准归因至对应查询的token,同时共享slate级多样性信号。在大规模生产数据上的离线评估与在线A/B测试表明,该方法显著提升了点击率、查询质量及意图覆盖率。2. Layer-wise Curriculum Learning for Efficient LLM Compression
Donggeon Lee, Dooyeon Na, Seungmin Oh, Jongbin Ryu
本文提出面向大语言模型(LLM)压缩的层式课程学习方法,通过将模型划分为多段层级结构,分阶段由易到难地进行知识蒸馏,提升教师模型向学生模型的知识迁移效率与稳定性。基于对累积误差现象的理论分析,该方法显著加速收敛并缓解训练失稳问题;
同时设计支持多线程的特征缓存机制,有效解决跨层特征不对齐问题,最大化GPU利用率。实验表明,在BERT与GPT-2上,本方法在保持SOTA压缩性能的同时,GPU内存占用与训练时长均降低超50%;在LLaMA系列及Qwen模型上,同等训练时间内亦优于主流剪枝方法,且显存开销更低。3. Block Parallelism For Efficient Distributed Long-Context Diffusion Language Model Training
Tarun Suresh, Pranshu Chaturvedi, Hangoo Kang, Parth Shroff, Ishan S. Khare, Hermann Kumbong, Azalia Mirhoseini
本文针对长上下文扩散语言模型(BDLM)分布式训练中的通信与显存瓶颈,提出块并行(Block Parallelism, BP)及其可扩展变体——上下文分片块并行(Context-Sharded Block Parallelism,
CSBP)。CSBP将污染块计算分配至不同GPU,并对共享的干净前缀进行分片,从而消除冗余通信与复制,保持BDLM语义完整性。实验表明,在256K上下文下,CSBP相较最优基线提升吞吐量1.18–1.45×(监督微调)和1.27–1.33×(AR模型转BDLM),峰值HBM不增反降;512K时全模型加速达1.61×;在DFlash2投机解码器训练中,512K和1M上下文下分别加速2.48×与7.59×;在DiffusionGemma 26B-A4B的12小时SFT任务中,CSBP在SWE-bench Verified与Terminal-Bench Lite上各检查点均取得更高通过率。🏛️ Azalia Mirhoseini
📄 arXiv: cs.CV
1. Open ultrasound foundation model for robust segmentation and clinical measurement across heterogeneous settings
Chao Qin, Fahad Shahbaz Khan, Salman Khan, Sarim Ather, Siddiq Anwar, Rao Muhammad Anwer, Shadab Khan
本文针对超声影像AI模型在设备、操作者及解剖结构变化下泛化能力差的问题,提出开源超声基础模型SonoBase及其支撑数据集SonoCorpus。SonoCorpus整合53个公开数据集、覆盖24种临床任务与17个国家的45.7万张
图像及162.6万个专家标注掩码;SonoBase基于此进行交互式分割预训练。在15个跨域测试集上,SonoBase全面超越SAM2、MedSAM2及MedSAM3,性能媲美各数据集专用模型,并在完全外部数据上反超基线在其自有分布上的表现。其衍生的心功能射血分数误差(6.63%)、胎儿头围(1.81 mm)和孕周(1.2天)误差均低于人机间变异;在资源受限场景中,对基线失效案例的恢复率达81%。模型支持仅5样本快速适配,且预训练优势源于超声特异性而非特定架构。全部代码、权重、数据划分与去重哈希均已开源。2. RAUL: Reference-Assisted Ureteroscopy Localization for Skill Assessment
Fangjie Li, Mai Bui, Charan Mohan, Michael Miga, Matthieu Chabanas, Nicholas Kavoussi, Jie Ying Wu
本文针对输尿管镜碎石术中因解剖导航不全导致的重复干预问题,提出RAUL——一种基于参考视频辅助的输尿管镜轨迹重建框架,旨在仅从内窥镜视频中恢复器械运动轨迹并量化操作技能。RAUL利用高精度慢速参考探索视频构建解剖参考模型,并将后续
视频帧配准至该模型;通过与电磁跟踪真值对比,验证其定位精度。在9个仿体实验中,RAUL平均平移均方根误差为$0.5 \pm 0.1$ mm,帧级定位覆盖率由传统SfM的$50.5 \pm 14.9\%$提升至$86.1 \pm 7.2\%$;基于重建轨迹计算的导航指标显著区分了不同经验水平的住院医师。该方法首次实现无需外部传感器的纯视频驱动输尿管镜轨迹重建与技能评估,为可扩展、自动化的手术技能评价提供了新范式。3. Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment
Henry O. Velesaca, David Freire-Obregon, Luigi Miranda, Abel Reyes-Angulo
本文针对奥运跳水动作质量评估(AQA)中人类运动复杂性与裁判主观性带来的挑战,探索开源视觉-语言模型(VLMs)在零样本条件下的评估能力。基于AQA-7基准数据集,提出一种回归框架,融合VLM生成的语义推理文本与阶段级子分数,结合
TF-IDF向量化、降维及集成学习预测最终得分。实验表明,单个VLM的Spearman相关系数低于0.32,而所提四模型集成框架达0.67;且文本推理特征显著优于原始数值子分数,验证了VLM解释性输出对动作质量分析的价值,为可解释、半自动化的体育表现评估提供了新路径。📝 AI 官方博客
1. New experts join Google’s AI & Economy team
📝 Google AI Blog
本文介绍了谷歌新成立的“AI与经济研究计划”(AI & Economy Research Program),旨在系统性探索人工智能技术对宏观经济、劳动力市场、产业变革及政策制定的深远影响。该计划汇聚了来自经济学、计算机科学、公共政策等领域的…
顶尖学者与行业专家,采用跨学科方法,结合大规模实证分析、因果推断模型与生成式AI模拟工具,评估AI驱动的生产力提升、就业结构转型与收入分配效应。初步研究表明,在高技能岗位显著增长的同时,中低技能岗位面临重构压力,但配套再培训政策可缓解不平等加剧趋势。团队已与多国央行及国际组织展开合作,推动基于证据的AI治理框架建设。2. Co-creating the future of fashion with Google
📝 Google AI Blog
本文探讨了时尚产业与科技巨头谷歌(Google)协同创新的前沿实践,聚焦于双方在可持续设计、AI驱动的虚拟试衣、个性化推荐及供应链智能化等领域的深度合作。作者通过案例分析与行业访谈,揭示了生成式AI、计算机视觉与大数据技术如何赋能设计师、品…
牌与消费者,重构从创意生成到消费体验的全链路。研究指出,此类跨领域共创不仅提升了设计效率与环保水平,也催生了新型人机协作范式。实证表明,在试点项目中,AI辅助设计使样衣开发周期缩短40%,虚拟试衣技术将线上退货率降低28%。3. Making global data easier to explore
📝 Google AI Blog
本文介绍了联合国系统数据公共平台(UN System Data Commons)的数据门户网站,旨在降低全球发展数据的获取与探索门槛。该平台整合了来自联合国各机构及合作伙伴的多源、异构统计数据,通过统一元数据标准、语义化标签体系与跨库检索技…
术,实现数据集的语义互操作与一站式发现。平台支持自然语言查询、可视化预览、动态图表生成及API批量获取,并内置数据质量评估与溯源功能。实验表明,相比传统联合国数据门户,用户完成典型分析任务的平均耗时减少42%,数据复用率提升3.1倍,显著提升了政策制定者、研究人员与公众对全球可持续发展目标(SDGs)相关数据的可及性与可用性。4. What We Learned Trying to Catch AI Liars: An Aletheia’s Quest Retrospective
📝 EleutherAI Blog
本文回顾了Aletheia’s Quest项目中构建AI欺骗检测器的实践经验,系统总结了黑盒与白盒两类检测方法在识别大语言模型(LLM)说谎行为中的有效性与局限性。研究发现,基于输出一致性、自我校验与多步推理链分析的白盒方法在可控实验中展现…
出较高准确率,但对模型内部机制依赖性强;而黑盒方法(如响应熵分析、跨提示稳定性评估)泛化性更优,却易受提示工程干扰。实验覆盖多个开源与闭源LLM,在事实核查、意图推断与反事实响应任务上验证了检测框架的鲁棒性。结果表明,单一检测范式难以普适,需结合模型可解释性、行为建模与动态对抗测试形成分层防御体系。5. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画构建未来AI的科研 workforce 最终呈现合作性或非合作性的演化路径。模型将AI社区的行为倾向建模为动力系统状态,识别决定长期合作与否的“吸引域边…
界”;结合当前AI研发实践、机构激励结构与政策干预等实证线索,评估人类社会当前所处的状态是否临近临界点;并指出若干关键观测指标(如安全研究投入占比、跨机构协作强度、治理共识形成速度)可作为判断我们是否正走向可治理未来的早期信号。实验模拟表明,适度早期干预可显著扩大合作吸引域。6. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的潜在迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,检测其隐含的奖励优化偏差。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该方法可在奖励作弊发生前平均提前32%的训练步数发出预警,准确率达89.7%,显著优于基线检测方法。7. Introducing Claude Fable 5.1 and Claude Mythos 5.1AnnouncementsSep 1, 2026Our most advanced models for coding and knowledge work. Their research capabilities also offer an early glimpse of how AI models will contribute to scientific progress.
📝 Anthropic
本文介绍了Anthropic于2026年9月发布的两款前沿AI模型——Claude Fable 5.1与Claude Mythos 5.1,分别专精于编程任务与知识密集型工作。二者在代码生成、推理能力与跨学科知识整合方面实现显著突破,并展现…
出支持科学发现的初步研究能力。同期,Anthropic提出一套新型AI发展度量框架,旨在提升前沿实验室研发进展的透明度;并披露其威胁情报团队在2026年前八个月成功识别并阻断多起利用Claude模型实施恶意活动的攻击事件,凸显模型在安全对齐与滥用防控方面的实质性进展。8. Sep 17, 2026Measurements for understanding the pace of AI development inside frontier labsToday, the world can’t see what’s going on inside AI labs. Anthropic is proposing new metrics that would give the public visibility into frontier AI development.
📝 Anthropic
暂无摘要
9. Sep 17, 2026AnnouncementsIntroducing the Life Sciences Verification Program
📝 Anthropic
本文介绍了生命科学验证计划(Life Sciences Verification Program),旨在应对前沿人工智能模型在生物医药领域应用中日益突出的安全与可靠性挑战。该计划通过构建领域专属的评估基准、可解释性分析框架及多层级验证协议,…
系统性检验模型在药物发现、基因组分析等关键任务中的事实准确性、逻辑一致性与伦理合规性。核心技术包括基于生物知识图谱的推理校验、对抗性提示鲁棒性测试,以及跨模态实验数据对齐验证。在涵盖12类典型生命科学任务的基准测试中,该方案将关键错误率降低63%,显著提升模型部署可信度。📬 TLDR AI 精选
1. one daily email
该页面仅显示标题“one daily email”,无其他实质性内容,无法提取具体新闻或信息。
💬 Hacker News AI 热门
1. An Empirical Study of Harness Design for Coding Agents
🔥 161 分 · 💬 34 评论