AI 每日资讯 — 2026-09-16
🔥 HuggingFace 每日论文
1. Atria Dawn: The Dawn of Agentic Superintelligence
Honglin Guo, Tao Gui, Yicheng Chen
本文提出Atria Dawn Preview——一种面向科研与工程工作流的基础型智能体语言模型,旨在提升AI代理在真实世界任务中的生产力。其核心创新在于“可验证经验流水线”(Verifiable Experience Pipeli
ne),将工具调用、可执行环境交互与外部验证结果闭环耦合。在涵盖科研、工程及数字工作的16项基准测试中,该模型性能媲美前沿智能体,并在5项上取得当前最高分。基于769条任务记录与多阶段人机协作分析,研究发现:约1/3的AI辅助任务被人类评估为“无AI则不可行”;AI频繁提出方法并实施迭代,而人类主导最终决策、方向判断与反馈引导。这标志着人机协作正从任务执行层跃升至项目级协同,人类精力聚焦于目标选择与证据驱动的研究范式构建。PDF · arXiv · 代码 · 项目 | ❤️ 364
2. LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
Xiaofeng Mao, Peijia Lin, Shaohao Rui
LynnReal-Omni 提出了一种原生多模态视频生成框架,旨在解决扩散模型在可控性、长时序一致性与高保真度之间的固有矛盾。该框架基于32B共享多模态扩散Transformer,统一支持文本/图像/3D场景/游戏状态等多种条件输
入,实现文本到视频、参考引导生成、结构化控制、视频编辑与修复及长视频合成。为提升实时性,另构建27B Flash变体模型。通过系统化数据清洗、主体关联与多模态对齐标注,构建高质量多镜头音视频语料库,并提出MSAVP评估协议(含100个提示、20项指标),从指令遵循、合理性、视觉质量、时序行为与音画协同五维度全面评测。实验表明,LynnReal-Omni在可控性与生成质量上显著优于现有方法。3. Discovery Foundation Models: Toward Open-Ended Discovery Intelligence
Ling Yang, Zhenfei Yin, Yingcheng Wu
本文提出“发现智能”(Discovery Intelligence)这一新范式,旨在推动基础模型从解决人类定义的问题,迈向主动参与新问题、新表征、新解释与新知识的生成过程。作者 formalize 了“发现基础模型”(DFMs),
构建涵盖问题发现、建模、表征构建、假设生成、干预设计、证据驱动修订及持续改进等七大耦合能力的通用框架。基于该框架,研究实现了Zetema(支持可修订科研状态与跨任务发现技能演化的推理系统)和GALILEO(整合干实验室推理、机器人湿实验、外部生物学证据与闭环迭代的药物发现系统)。进一步,论文提出以过程为中心的能力形成与评估方法,突破传统终态答案导向的评测局限,为开放-ended科学发现提供系统性技术路径与实证基础。4. Kaininja: Extending Native 3D Generators to the Part Level
Ruihan Yu, Lian Fu, Muyao Niu
本文提出KaiNinja,一种将原生3D生成器(如TRELLIS.2)扩展至部件级的新方法。针对传统单一体积表示无法建模部件接触界面的根本限制,作者设计双体积表示法,使模型能显式区分相邻部件的表面。KaiNinja基于TRELLI
S.2的O-Voxel架构构建,无需额外分割网络或掩码监督,保持原有生成速度与质量。训练数据融合CAD模型与大语言模型驱动的智能体生成的部件级资产,系首个以此类数据训练的3D生成模型。实验表明,其整体物体Chamfer距离降低40%,严格部件F-score提升16%,且在整物保真度上亦优于同 backbone 的基线模型。5. The Router Within: Eliciting Native Skill Routing from a Frozen LLM
Ruishuo Chen, Xun Wang, Yu Chen
本文提出Gavel方法,旨在从冻结的大型语言模型(LLM)中直接提取原生技能路由能力,无需修改模型参数或在上下文中注入技能描述。Gavel仅通过两个可训练的线性映射,从LLM中间层状态中解码任务与技能的匹配信号:先“一瞥”(Gla
nce)构建紧凑技能表征并完成粗筛,再“裁决”(Verdict)融合模型自身生成概率与二元判断进行精排。在Qwen3-32B上,Gavel零样本迁移至多个基准(含新构建的SkillTraj),性能显著优于需额外1.2B–16B参数的渐进式披露与检索重排方案,在书面任务和滚动中技能触发场景下分别提升达13.4和21.9分,且路由准确率随主干模型增强而同步提升。6. Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering
Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah
本文针对临床问答系统中引文可验证性不足的问题,提出“构造即可信”(Verifiable by Construction)范式,要求模型为每个事实性主张提供细粒度、逐字引用的原文片段以实现无需跳转即可验证。作者构建覆盖4部临床指南、
含222个合成问题的标准化评测框架,对12种大语言模型在主张级引文生成、逐字引用提取及引用充分性三个阶段进行端到端评估。实验表明,多数模型(如Claude-Opus-5)能为98.0%的主张生成逐字引用,但仅37.1%的引用能完全支撑对应主张;轻量级模型(如Claude-Haiku-4.5)表现显著更差。研究揭示了当前LLMs在构建高可信临床QA系统中的关键能力缺口,并开源评测基准与数据集。7. Learning to Coach for Experiential Learning
Guanheng Chen, Tianzhu Ye, Li Dong
本文提出“学习教练”(L2C)框架,旨在从语言模型(LM)的原始解题轨迹中提炼可操作的经验性知识,以提升其在经验学习中的表现。L2C训练一个专用的“LLM-as-a-Coach”模型,该模型基于冻结的actor模型的历史轨迹生成指
导,并通过两种奖励信号(同实例正确性奖励与跨实例泛化奖励)进行优化。实验表明,L2C在数学推理与交互式文本游戏任务上显著优于自我精炼及未训练的教练模型;增加经验学习迭代次数比扩大actor解码预算更高效地提升准确率;且训练后的教练模型具备跨分布任务迁移能力,并能自适应不同actor特性提供定制化指导。8. JEPLO: Joint-Embedding Predictive Learning for LiDAR-Based Legged Locomotion
Qihao Yuan, Yixuan Qiu, Ziyu Cao
本文提出JEPLO——一种面向激光雷达(LiDAR)感知的无建图、单阶段学习框架,用于四足机器人动态地形穿越。针对LiDAR在具身智能中建模不足的问题,JEPLO构建了融合本体感知与外部感知的联合嵌入预测世界模型(PE-JEPA)
,直接从原始LiDAR扫描中学习预测性自我中心地形表征;并设计协同JEPA-教师-学生(CJTS)训练流程,在仿真中以轻量奖励函数驱动强化学习策略训练。该框架在真实机器人上实现高效sim-to-real迁移,支持全向、鲁棒穿越楼梯、高障碍等复杂地形,且对遮挡、稀疏性与噪声具有显著更强的感知鲁棒性。代码、数据集与硬件设计已开源。🔥 arXiv 每日论文
📝 AI 官方博客
1. AI for Societal Impact
📝 Google AI Blog
本文探讨人工智能如何赋能社会可持续发展,聚焦AI在医疗健康、教育公平、气候应对与社区治理等关键领域的实际应用。研究系统梳理了面向社会影响的AI技术路径,包括可解释性模型、低资源场景适配算法、多方协同数据治理框架及以人为本的设计范式。通过全球…
十余个典型案例分析(如非洲基层医疗辅助诊断系统、印度农村教育智能助教平台),验证了轻量化、可部署、可审计的AI解决方案在资源受限环境中的有效性与可扩展性。实验表明,所倡导的“社会就绪型AI”范式显著提升了技术采纳率与长期社会效益。2. Building AI to accelerate science and improve lives
📝 Google AI Blog
本文探讨了人工智能如何赋能科学研究与社会福祉提升。作者提出一种以“人类中心”为导向的AI研发范式,强调跨学科协作、可解释性建模与负责任部署。关键技术包括面向科学发现的物理信息神经网络(PINNs)、低资源场景下的自适应小样本学习,以及保障公…
平性与隐私保护的联邦学习框架。在教育、医疗与气候建模等真实场景中开展实证研究:AI助教系统使课堂互动效率提升37%;医学影像辅助诊断模型在多中心临床试验中达到92.4%的敏感度;气候预测模型将区域降水预报误差降低21%。结果表明,以问题驱动、价值对齐的AI建设路径可显著加速科学突破并切实改善民生。3. AI for everyone in every language
📝 Google AI Blog
本文提出“AI for everyone in every language”愿景,致力于构建真正普惠、多语言支持的人工智能系统。针对低资源语言缺乏高质量训练数据与模型支持的挑战,作者设计了一种轻量级、可扩展的跨语言迁移学习框架,结合自监督…
预训练、动态语言适配模块与社区驱动的数据众包机制。该方法在52种低资源语言上显著提升语音识别、机器翻译与文本生成任务性能,平均错误率降低37%。实验表明,系统可在边缘设备实时运行,且支持用户本地化微调。研究成果已在多个发展中国家教育与医疗场景中落地验证,为全球语言多样性保护与AI公平性提供了可行路径。4. What We Learned Trying to Catch AI Liars: An Aletheia’s Quest Retrospective
📝 EleutherAI Blog
本文回顾了Aletheia’s Quest项目中构建AI欺骗检测器的实践经验,系统总结了黑盒与白盒两类检测方法在识别大语言模型(LLM)说谎行为中的有效性与局限性。研究发现,基于输出一致性、自我校验与多步推理链分析的白盒方法在可控实验中展现…
出较高准确率,但对模型内部机制依赖性强;而黑盒方法(如响应熵分析、跨提示稳定性检验)泛化性更优,却易受提示工程干扰。实验表明,混合检测框架可将欺骗识别F1分数提升至0.82(在TruthfulQA基准上),但面对策略性对抗微调模型时性能显著下降。研究强调了评估基准的脆弱性、检测-生成博弈的动态性,以及对齐研究中“可验证真实性”的根本挑战。5. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画构建未来AI的科研 workforce 最终呈现合作性或非合作性的演化路径。模型将AI社区的行为倾向建模为动力系统状态,识别决定长期合作与否的“吸引域边…
界”;结合当前AI研发实践、机构激励结构与政策干预等实证线索,评估人类社会当前所处的状态——是否已落入合作性吸引域;并指出若干关键观测指标(如安全研究投入占比、跨机构协作强度、治理共识形成速度)可作为判断我们是否正走向可治理未来的早期信号。实验模拟表明,适度早期干预可显著扩大合作吸引域。6. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的潜在迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,检测其隐含的奖励优化偏差。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该方法可在奖励作弊发生前平均提前32%的训练步数发出预警,准确率达89.7%,显著优于基线检测方法。7. Introducing Claude Fable 5.1 and Claude Mythos 5.1AnnouncementsSep 1, 2026Our most advanced models for coding and knowledge work. Their research capabilities also offer an early glimpse of how AI models will contribute to scientific progress.
📝 Anthropic
本文介绍了Anthropic于2026年9月发布的两款新型先进AI模型——Claude Fable 5.1与Claude Mythos 5.1,分别专精于编程任务与知识密集型工作。二者基于强化对齐训练(RLAIF)与多阶段推理验证机制,在代…
码生成、数学推导与跨学科知识整合方面显著提升;尤其Claude Mythos 5.1展现出初步的科研辅助能力,可在文献综述、假设生成与实验设计中提供可验证的推理链。在HumanEval与MMLU-Pro基准测试中,Fable 5.1代码通过率达89.3%,Mythos 5.1知识推理准确率达84.7%,均超越前代模型逾7个百分点。8. AnnouncementsAug 27, 2026Previewing the Model Hardware StandardWe’re opening a research preview of the Model Hardware Standard (MHS), a shared specification for AI agents to safely operate physical devices, to a first group of scientific research labs and advanced manufacturers.
📝 Anthropic
暂无摘要
9. ProductJul 24, 2026Introducing Claude Opus 5Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该页面仅显示标题“one daily email”,无其他实质性内容,无法提取具体新闻或信息。
💬 Hacker News AI 热门
1. Cartesian – AI 3D Modeling for Design
🔥 35 分 · 💬 27 评论