AI 每日资讯 — 2026-09-17

AI 每日资讯 — 2026-09-17 🔥 HuggingFace 每日论文 1. ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents Shuhan Xue, Jianyuan Zhong, Ziyuan Nan 本文提出并开源了ScienceBuddy——一个支持递归式自我演化的交互式科学智能体工作平台。针对科学任务中模型能力与工具调度协同进化不足的问题,作者提出“递归内嵌递归”(recursive-in-recursive)自改进范式:内层递归在固定大模型前提下优化工具调用框架(harness),外层递归则基于增强后的harness对模型进行强化学习训练,二者形成闭环驱动。系统将用户请求、反馈及执行证据自动转化为训练任务与评估准则,实现持续学习。在涵盖文献综述、实验设计、数据分析与假设生成四大类科学任务的基准测试中,该范式显著提升任务完成质量与泛化能力。 PDF · arXiv · 代码 · 项目 | ❤️ 17 2. Modality-Autoregressive World-Action Models Adam Hung, Bardienus P. Duisterhof, Deva Ramanan 本文提出ModAR——首个支持多模态自回归去噪的世界-动作模型(WAM),可依次生成深度图、DINO视觉特征与点轨迹等几何/语义/运动相关模态,再基于已生成模态预测动作。通过从零训练的系统性消融,发现预测点轨迹、DINO特征与深度图显著提升性能,而额外预测RGB图像无一致增益。实验表明,ModAR在各数据规模下均取得最高平均成功率;相比预训练初始化的Flex-π模型,ModAR以约1/20训练FLOPs、无需预训练即实现更高平均成功率(75% vs. 72%),并在三个真实双臂操作任务中优于基线且随人类演示视频增多持续提升。 🏛️ Deva Ramanan | PDF · arXiv · 项目 | ❤️ 4 3. PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control Chuhao Chen, Peter Wonka, Chaoyang Wang...

九月 17, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-09-16

AI 每日资讯 — 2026-09-16 🔥 HuggingFace 每日论文 1. Atria Dawn: The Dawn of Agentic Superintelligence Honglin Guo, Tao Gui, Yicheng Chen 本文提出Atria Dawn Preview——一种面向科研与工程工作流的基础型智能体语言模型,旨在提升AI代理在真实世界任务中的生产力。其核心创新在于“可验证经验流水线”(Verifiable Experience Pipeline),将工具调用、可执行环境交互与外部验证结果闭环耦合。在涵盖科研、工程及数字工作的16项基准测试中,该模型性能媲美前沿智能体,并在5项上取得当前最高分。基于769条任务记录与多阶段人机协作分析,研究发现:约1/3的AI辅助任务被人类评估为“无AI则不可行”;AI频繁提出方法并实施迭代,而人类主导最终决策、方向判断与反馈引导。这标志着人机协作正从任务执行层跃升至项目级协同,人类精力聚焦于目标选择与证据驱动的研究范式构建。 PDF · arXiv · 代码 · 项目 | ❤️ 364 2. LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows Xiaofeng Mao, Peijia Lin, Shaohao Rui LynnReal-Omni 提出了一种原生多模态视频生成框架,旨在解决扩散模型在可控性、长时序一致性与高保真度之间的固有矛盾。该框架基于32B共享多模态扩散Transformer,统一支持文本/图像/3D场景/游戏状态等多种条件输入,实现文本到视频、参考引导生成、结构化控制、视频编辑与修复及长视频合成。为提升实时性,另构建27B Flash变体模型。通过系统化数据清洗、主体关联与多模态对齐标注,构建高质量多镜头音视频语料库,并提出MSAVP评估协议(含100个提示、20项指标),从指令遵循、合理性、视觉质量、时序行为与音画协同五维度全面评测。实验表明,LynnReal-Omni在可控性与生成质量上显著优于现有方法。 PDF · arXiv · 代码 · 项目 | ❤️ 43 3. Discovery Foundation Models: Toward Open-Ended Discovery Intelligence Ling Yang, Zhenfei Yin, Yingcheng Wu...

九月 16, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-09-15

AI 每日资讯 — 2026-09-15 🔥 HuggingFace 每日论文 1. Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models Jianman Lin, Shailesh Shailesh, Zhongyi Luo 本文针对机器人基础模型在视觉分布偏移下泛化能力下降的问题,指出其根源在于模型依赖训练数据中任务无关的视觉-动作相关性(即“vision-action shortcut”),而非真正理解任务目标。为此,作者提出一种框架无关的两阶段“潜在接口训练”(LIT)方法:第一阶段在无图像条件下,仅基于语言指令、机器人状态及末端执行器终端SE(3)位姿学习目标导向的动作先验;第二阶段引入一个姿态监督的潜在接口,将视觉与语义表征融合,并作为唯一视觉输入通道驱动动作生成,同时强制该接口重建第一阶段所用终端位姿,从而保留任务关键的空间信息。在Pi0.5、Molmo等四种架构上的实验表明,LIT显著提升跨域泛化能力,在多个真实世界机器人任务中实现平均18.7%的动作成功率提升。 PDF · arXiv · 代码 · 项目 | ❤️ 61 2. SAS: Simple Attention Sparsification via End-to-End Optimization of Context Ranking Zhiwei Li, Lei Zhu, Hao Gu 本文提出Simple Attention Sparsification(SAS),一种面向端到端优化的轻量级注意力稀疏化方法,旨在解决现有后训练稀疏化方法中上下文单元排序与预测影响不一致的问题。SAS将选择器输出的连续分数直接注入注意力logits,在softmax内部以归一化门控形式建模,使选择器可通过语言建模损失进行梯度更新;同时引入当前块强制保留机制与历史上下文校准策略,确保稀疏注意力在固定预算下更聚焦于对预测贡献最大的单元。实验表明,SAS在多个基准上显著优于主流稀疏基线,推理速度提升达2.1倍,且几乎无精度损失。 PDF · arXiv · 代码 | ❤️ 49 3. StepAudio 3 Gen Technical Report Bin Lin, Bo Zhao, Boyang Wang...

九月 15, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-09-14

AI 每日资讯 — 2026-09-14 🔥 HuggingFace 每日论文 1. SenseNova-U1.5: Towards Native Unified Visual Intelligence Haiwen Diao, Jiahao Wang, Chenjing Ding 本文提出SenseNova-U1.5——一个8B参数的原生统一多模态模型(MoT),摒弃传统编码器与VAE结构,实现端到端的视觉理解、推理与生成。通过空间一致的图像块重建、4K原生分辨率训练、精细化生成/编辑数据构建、任务建模优化及结构化提示增强,显著提升模型能力;后训练阶段采用多专家协同优化与在线策略蒸馏,集成美学、双语文本渲染、信息图生成与图像编辑等专项能力。实验表明,该模型在图像保真度、文本渲染精度、复杂构图、多参考编辑及图文交错生成等方面大幅超越现有方法,同时强化指令遵循能力与主体身份、几何结构及未修改区域的一致性。即使训练数据中结构化指令有限,模型仍能泛化至长程、复杂、结构化视觉任务,验证了原生统一建模通向感知—推理—创作一体化系统的可行性。 PDF · arXiv | ❤️ 229 2. The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement Yi Duan, Ying Liu, Zirui Tang 本文探讨通向真正递归自我改进(RSI)的路径,旨在构建人类设计的最后一款AI系统。作者提出Headroom-Closed Index(HCI)指标,揭示当前大语言模型在能力提升空间与闭环优化能力上的根本局限;进而系统构建RSI五阶段发展框架:从改进执行自主性、改进策略自主性、经验获取自主性、环境适应自主性,最终迈向递归元改进。研究横跨科学发现、具身智能与软件工程等典型场景,分析其差异化需求与演进节奏,并结合工业实践与初步实证,识别出实现真正RSI所面临的关键技术挑战,包括目标稳定性、评估可信赖性与改进过程的可解释性等。 PDF · arXiv | ❤️ 75 3. Biology-in-the-loop: Amortized Adaptive Hit Discovery in CRISPR Screens Carl Edwards, Edward De Brouwer, Xiner Li 本文针对CRISPR筛选中受限预算下的序贯实验设计问题,提出“生物学闭环”(Biology-in-the-loop)范式。作者构建了大规模自适应命中发现基准AssayBench-Loop,涵盖1389个跨五类表型的CRISPR屏幕;在此基础上提出AssayLoop框架,融合基于Transformer的可泛化采集策略AssayFormer与大语言模型(LLM)提供的生物学先验知识,实现反馈驱动的动态实验规划。进一步提出轻量级微调方案AssayLLM,将该范式直接迁移至LLM。实验表明,在时间隔离测试集上,AssayLoop相较随机选择实现5.67倍命中富集,并在仅检测约5%候选扰动时即识别出27.7%的真实功能基因。 PDF · arXiv | ❤️ 2...

九月 14, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-09-13

AI 每日资讯 — 2026-09-13 🔥 HuggingFace 每日论文 1. SenseNova-U1.5: Towards Native Unified Visual Intelligence Haiwen Diao, Jiahao Wang, Chenjing Ding 本文提出SenseNova-U1.5——一个8B参数的原生统一多模态模型(MoT),摒弃传统编码器与VAE结构,实现端到端的视觉理解、推理与生成。通过空间一致的图像块重建、4K原生分辨率训练、精细化任务建模及结构化提示增强等关键技术,显著提升图像保真度、文本渲染质量、复杂构图能力、多参考编辑与图文交错生成性能。后训练阶段采用多专家协同优化与在线策略蒸馏,强化美学、双语文本、信息图与图像编辑等专项能力。实验表明,该模型在指令遵循、主体一致性、几何结构保持及未修改区域保护等方面全面领先,并展现出对长程、复杂、结构化视觉指令的强泛化能力,验证了原生统一建模通向感知—推理—创作一体化系统的可行性。 PDF · arXiv | ❤️ 168 2. The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement Yi Duan, Ying Liu, Zirui Tang 本文探讨通向真正递归自我改进(RSI)的路径,旨在构建人类设计的最后一款AI系统。作者首先提出“余量-封闭指数”(HCI)量化现有大语言模型在自我改进能力上的根本局限;继而系统构建RSI五阶段发展框架:从改进执行自主性、改进策略自主性、经验获取自主性、环境适应自主性,最终迈向递归元改进。研究进一步分析RSI在科学发现、具身智能与软件工程等场景中的差异化需求与发展节奏,并基于工业实践与初步实证数据,厘清RSI落地的关键技术瓶颈,包括目标稳定性、评估可信性与改进可追溯性等核心挑战。 PDF · arXiv | ❤️ 73 3. Generative Late-Interaction Embeddings For Visual Document Retrieval Mohamed Eltahir, Talal Aloushan, Rose Khairoalsendi 本文针对视觉文档检索中late-interaction模型因高维嵌入导致的存储开销问题,提出生成式晚期交互嵌入(GLIE)。作者发现文档页嵌入向量严格位于单位球面上,且集中于内在维度为5–6的低维流形,据此提出两项关键改进:一是将k-means质心归一化至球面以消除MaxSim分数系统性低估;二是利用该低维几何结构,仅用k ≪ N个生成向量即可重建整页N≈1000个嵌入。GLIE以k个轻量向量作为索引,并在检索后对候选页动态解码恢复全量嵌入以精确重排序。在ViDoRe v1数据集上,仅用每页4个向量时,GLIE达近80%原始nDCG@5性能,显著优于最优已有后处理方法(70%),且仅需415K参数、训练耗时不足3GPU小时。 PDF · arXiv · 代码 · 项目 | ❤️ 14...

九月 13, 2026 · 4 分钟 · Pan