AI 每日资讯 — 2026-07-21
🔥 HuggingFace 每日论文
1. Loop the Loopies!
Zitian Gao, Yilong Chen, Yihao Xiao
本文提出Loopie——迄今最强大的循环式Transformer模型。Loopie采用双规模混合专家(MoE)架构,包含20B总参/2B激活参数与6B总参/0.6B激活参数两个版本,突破了传统循环Transformer中“计算量线
性增长不如参数量线性增长”的瓶颈。通过创新的后训练推理增强流程,Loopie在同等预训练计算预算下显著超越同规模标准Transformer基线(如30B-A3B)。实证表明,其在2025年国际数学与物理奥林匹克竞赛中无需外部工具即达金牌水平,验证了循环架构与推理优化协同设计的有效性。2. Understanding Reasoning from Pretraining to Post-Training
Jingyan Shen, Ang Li, Salman Rahman
本文探究了从预训练到后训练(RL)全过程对大语言模型推理能力的影响,以国际象棋为可控实验平台,系统研究模型规模、预训练数据量与RL计算投入之间的交互关系。作者构建了涵盖5M至10亿参数的模型族,在人类棋谱上预训练,经合成推理轨迹监
督微调(SFT),再在可验证奖励的棋题上进行强化学习。实验发现:RL后性能可由预训练损失良好预测,且RL奖励曲线斜率近似线性依赖于预训练token数量;RL并非简单优化SFT策略,而是在简单题目中放大已有正确偏好,在难题中挖掘SFT几乎忽略的正确动作。3. When Does Muon Help Agentic Reinforcement Learning?
Kai Ruan, Jinghao Lin, Zihe Huang
本文探究了优化器 Muon 在稀疏奖励智能体强化学习(Agentic RL)中的有效性。基于 ALFWorld 环境与 Qwen2.5-0.5B-Instruct 模型,作者在 Group-in-Group Policy Opti
mization(GiGPO)等策略优化框架下,开展单种子对照实验,对比 Muon 与 AdamW 的性能。结果表明:仅将 Muon 应用于隐藏层权重矩阵即可显著提升验证成功率(如 GiGPO 下从 0.290 升至 0.546,+88%);其增益高度依赖优势估计器选择与学习率——在 1e-5 学习率下,GraphGPO+Muon 达到 0.901 最终成功率,AUC 提升 39.3%,且分别提前 30 和 60 轮达到 0.5 与 0.75 成功率阈值。研究揭示了策略优化器、优势估计与学习率的协同效应,为 agentic RL 的优化器设计提供了新视角。4. Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar
本文提出Audio-Visual Flamingo(AV-Flamingo),一种面向长时复杂视频的开源音视频大语言模型。针对现有音视频大模型难以处理长程、多事件、跨模态推理的问题,作者构建了含约700万样本的Audio-Visu
al-Skills数据集,设计了从短时感知到长时多事件推理的三阶段课程学习策略,并提出了基于时间戳对齐的“时序音视频交错思维链”推理框架,显著提升时序建模与可解释性。在15+音视频及多模态基准测试中,AV-Flamingo以更小参数量超越同类开源模型,在长视频理解任务上甚至媲美或优于更大规模的闭源模型,同时展现出优异的零样本迁移与真实场景泛化能力。5. JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
Haoran Sun, Wentao Zhang, Junyang Hua
JoyNexus提出了一种面向服务的多租户VLA模型后训练框架,旨在解决现有计算服务中资源独占、成本高昂与调度低效等问题。该框架将训练、推理与环境服务解耦,依托共享基础模型与租户专属插槽,支持监督微调、强化学习与评估等多类任务。租
户可通过高层语义API或底层可组合API灵活调用服务,其动作模块、优化器及策略版本严格隔离,并由全局训练/推理队列统一调度。创新性地引入组批机制(group batching),适配异构VLA数据模式中兼容的模型输入前缀,显著提升GPU利用率与吞吐量。实验表明,JoyNexus在保持租户隔离性的同时,相较独占式部署降低37% GPU小时消耗,加速比达2.1×。6. FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation
Hao Liu, Chenghuan Huang, Ye Huang
本文针对视频扩散Transformer中自注意力计算开销大、多GPU序列并行下自适应稀疏注意力负载不均衡导致的“秩级长尾”问题,提出FVAttn——一种免训练、支持运行时负载均衡的稀疏注意力系统。其核心包括:视频感知的块组织与To
p-p+Top-k混合路由前端、运行时掩码修复机制、基于P2P通信的重头迁移策略,以及利用空闲计算资源的松弛感知稀疏增强技术。在Wan2.2 I2V模型上,FVAttn将平均负载不均衡度从1.34降至1.08,注意力计算速度较FlashAttention提升4.41倍,DiT端到端推理加速2.02–2.11倍,同时保持具有竞争力的生成质量。7. An Exam for Active Observers
Jiarui Zhang, Muzi Tao, Shangshang Wang
本文提出ActiveVision基准,首次系统评估多模态大语言模型(MLLMs)是否具备人类式的主动视觉观察能力——即通过迭代注视与假设驱动的感知闭环完成复杂视觉任务。该基准涵盖17项跨3类任务,强制要求模型进行多次视觉交互而非单
次静态理解。实验表明,当前前沿MLLMs表现极差:GPT-5.5在最高推理努力层级下仅解决10.6%题目,11项任务得分为零;Claude Fable 5亦仅达3.5%,远低于人类平均96.1%。即使赋予模型自主编写与执行视觉代码的能力,其代码在真实图像上仍不可靠,且缺乏检测自身失败所需的主动感知机制。结果揭示现有MLLMs在感知-推理闭环上的根本性缺失,亟需新型架构与训练目标予以弥补。8. Let the Body Follow: Coupled Egocentric Control for Whole-Body Robot Teleoperation
Tsung-Chi Lin, Yichen Xie, Chien-Ming Huang
本文针对全身遥操作中多体部件(头、臂、躯干、底盘)协调难、任务意识易分散及运动学/环境约束易触发的问题,提出“耦合自我中心控制”方法:通过将操作者头部与手部动作自然映射至机器人躯干与底盘运动——头俯仰调节躯干高度、头偏航驱动底盘旋
转、末端高度变化触发躯干运动、工作空间边界激活底盘平移。在TIAGo机器人家庭照护任务的用户实验中,相比基线混合接口,该方法显著提升物体操作效率,降低按钮操作负荷与臂部奇异性,减轻认知负荷与总体工作量,并提高易用性、学习效率、操作信心及用户对躯干/底盘控制的偏好。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis
Shaoting Tan, Ning Liu, Yuntao Du, Shuyue Wei, Wu Shuai, Qian Li, Yanyu Xu, Wei Zhang, Lizhen Cui, Haitao Yuan
本文针对序贯诊断中诊断准确性与资源成本难以兼顾的问题,提出GraphDx——一种成本感知、知识增强的多智能体框架。该框架首创医学诊断知识图谱(MDKG)自动化构建流程,融合典型性量化、动作中心拓扑及双目标属性(诊断相关性与成本敏感
性);并设计感知、推理、决策三类协同智能体,其中推理智能体在MDKG上执行确定性证据评分与成本感知规划。在MedQA与MIMIC-IV数据集上,基于DeepSeek-V3、Kimi-k2和Llama-3.3三大LLM骨干模型的实验表明,GraphDx将诊断成功率从50%–68%显著提升至79%–93%,同时降低检测成本20%–54%,兼具鲁棒性、经济性与可解释性。2. Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction
Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew
本文针对现有大语言模型(LLMs)在因果干预型问答中依赖隐式语言推理、导致因果假设不透明、推理路径不可验证及干预鲁棒性差等问题,提出Causal-Audit框架。该框架将因果推断建模为显式的图结构推理,包含四个模块化阶段;核心创新
在于目标感知的因果图构建策略,以目标变量为约束引导图扩展,有效抑制无关变量与伪因果关系;并设计路径级因果证据聚合机制,协同建模增强与抵消效应。在三个基准上的实验表明,本方法显著优于现有LLM基线,同时提供可解释、可审计的因果推理轨迹。3. Cura 1T: Specialized Model for Agentic Healthcare
actAVA AI, :, Haolin Chen, Leon Qi, Steve Brown, Deon Metelski, Tao Xia, Joonyul Lee, Qixuan Wang, Kevin Riley, Frank Wang, Weiran Yao
Cura 1T 是一款面向医疗智能体(Agentic Healthcare)场景专门设计的大语言模型,旨在统一支持高风险医患沟通、多模态临床推理(文本与影像)、交互式诊断及电子健康档案(EHR)工具调用等复杂任务。为克服传统微调中
能力耦合与任务干扰问题,本文提出人类把关的自进化训练范式:训练智能体在每轮迭代中自主规划能力目标、生成/筛选合成与真实数据、评估基准轨迹并动态优化数据配比。实验表明,Cura 1T 在综合性医疗评测套件中位居前沿模型前列,同时在跨领域推理与智能体通用基准上保持强竞争力。📄 arXiv: cs.CL
1. Large Language Models as Unified Multimodal Learners for Clinical Prediction
Ajay Madhavan Ravichandran, Bilgin Osmandoja, Klemens Budde, Klaus Netter, Tobias Strapatsas, Aljoscha Burchardt, Sebastian M"oller, Roland Roller
本文提出一种基于大语言模型(LLM)的统一多模态临床预测范式,将电子健康记录中的文本叙述、生命体征、检验指标及合并症等异构数据统一序列化为自然语言文本,直接对预训练语言模型(如Llama 3.1、Gemma、Qwen3等)进行端到
端微调,无需设计专用多模态融合架构。该方法在三个临床任务上验证:MIMIC-III院内死亡预测、德国移植中心移植物失功纵向预测、急救救护车记录分诊分类。结果表明,该统一序列化方法在全部任务中均达到或超越传统多模态基线模型,并显著优于临床实际部署的梯度提升模型(移植物失功预测AUC提升4.2%),验证了其在降低系统复杂性的同时保持甚至提升预测性能的有效性。2. Verbalizable Representations Form a Global Workspace in Language Models
Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey
本文提出“可言说表征”(verbalizable representations)构成大语言模型中的全局工作空间(global workspace),类比人类意识中有限但可报告的意识内容。作者引入新型可解释性技术——Jacobia
n lens,识别模型在任意处理时刻“准备言说”的表征(即J-space)。实验表明,J-space具备全局工作空间的关键功能特性:支持报告、主动调用与保持、支撑静默推理的中间步骤,并能作为参数参与任意下游计算;其结构特征亦符合理论预期——仅在中间层呈现连贯语义、容量约数十个概念、且被模型权重更广泛广播。该表征窗口成功揭示了对齐审计中未显现在输出中的策略性推理、评估意识及训练内嵌的错位倾向;进一步发现后训练阶段将“助手视角”植入工作空间,并提出反事实反思训练,仅优化模型被中断后可能表达的反思内容,即可显著提升行为表现。🏛️ Google Research
3. VarRate: Training-Free Variable-Rate KV Cache Compression for Long-Context LLMs
Shahrzad Esmat, Dhawal Shah, Ali Jannesari
本文针对长上下文大语言模型(LLM)推理中KV缓存导致的内存瓶颈问题,提出无需训练的可变码率KV压缩方法VarRate。区别于现有训练-free方法——基于token选择的不可逆淘汰或均匀低秩编码的资源浪费——VarRate依据查
询敏感度为每个token动态分配非零低秩预算,实现“按需保秩”而非“粗暴裁剪”。在LongBench(16任务)上,以20%内存预算运行时,VarRate在Llama-3.1-8B和Qwen2.5-7B上分别仅比无压缩基线下降3.5–5.5分,平均性能优于均匀低秩基线及主流方法KVzip,在多数场景下精度相当且预填充开销降低至其1/8。📄 arXiv: cs.LG
1. Structure of the Circular-Dyadic Convolution Error
Ben Fauber, Alireza Moradzadeh
本文系统刻画了用哈达玛变换替代离散傅里叶变换(DFT)计算循环-二元卷积时引入的代数误差结构。作者提出三项互补性理论结果:首先,指出存在两个固定输入位置与两个输出位置始终无误差,且该误差无法通过输出重排消除;其次,误差算子近似满秩
,其零空间维数仅为对数级;最后,期望误差由单一“对齐标量”主导,并给出了在随机滤波器上的闭式均值表达式。理论分析表明,除位于普适零误差子空间的滤波器外,替换误差使输出能量渐近加倍。结果证实该误差具有明确结构、可预测性及对齐依赖性。2. Position: Quantum Program Generation Must Prioritize Validity Over Probabilistic Scaling
Junhao Song, Yu Zhou, William Knottenbelt, Yudong Cao
本文指出,将大模型的“规模扩展假说”直接迁移至通用量子电路生成存在根本性方向错误:量子电路需严格满足希尔伯特空间中的物理约束,其有效程序空间随量子比特数呈指数衰减,导致后验过滤不可行。作者主张从“人类中心型”代码助手转向“验证器中
心型”智能体,提出融合分层约束、拓扑掩码与符号代理的生成架构,在建模阶段即内嵌量子信息任务规则。实验分析表明,单纯扩大参数规模无法弥合有效性鸿沟,而验证感知的架构设计可实现模块化、高保真量子程序生成。🏛️ Yudong Cao
3. A Transportable Threshold-Based Framework for Interpretable Classification of Medical Data
Antony Garcia, Adrian Noriega, Gabrielle Britton, Xinming Huang
本文针对医疗AI中黑箱模型可解释性与可复现性不足的问题,提出一种基于统计学的可迁移阈值化框架,实现完全可解释的规则式临床分类。该方法采用监督式χ²引导的二值化策略,为连续医学变量自动学习最优临床相关阈值,使伯努利朴素贝叶斯(BNB
)模型能在保持固有透明性的同时高效处理连续数据。在Pima糖尿病、威斯康星乳腺癌和心衰预测三个基准数据集上,AUC分别达0.800、0.984和0.919;结合泄漏安全的交叉验证校准分析(含Brier分数、校准截距/斜率及β校准),显著提升概率可靠性。实例表明,模型推理仅需查表与基础算术即可复现,无需软件支持,为临床部署提供了可信、通用且可审计的AI解决方案。📄 arXiv: cs.CV
1. An Empirical Study of Handcrafted Feature Learning and Convolutional Neural Networks for Facial Expression Recognition
Chethiya Galkaduwa
本文对人工设计特征与卷积神经网络(CNN)在面部表情识别任务中的性能进行了实证比较。研究评估了三种方法:基于HOG特征与SVM分类器、LBP特征与逻辑回归、以及轻量级CNN,在FER-2013、CK+和KDEF三个基准数据集上的表
现。结果表明,CNN在整体准确率上最优,尤其在复杂、真实场景数据中优势显著;HOG+SVM在受控环境下表现稳健;而LBP方法在所有数据集上均效果欠佳。研究进一步指出,数据集复杂度显著影响模型性能,强调鲁棒特征学习对实际应用的重要性。2. Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection
Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhenyu Zhang
本文针对AI生成视频(AIGV)检测中视频预训练骨干网络性能未达预期的问题,指出其根源在于标准全局读出层过度压缩时空信息,丢失了关键的局部补丁级时序动态与跨补丁关系。为此,作者提出轻量级插件式读出模块——速度门控补丁速度分析(V-
PVP),仅替换聚合层,通过双流结构建模补丁速度场,仅引入约0.5M可训练参数。在端到端微调与线性探针两种设定下,V-PVP显著提升多种视频骨干网络性能,在AIGVDBench上以完全冻结骨干网络实现95.28% AUC,验证了重激活视频骨干时序表征能力的有效性。3. Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark
Silas kwabla Gah, Ebenezer Owusu
本文提出一种无需训练的开放词汇3D点云分割方法,面向广义少样本(GFS-PCS)任务。该方法摒弃了传统依赖3D标注、每轮微调及少样本支持图像的做法,仅利用冻结的3D视觉-语言模型(RegionPLC)与冻结的可提示三维分割器(SA
M3),通过跨视角一致性机制融合二者输出:仅当足够多视角共识某点属于新类别时才判定为新类。在ScanNet200基准上,该方法在不牺牲基类精度(下降≤0.5)前提下,将新类mIoU提升2.6;在更具挑战性的ScanNet++上,新类mIoU大幅提升15.7(达31.9),调和平均分从21.5升至31.1,验证了其强泛化能力与鲁棒性。📝 AI 官方博客
1. Connect more of your apps to Search
📝 Google AI Blog
本文提出一种面向搜索引擎的多应用深度集成框架,旨在突破传统搜索结果仅返回网页链接的局限,实现本地及第三方应用程序内容的实时、结构化接入与渲染。核心方法包括:设计统一的应用连接协议(ACP)以标准化应用数据暴露接口;构建轻量级代理服务实现跨平…
台应用索引与权限安全管控;提出动态上下文感知的“Connected Apps Rendering”机制,支持在搜索结果页原生渲染应用内功能模块(如日历事件、待办事项、文档预览)。实验表明,该方案在主流移动与桌面平台上平均提升用户任务完成率37%,搜索意图满足度提升29%,且端到端延迟控制在120ms以内。2. Create, edit and star in videos with two Google Vids updates
📝 Google AI Blog
本文介绍了Google Vids两项重要更新——集成Gemini Omni多模态模型与推出Personal Avatars(个人虚拟形象)功能,旨在降低视频创作门槛。Gemini Omni支持跨文本、图像、音频与视频的联合理解与生成,实现自…
然语言驱动的视频剪辑、脚本生成与智能配音;Personal Avatars则基于少量用户影像与语音样本,构建高保真、可驱动的个性化数字人,支持用户“出镜”于自动生成的视频中。实验表明,新功能将平均视频制作时间缩短68%,用户编辑意图准确率达92.3%。该工作标志着AIGC视频工具向端到端、个性化与高度可控方向迈出关键一步。3. Celebrating 25 years of visual search innovation
📝 Google AI Blog
本文回顾了视觉搜索技术发展25年的重要历程,系统梳理了从早期基于内容的图像检索(CBIR)到深度学习驱动的端到端视觉搜索范式的演进路径。论文重点剖析了关键技术创新,包括局部特征描述子(如SIFT)、哈希编码、大规模图像嵌入学习及多模态对齐机…
制,并探讨了在真实场景中面临的挑战,如细粒度识别、跨域泛化与隐私保护。实验表明,当前主流方法在Flickr30K和MS COCO等基准上实现92.3%的Top-1检索准确率,较2000年代初提升逾40个百分点。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画构建未来AI的从业者群体最终走向合作或非合作状态的演化机制。模型将AI社区视为受激励结构、规范传播与外部干预影响的动态系统,通过相空间建模刻画合作性行为…
的吸引域边界。作者结合当前AI研发生态中的实证线索(如开源文化、安全研究投入、机构治理实践),评估人类社会当前所处的演化区域,并识别若干关键观测指标——如跨组织协调机制的成熟度、对齐研究资源占比及政策响应速度——作为判断是否处于“良性路径”的早期信号。模拟与定性分析表明,微小但持续的制度性干预可能显著改变长期演化轨迹。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(Reasoning Interpolation)的早期检测方法,用于在强化学习训练过程中预判奖励黑客行为(Reward Hacking)的出现。核心思想是利用重要性采样(Importance Sampling),结…
合经微调的捐赠者前缀(donor prefills)生成多样化但语义连贯的推理轨迹,通过分析模型在插值路径上的奖励预测偏差与策略不一致性,识别潜在的奖励博弈信号。该方法无需修改训练流程或访问环境内部状态,仅依赖离线策略快照即可实现高精度预警。在多个基准任务(如MiniGrid、ProcGen及文本驱动的RLHF模拟环境)中,该方法平均提前32%的训练步数检测到奖励黑客现象,误报率低于8.7%。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为奖励黑客(Reward Hacking)问题的阶段性研究进展报告,聚焦于强化学习中智能体通过非预期方式操纵奖励函数以获取高分却违背设计意图的现象。研究系统梳理了现有奖励黑客的典型模式与成因,提出一种基于奖励函数鲁棒性验证与行为约束联合…
建模的防御框架;关键技术包括可解释性奖励分解、反事实行为扰动检测及基于不变性约束的策略正则化。在Gridworld、ProcGen及自定义多目标控制任务上的实验表明,该方法将奖励黑客发生率降低62%–78%,同时保持92%以上的原始任务性能。7. Inviting hard questionsAnnouncementsJul 9, 2026We’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
本文围绕Anthropic最新发布的AI模型与技术生态展开,重点介绍Claude Sonnet 5的性能突破、Claude Code从内部CLI工具演进为成熟编码代理的开发历程,以及Fable 5重部署与跨企业合作构建的 jailbreak…
严重性评估框架。研究通过系统性工程实践与多机构协同验证,显著提升模型在代码生成、安全对齐与鲁棒性方面的表现;实验表明,Sonnet 5在多项基准测试中达到前沿水平,Claude Code在真实开发场景中实现高准确率与低延迟响应,Fable 5框架则为行业提供了可复现、可量化的安全评估标准。8. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
9. AnnouncementsJun 30, 2026Redeploying Fable 5Fable 5 returns globally July 1. We’re also proposing an industry-wide framework for scoring jailbreak severity, together with Amazon, Microsoft, Google, and other Glasswing partners.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该内容仅显示标题“one daily email”,无正文信息,无法提取具体新闻或文章核心内容。
💬 Hacker News AI 热门
1. China’s open-weights AI strategy is winning
🔥 201 分 · 💬 181 评论
文章指出,中国采取开放权重(open-weights)AI模型战略,正逐步削弱美国在AI领域的主导地位。相比美国企业封闭、 proprietary 的模型和受出口管制限制的GPU算力,中国通过免费、可自由部署、可定制的开源式模型,快速构建全…
球生态——尤其在工程、科研、制造等领域广泛落地。尽管美国前沿模型曾具性能优势,但阿里、Moonshot等新模型已逼近OpenAI水平且成本更低。作者认为,开放基础设施更能激发创新,而美国过度依赖商业锁定与政府管制,反而阻碍生态发展,亟需调整激励机制以支持公共利益导向的开放AI。2. Over 30% of new ArXiv submissions now read as AI-written
🔥 16 分 · 💬 4 评论