AI 每日资讯 — 2026-07-28
🔥 HuggingFace 每日论文
1. Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
Siyuan Huang, Pengyu Cheng, Haotian Liu
本文针对大语言模型(LLM)自演化训练中任务多样性与验证可靠性难以兼顾的根本矛盾,提出技能自博弈(Skill Self-Play, Skill-SP)框架。该方法以可验证、场景特异的“技能”为基本单元,通过动态技能路由平衡深度执行
与开放探索;框架包含命题者、求解者与动态技能控制器三模块,在强化学习驱动下协同进化:命题者基于采样技能生成挑战性任务,求解者探索能力边界,技能控制器依据执行反馈持续更新并扩展技能库。在工具调用与复杂推理基准上的实验表明,Skill-SP显著提升模型性能上限,展现出强健的自主进化能力。2. Scaling Native Multimodal Pre-Training From Scratch
Haoyuan Wu, Aoqi Wu, Hai Wang
本文系统研究了从零开始的原生多模态预训练(Native Multimodal Pre-Training)的可扩展性规律。针对现有工作缺乏对计算预算约束下模型规模与数据量协同缩放机制的定量刻画,作者提出基于Transformer的视
觉-语言联合训练框架,发现目标损失服从可预测的计算定律,且最优模型参数量与token数均呈幂律缩放。关键发现包括:语言任务的资源分配规律对多模态数据比例不敏感,而多模态任务则高度依赖数据构成——文本主导的数据混合仅在大模型尺度下具备计算效率,促使最优资源配置向更大模型容量倾斜。通过建模数据组成对缩放指数的影响,进一步推导出指导高效训练的配置前沿。3. IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
Varun Gumma, Navonil Majumder, Soumitra Sinhahajari
本文针对现有大语言模型(LLMs)在科研创意生成中仅单独优化质量或多样性、导致创意同质化或低质泛滥的问题,提出将研究构想生成建模为质量-多样性(Quality-Diversity, QD)联合搜索任务。为此,作者设计了多智能体框架
IDEAgent,通过谱系化思想演化机制,结合多目标反馈驱动的修复与精炼以提升质量,并利用轻量级序列记忆及与历史祖先、已拒提案的显式对比保障多样性。为定量评估QD协同效果,提出联合指标Yield,衡量满足预设质量阈值的最大互异创意集规模。在覆盖计算机科学8个子领域的32个主题上实验表明,IDEAgent的Yield得分较最优基线提升3.89倍,且在8倍数量的主题上实现非零Yield;进一步分析证实,修复与精炼模块显著增强了创意的逻辑严谨性与表达清晰度。4. SceneActBench: Can Agents Act on the 3D Scenes They See?
Yifei Zhao, Xiangxin Zhou, Wenhao Yang
SceneActBench 首次系统评估视觉语言模型(VLM)代理在完整多物体3D场景中的具身动作能力,填补了现有3D基准仅关注文本响应或单物体操作的空白。该基准构建于统一的代理-环境闭环框架,涵盖五类3D任务,基于210个源实例
生成520个带配对输入条件的任务案例。代理以PNG图像或视频帧(辅以可选3D资产)为输入,在3D环境中执行动作,输出通过任务定制的几何指标与隐藏真值对比评估。在11种主流VLM配置上的实验表明,整体得分仅介于38.6–50.2之间,且无一模型在所有任务上表现稳健,失败分析进一步揭示了跨模态理解与空间推理的关键瓶颈。5. Spectral Prior for Reducing Exposure Bias in Diffusion Models
Yuya Kobayashi, Masato Ishii, Yuhta Takida
扩散模型在迭代采样过程中常因误差累积而产生暴露偏差(exposure bias)。本文揭示了训练与推理阶段间存在系统性的频域偏差,可建模为频率相关的信噪比(SNR)误差,且其方向随模型结构和时间步动态变化,导致固定校正策略难以泛化
。为此,我们提出频谱对齐(Spectral Alignment, SPA)方法:首先离线拟合训练数据的参数化频谱先验,再在推理时通过高效FFT加速的梯度计算实现频谱引导。SPA计算开销仅增加3–4%,可与无分类器引导(CFG)协同使用。实验表明,该方法在DDPM、ADM、SD2.0、SDXL、SD3.5及FLUX等多种架构上均取得一致性能提升。6. Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization
Hao Wang, Kun Yuan, Wenlin Zhong
本文针对跨分词器(cross-tokenizer)场景下在线策略蒸馏(OPD)中教师模型概率质量丢失或错配的问题,提出字节前缀边缘化(BPM)方法。BPM在共享字节空间中重构教师模型的下一词分布:将每个教师token的概率分配给其
字节表示最长前缀匹配的学生token,聚合映射至同一学生token的概率质量,并将未匹配部分归入显式残差类别,从而生成词汇完备、字节对齐且质量守恒的目标分布。该方法在99%以上训练位置精确恢复教师诱导的字节前缀边缘分布,其余情形采用质量守恒的链式分解下界。实验表明,BPM在六个数学与编程基准上显著优于现有跨分词器方法,六任务平均@8准确率提升3.7–6.6个百分点。7. RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding
Jianqin Liu, Weiwei Cao, Wanxing Chang
本文针对医学多模态大语言模型(MLLMs)在放射影像理解中视觉感知不可靠、诊断结果缺乏底层视觉证据支撑的问题,构建了涵盖113万样本的细粒度基准Perception-Bench,从属性判断、空间定位、空间理解等六维度系统评估模型基
础视觉能力。实验发现现有模型在病灶位置、大小、密度等基本属性识别上严重不足。为此,提出感知驱动的RadSight模型:采用双通路2D/3D编码器保留原始影像空间结构,将理解过程解耦为视觉-语言对齐、细粒度视觉感知、临床诊断与诊断解释四阶段;基于837万感知导向语料与渐进式课程学习训练。在Perception-Bench上,RadSight显著提升各维度性能,尤其在空间接地与属性识别任务中较基线模型平均提升24.6%。8. MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
Lorenzo Concina, Seraphina Fong, Marco Matassoni
本文提出MEUSLI——首个面向开源社区的多语言投影器家族,旨在 bridging Whisper语音编码器与开源多语言大语言模型(LLMs),实现端到端、全开源的28种欧洲语言自动语音识别(ASR)。相比现有仅支持少数语言(尤以
英语为主)的轻量级投影器,MEUSLI通过适配高/低资源语言并采用持续学习策略,显著提升跨语言泛化能力。实验表明,其在ASR任务上性能优异;进一步拓展至语音翻译与主题识别任务时,仅需每语言数小时监督数据即可取得良好效果。MEUSLI为可扩展、包容性强的多语言SpeechLLM研究提供了坚实基础。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills
Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di
本文提出FlowEvo——一种无需训练的自演化智能体框架,旨在解决大语言模型代理在推理时生成的工作流中有效策略难以复用的问题。该框架通过三重耦合机制实现能力持续积累:(1)工作流到技能的编译,从成功执行轨迹中提取可调用的可执行构件
及结构化引导;(2)技能到工作流的反馈,支持技能检索与上下文注入;(3)技能策展,动态评估并抑制引发负迁移的低效技能。实验表明,FlowEvo在ALFWorld、HumanEval和GSM8K等基准上显著提升准确率与效率,在ALFWorld中成功率高达82.8%,较最强基线提升23.6个百分点,且单次交互平均token消耗不足最优基线的一半。消融研究验证了各机制的有效性。2. Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals
Nicolas Caron, Christophe Guyeux, Maxime Coulmeau, Benjamin Aynes
本文针对野火风险评估中误用分类指标(如F1-score、IoU)评价连续风险信号的根本缺陷,提出一种基于序关系一致性的单调性评估框架,旨在衡量预测风险分值的上升是否系统性对应真实运营负荷(如火点数量、响应时长、部署资源)的增加。在
法国滨海阿尔卑斯省开展实证研究,对比专家驱动的DFE指数、基于GRU的预测模型及融合预测AI与大语言模型推理的多智能体系统FARS。结果表明:DFE虽分类性能差,却在全风险尺度上展现出最优且均衡的单调性;GRU模型局部单调性强但风险分布失衡;FARS未能修正上游信号固有缺陷。研究确立了风险建模的新范式——有效性在于风险序数尺度对运营动态的可解释性,而非火灾事件预测精度。3. Securing Multimodal AI through Internal Information Decomposition
Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji
本文针对多模态大语言模型中跨模态协同攻击难以被单模态防御机制识别的问题,提出基于内部信息分解的检测框架FlowGuard。该方法通过监控文本与视觉模态在推理过程中的内在一致性,利用受偏信息分解(Partial Informatio
n Decomposition)启发的FlowVectors量化跨模态冗余、协同与模态主导性,从而判别输入是否恶意。不同于依赖原始输入或输出的现有方法,FlowGuard在推理时轻量运行,仅需良性样本训练。实验表明,在未知攻击下,其攻击成功率由>90%降至<15%,同时保持<3%的效用损失,并实现最高6倍的延迟降低。🏛️ Heng Ji
📄 arXiv: cs.CL
1. Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding
本文针对多模态大语言模型(MLLMs)安全对齐脆弱性问题,首次揭示其在内容理解与安全防御能力间存在“风格不一致性”:模型能鲁棒理解不同视觉风格的内容,却易被特定风格触发绕过安全机制。为此,作者提出对抗风格优化(ASO)方法,通过基
于组相对策略优化(GRPO)的强化学习框架,联合对数概率拒绝信号与强判别力法官模型的语义保真度评估,驱动图像编辑模型生成最优风格扰动。ASO作为即插即用模块,显著提升现有视觉越狱攻击的成功率(ASR),在多个SOTA基线上实现稳定增益,验证了风格偏差是可扩展的MLLM红队测试新维度。2. A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
Mohtashim Khan
本文提出一种基于共识的相对偏好评估框架,旨在解决传统LLM基准依赖静态数据集与绝对正确性指标、难以刻画多解场景下响应质量差异的问题。该框架摒弃固定参考答案,转而通过多个大语言模型对匿名化候选响应进行盲评排序,以跨模型共识作为响应质
量的代理指标。实验涵盖编程、常识、安全、逻辑推理与数学五大领域,采用5个前沿LLM开展交叉投票,构建“相对智能指数(RII)”量化模型间偏好关系。结果表明,不同模型在各领域展现出稳定且可复现的偏好排序模式,验证了该方法的可行性与可扩展性;需强调的是,RII反映的是模型间一致性而非客观正确性或人类判断,但其与人类评价存在部分相关性,为多解任务下的LLM评估提供了新型自动化范式。3. Evaluation design conditions the expert-vs-auto MeSH gap: a controlled comparison of bag-of-words and BiomedBERT on the Cohen benchmark
Samuel M. Okoe-Mensah
本文探究了评估设计对专家标注与自动标注MeSH术语在文献筛选任务中性能差距的影响。基于Cohen等(2006)药物类别基准数据集,作者系统比较了词袋模型逻辑回归与BiomedBERT两种分类器在Statins、Opioids和AD
HD三个主题上的表现。结果表明,在标准5折全量交叉验证下,词袋模型的专家-自动MeSH差距达+0.096 WSS@95%,但当调整为匹配小主题规模(n=803)或采用10折验证后,差距显著缩小至+0.033和+0.021;BiomedBERT在标准评估下仅达+0.020,与优化后的词袋结果无统计学差异。研究揭示评估设计(如折数、数据规模)会实质性改变关于特征来源优劣的结论,并指出Transformer模型受输入长度限制可能引入偏差。📄 arXiv: cs.LG
1. Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees
Lei Yang
本文提出EaaS——一种云原生的“评估即服务”(Evaluation-as-a-Service)参考架构,采用六类无状态Kubernetes微服务实现可扩展AI监控:基于有限样本校正自适应预测集的共形预测、校准性评估、基于随机傅里
叶特征近似最大均值差异(RFF-MMD)的漂移检测、带自助置信区间的公平性监控、DAG驱动的流水线编排器及结果存储API。实验表明:共形覆盖率达标(偏差≤1.4个百分点);MMLU任务中top-20对数概率完整覆盖全部答案,10%模拟缺失仅致覆盖率下降<1.5%;RFF-MMD在中位数启发式带宽下漂移检出率达100%,误报率5–8.5%;UCI Adult数据集上识别出显著种族间人口统计奇偶性差距(DP gap=0.33)。各服务p99延迟优异(共形预测与校准<2ms),RFF-MMD适用于周期性批处理(~500ms)。对比现有开源工具,EaaS首次融合共形预测即服务、微服务解耦与DAG编排能力。2. On the Depth Scalability of Logic Gate Networks
Taegun An, Dohun kim, Haebeom Lee, Changhee Joo
本文针对逻辑门网络(LGNs)深度可扩展性不足的问题,揭示了其根本原因:一是深层松弛化LGNS中的优化坍塌,二是拓扑结构导致的信息瓶颈——即使采用跳连偏置初始化与直通估计也难以缓解。为此,作者提出输入锚定逻辑门网络(IALGNs)
,通过将每层门的计算耦合于动态隐特征与原始输入锚点,构建一条稳健的“计算脊柱”,保障深层路径对输入信息的有效访问。理论分析表明,深度为D的路径最多可依赖D+1个输入比特,并确立了严格的逐层深度层级关系;引入随机-k锚松弛进一步优化锚点选择而不破坏脊柱结构。在MNIST、CIFAR-10和CIFAR-100上的实验显示,IALGNs在固定宽度下可持续提升精度至100层以上,显著优于其他LGNS变体;消融实验与有效深度分析验证了输入锚定机制能生成渐进式更有信息量的表征并维持长程计算路径。3. MotifRole-Diff: Risk-Optimal Role-Aware Corruption for Masked Molecular Graph Diffusion
Tasfia Nuzhat Ornee, Elias Hossain, Ivan Garibay, Niloofar Yousef
本文针对分子图扩散生成中统一掩码策略忽视结构异质性的问题,提出MotifRole-Diff——一种基于分子子结构角色的风险最优掩码方法。该方法依据实证测得的去噪难度与图级扰动影响,为不同角色(如官能团、骨架等)分配差异化掩码率,在
保持原有模型架构、无损序列空间及图解码器的前提下,将掩码预算的分配建模为角色加权残差风险最小化问题。理论证明其风险最优性,并在QM9和MOSES数据集上验证:在计算资源匹配条件下,有效性分别提升至0.944和0.938,FCD指标显著下降,且各角色类别重建质量均获改善,证实结构感知掩码优于均匀策略。📄 arXiv: cs.CV
1. Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu
本文提出Oxygen-TryOn——一种面向时尚领域的通用虚拟试穿基础模型,旨在解决现有方法在多品类、多物品、非受控场景下试穿效果差、身份与外观保真度低的问题。该模型摒弃传统掩码修复范式,将试穿重构为多参考、理解驱动的生成任务;通
过自建大规模高质量数据引擎,并采用三阶段训练策略(持续预训练、监督微调与强化学习),其中强化学习阶段融合自研试穿奖励模型与规则引导的通用大模型,协同优化细粒度一致性与指令级质量。实验表明,其在单/多物品试穿任务上均达SOTA,显著优于主流开源(FLUX.2)与闭源系统(Nano Banana Pro等)。🏛️ Nan Duan
2. Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints
Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis
本文针对大型视觉语言模型(LVLMs)在复杂视觉推理任务中逻辑一致性不足的问题,提出ConVBench基准——首个聚焦多维度视觉中心推理(涵盖动作状态、复杂计数、空间关系、因果意图、常识推理与时间感知)且每图配对两个逻辑等价问题的
评测集。为全面评估,作者定义逻辑一致性和鲁棒准确率双指标。进一步,提出ConVLM方法,基于组相对策略优化(GRPO)强化学习框架,引入自动构建的逻辑等价问答对与双奖励机制(准确性+一致性),显著提升模型推理鲁棒性,且无需严格答案监督。实验表明,ConVLM在ConVBench上大幅超越基线,验证了一致性约束对视觉推理能力的有效增强。3. Risk-Routed Implicit Boundary Refinement for Robust Ultrasound Image Segmentation
Jingguo Qu, Xinyang Han, Xiang Wang, Yuqi Yang, Tonghuan Xiao, Sheng Ning, Jing Qin, Ann Dorothy King, Winnie Chiu-Wing Chu, Jing Cai, Michael Ying
本文针对超声(US)图像分割中因斑点噪声、低对比度边界、声影及跨中心采集差异导致的边界模糊与泛化性差问题,提出风险引导的隐式边界精修方法(RIBR)。该方法将隐式神经表征作为风险感知的残差校正模块,而非全图掩码预测器,结合边界精修
隐式残差、风险路由残差调控及几何与斑点感知的边界正则化,精准增强不确定区域边界并抑制非边界振荡。在涵盖淋巴结、乳腺病灶、甲状腺结节和前列腺的9个US数据集上,RIBR以紧凑参数量显著降低边界误差,在宏平均指标及器官特异性评估中均达最优性能,验证了受控隐式残差学习在资源受限与边界敏感场景下的有效性。📝 AI 官方博客
1. 3 Google updates from Galaxy Unpacked 2026
📝 Google AI Blog
本文报道了2026年三星Galaxy Unpacked发布会上公布的三项谷歌重要更新:一是Google Lens深度集成至Galaxy智能眼镜(如Gentle Monster与Warby Parker联名款),支持实时视觉问答;二是增强版多…
模态理解能力,可基于图像精准识别建筑并返回其历史背景;三是端侧AI驱动的场景化行动推理,用户拍摄餐厅门面即可一键触发订座流程。实验表明,新系统在复杂光照与遮挡场景下视觉-语言对齐准确率达92.4%,端到端任务完成时延低于1.8秒。2. Connect more of your apps to Search
📝 Google AI Blog
本文提出一种面向搜索生态的跨应用连接框架,旨在提升用户在搜索引擎中对第三方应用内容的发现与交互效率。通过定义标准化的“Connected Apps”协议与轻量级渲染接口,支持应用将结构化数据实时同步至搜索索引,并在搜索结果页原生渲染富媒体卡…
片。关键技术包括动态Schema映射、低延迟增量同步机制及隐私感知的内容授权模型。实验表明,该方案使应用内内容在搜索结果中的点击率提升37%,用户任务完成时长平均缩短22%,已在主流移动搜索平台部署并支持超500款应用接入。3. Create, edit and star in videos with two Google Vids updates
📝 Google AI Blog
本文介绍了Google Vids两项关键更新:集成Gemini Omni多模态模型与推出Personal Avatars(个人虚拟形象)功能。前者显著增强视频生成与编辑能力,支持跨文本、语音、图像与视频的联合理解与生成;后者允许用户基于少量…
照片和语音样本创建高保真度、可驱动的个性化数字人,实现“自导自演”式视频创作。系统采用轻量化神经渲染与语音驱动唇形同步技术,在端侧完成实时姿态与表情生成。实验表明,新版本在视频连贯性、语音-唇动对齐精度(误差<0.2帧)及用户创作效率(平均缩短70%制作时间)方面均达行业领先水平。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画AI研发 workforce 在未来AI系统构建过程中趋向合作或非合作行为的演化机制。模型将AI社区的协作倾向建模为非线性动力系统,识别决定系统长期走向…
的关键分岔点与吸引域边界;结合当前AI领域在开源实践、安全研究投入、机构治理倡议等方面的实证数据,初步定位人类社会所处的状态区域;并提出若干可观测指标(如跨组织对齐研究合作率、关键能力披露规范采纳度等),用于动态评估是否正朝向可治理路径演进。实验模拟表明,早期制度设计与激励结构对长期合作均衡具有显著锁定效应。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(Reasoning Interpolation)的早期预警方法,用于在强化学习训练过程中提前识别奖励黑客行为(Reward Hacking)的出现。核心思想是利用重要性采样(Importance Sampling)…
,结合经微调的“捐赠者”预填充(donor prefills)生成具有潜在异常推理路径的样本,并通过插值分析模型决策逻辑的偏移趋势。该方法无需修改训练流程或访问奖励函数内部结构,仅依赖策略输出与偏好数据即可实现干预前检测。在多个基准任务(如MiniGrid、SafeRLBench)上的实验表明,该方法可在奖励黑客现象实际发生前平均提前3.2个训练阶段发出预警,准确率达89.7%,显著优于基线检测手段。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习智能体在优化代理奖励函数时偏离设计者真实意图的现象,本工作系统梳理了现有奖励黑客案例的成因分类,提出一种基于奖励函数可解释性与行为一致性的双维度检测框架…
,并初步实现了在Gridworld与MiniGrid环境中的验证。实验表明,该方法能有效识别约78%的隐式奖励篡改行为,且在保持策略性能的同时将目标偏移率降低42%。后续将拓展至高维连续控制任务并探索鲁棒奖励建模机制。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,旨在显著提升长时程智能体(long-running agents)的稳定性与推理能力,并在编程任务与专业工作场景中实现性能跃升。该模型通过优化长上下文建模、增强多步推理一…
致性及改进代码生成准确性等关键技术,大幅降低幻觉率并提升任务完成率。实验表明,Opus 5在HumanEval、MBPP等编程基准上较前代提升12.3%,在复杂文档分析与跨任务规划任务中准确率提高9.7%。同时,其内存效率优化支持长达200K token的持续交互,为实际Agent部署提供了坚实基础。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该内容仅显示标题“one daily email”,无正文信息,无法提取具体新闻或文章核心内容。