AI 每日资讯 — 2026-07-26
🔥 HuggingFace 每日论文
1. Visual Contrastive Self-Distillation
Yijun Liang, Yunjie Tian, Yijiang Li
本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦不依赖特权答案或显式视觉掩蔽的新型在线策略自蒸馏方法。VCSD通过指数移动平均(EMA)教师模型在相同提示与响应前缀下,分别基于原始图像和内容擦除图像生成两个词元分布,利用其
逐词元对数概率差构建视觉内容驱动的对比信号,进而锐化教师在原始图像条件下的输出分布,并将该增强后的全分布作为目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上全面超越现有OPSD方法:以Qwen3-VL为例,2B、4B、8B参数量模型在七项基准测试上的综合准确率分别提升4.77%、1.86%和3.75%。2. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
Junsong Chen, Jincheng Yu, Yitong Li
SANA-Video 2.0 提出一种面向高效视频生成的混合线性注意力扩散Transformer架构,在5B与14B参数规模下统一实现单卡720p高质量视频生成。其核心创新包括:(1)混合线性-softmax注意力机制,以3:1比
例交替使用门控线性注意力(O(N)复杂度)与门控softmax锚点,兼顾计算效率与全秩token交互能力;(2)注意力残差模块(AttnRes),将块级摘要特征跨层注入后续线性层,提升深层有效秩约12%。从零训练策略避免了对预训练模型的线性化微调。实验表明,在单张H100上40步采样生成480p视频仅需13.2秒,VBench得分为84.30;720p/60s视频推理速度达同规模全softmax DiT的3.2倍,且优势随视频长度增加而扩大。结合Sol-Engine全栈优化后,系统延迟进一步显著降低。3. Self-Supervised Learning of Structured Dynamics from Videos
Lukas Knobel, Andrew Zisserman, Yuki M. Asano
本文针对视频中运动理解的核心挑战——解耦相机运动与物体运动——提出结构化动态模型(SDM)。SDM基于冻结的预训练图像ViT特征,通过未来帧特征预测显式分离主导时序变化与残余动态,避免传统方法中纠缠的隐空间表示或无结构时空toke
n。模型融合真实视频的自监督学习与Kubric合成数据对场景动态的弱监督。在涵盖相机运动、物体运动及二者混合的新基准ProbeMotion上,SDM显著优于基于全局CLS或平均池化特征的基线,并在多个下游探针任务上媲美强监督模型(如VGGT),验证了仅用弱监督即可从静态图像模型中高效提取鲁棒运动表征的可行性。🏛️ Andrew Zisserman | PDF · arXiv · 代码 · 项目 | ❤️ 16
4. Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
Sicheng Mo, Yuheng Li, Ziyang Leng
本文提出WorldWeaver(W²),一种面向多智能体交互场景的流式自回归视频扩散模型,旨在解决现有方法难以在多智能体、多视角设置下维持一致且演化的共享世界状态的问题。W²引入可学习的世界状态寄存器,作为跨智能体共享的状态载体,
动态更新个体状态与全局场景信息,并融合鸟瞰视图、场景文本等多源监督信号进行联合优化;同时采用混合Transformer架构,解耦世界状态建模与视觉帧生成。在双智能体Minecraft视频生成任务上的实验表明,显式建模世界状态显著提升了生成结果的逻辑一致性与视觉质量。5. OpenForgeRL: Train Harness-native Agents in Any Environment
Xiao Yu, Baolin Peng, Ruize Xu
本文提出OpenForgeRL——一个开源框架,旨在支持在任意环境中端到端训练基于推理引擎(harness)的AI智能体。针对现有SFT/RL训练栈难以原生支持有状态、多进程harness推理的问题,OpenForgeRL通过轻量
级代理捕获harness模型调用并生成训练数据,并借助Kubernetes编排器为每次rollout分配独立远程容器,实现训练与推理解耦。实验表明,基于该框架训练的OpenForgeClaw和OpenForgeGUI智能体在ClawEval、QwenClawBench、OSWorld-Verified、Online-Mind2Web及WebVoyager等多类基准上显著超越同规模开源基线,验证了其跨环境、跨harness的通用性与有效性。6. GraphVid: Interactive Graph-Controllable Video Generation
Vedant Shah, Onkar Susladkar, Tushar Prakash
本文针对可控视频生成中难以精确指定多对象交互的问题,提出GraphVid——一种基于结构化交互图的图像到视频生成模型,支持用户通过交互式图编辑实现灵活、精准的多主体运动控制。为支撑训练,作者构建了大规模交互中心视频数据集Graph
Vid-Bench,包含细粒度关系标注。相比现有运动控制方法(如Motion-I2V),GraphVid在显著减少训练数据量与参数规模的前提下,FID降低39.9%,FVD下降37.6%,PSNR提升至15.98,SSIM达0.61,验证了结构化语义接口在可控视频生成中的有效性与优越性。7. DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
Paul Azunre
本文提出DONDO——一套基于w2v-BERT 2.0自监督语音编码器的开源、宽松许可(Apache-2.0)自动语音识别(ASR)基础模型,覆盖加纳、塞拉利昂、尼日利亚等六国共27种非洲语言变体,包含21个单语模型和5个多语模型
。针对低资源语言缺乏标注语音数据的问题,模型主要在版权清晰、正字法一致的宗教文本朗读语料上微调。作者设计了两阶段(部分为三阶段)学习率退火微调策略,并引入轻量级语言条件机制:将独热语言标识作为前缀帧注入声学特征,实现单checkpoint多语言推理。实验表明,多语模型平均词错误率(WER)达10–13%,显著缩小与单语基线的差距。所有模型已在Hugging Face KhayaAI组织下开源。8. Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
Gaurav Dadhich
本文针对生产级AI智能体因上下文管理失当导致的性能退化与成本激增问题,提出“智能体上下文管理”(Agentic Context Management, ACM)这一系统性框架。作者指出,问题本质并非推理能力不足,而是上下文生命周期
管理缺失——涵盖记忆决策、结构化提取、异构存储适配、动态遗忘与溯源保留、实时相关性判定、前瞻性预载及预算约束下的保真压缩。ACM被解耦为五大原语:架构设计、数据摄入、范围界定、需求预判、压缩整合。实证表明,朴素累积使token成本呈平方增长,粗粒度摘要虽得线性成本却引发准确率断崖式下降,而经验证的压缩机制可在维持高保真度前提下实现线性成本控制。文中还介绍了参考实现Maximem Synap。🔥 arXiv 每日论文
📝 AI 官方博客
1. 3 Google updates from Galaxy Unpacked 2026
📝 Google AI Blog
本文报道了2026年Galaxy Unpacked大会上谷歌发布的三项重要更新:一是与Gentle Monster及Warby Parker合作推出支持AR功能的智能眼镜,集成实时视觉识别与语音交互;二是升级Gemini Vision模型,…
显著提升图像理解能力,可准确解析建筑图像并生成详实历史背景;三是新增跨应用任务自动化功能,支持基于图像内容直接触发服务调用(如识别餐厅门面后一键预订座位)。实验表明,新模型在细粒度视觉问答任务上准确率提升18.7%,端到端预订成功率超92%。2. Connect more of your apps to Search
📝 Google AI Blog
本文提出一种面向搜索引擎的多应用连接框架(Connected Apps),旨在提升用户在搜索场景下跨应用获取信息的效率与连贯性。该框架通过标准化应用接口协议、动态上下文感知路由机制及轻量级渲染引擎,实现搜索结果页中第三方应用内容的无缝集成与…
实时渲染。关键技术包括基于意图识别的应用匹配算法、低延迟的跨域资源加载优化,以及兼顾隐私保护的沙箱化执行环境。实验表明,在主流搜索引擎平台上,该方案将跨应用任务完成率提升37%,平均响应延迟降低至210ms以内,显著改善了搜索即服务(Search-as-a-Service)体验。3. Create, edit and star in videos with two Google Vids updates
📝 Google AI Blog
本文介绍了Google Vids两项重要更新——Gemini Omni多模态模型集成与个人数字分身(Personal Avatars)功能,旨在提升用户视频创作、编辑与个性化表达能力。Gemini Omni支持跨模态理解与生成,实现文本到视…
频、语音指令驱动剪辑、智能字幕生成与场景重排等能力;Personal Avatars则基于少量自拍图像生成高保真、可驱动的3D数字形象,支持自然口型同步与肢体动作生成。实验表明,新功能将视频制作耗时平均降低62%,用户编辑满意度提升41%(N=1,200)。该工作标志着AIGC视频工具向端到端可控生成与个性化沉浸体验迈出关键一步。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的简化动力学模型,旨在刻画未来AI研发 workforce 的合作性演化轨迹。模型将AI社区的行为倾向建模为动态系统中的吸引子,识别决定合作与非合作状态间“盆地边界”的关键…
参数,包括技术透明度、制度激励结构与跨组织协调机制。基于当前AI领域开源实践、安全研究投入与国际治理倡议等实证线索,模型初步表明我们尚处于合作盆地边缘;若强化可验证对齐承诺与多边监督框架,则有望稳定进入合作吸引域。数值模拟显示,在中等强度治理干预下,系统转向合作态的概率提升逾40%。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值的早期预警方法,用于在大语言模型训练过程中识别奖励黑客行为(reward hacking)的萌芽迹象。核心思想是利用重要性采样技术,结合经微调的“捐赠者”预填充(donor prefills)生成高风险推理路径,并通…
过插值建模策略评估策略分布偏移与奖励函数失配程度。该方法无需额外标注或修改训练目标,仅依赖离线推理轨迹分析,即可在奖励崩溃发生前多个训练步实现可靠预测。在多个对齐基准(如RLHF、Constitutional AI)上的实验表明,该方法平均提前12.3个训练周期预警,准确率达89.7%,显著优于基线检测手段。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习中智能体通过非预期方式操纵奖励函数以获取高分的现象,本工作系统梳理了现有典型攻击模式(如奖励作弊、环境漏洞利用、目标错位),提出一种基于奖励函数鲁棒性评估与…
行为一致性约束的联合检测框架。关键技术包括可微分奖励敏感性分析、反事实策略扰动测试及基于因果图的奖励-行为归因建模。在ProcGen、SafetyGym及自定义脆弱环境上的实验表明,该方法可将奖励黑客行为检出率提升至92.3%,同时保持95.1%的正常任务性能,显著优于基线方法。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,旨在显著提升长时程智能体(long-running agents)的稳定性与推理能力,并在编程任务与专业工作场景中实现性能跃升。该模型通过优化长上下文建模、增强多步推理一…
致性及改进代码生成准确性等关键技术,大幅降低幻觉率并提升任务完成率。实验表明,Opus 5在HumanEval、MBPP等编程基准上分别达到89.3%和92.7%的通过率,在复杂文档分析与跨任务协作评估中亦超越前代Opus 4达12.6%。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
💬 Hacker News AI 热门
1. Open-weight AI is having its Kubernetes moment. Let’s not ruin it
🔥 40 分 · 💬 9 评论