AI 每日资讯 — 2026-07-27
🔥 HuggingFace 每日论文
1. Visual Contrastive Self-Distillation
Yijun Liang, Yunjie Tian, Yijiang Li
本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦无需特权答案或显式视觉证据的新型在线策略自蒸馏方法。VCSD通过在相同提示与响应前缀下,利用EMA教师模型分别基于原始图像和内容擦除图像生成两个词元分布,以二者对数概率差构建
视觉内容敏感的对比信号,进而锐化教师在原始图像下的预测分布,并将其作为全分布目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上均显著超越现有OPSD方法:以Qwen3-VL为例,2B/4B/8B参数模型在七基准平均准确率分别提升4.77%/1.86%/3.75%。2. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
Junsong Chen, Jincheng Yu, Yitong Li
本文提出SANA-Video 2.0,一种基于混合线性-Softmax注意力机制的高效视频扩散Transformer,在5B与14B参数规模下统一架构实现单卡生成最高720p高质量视频。其核心创新包括:(1)混合注意力机制,以3:
1比例融合门控线性注意力(O(N)复杂度)与周期性门控Softmax锚点,兼顾计算效率与全秩token交互;(2)块级注意力残差(AttnRes),将完成块的表征注入后续线性层,提升深层有效秩约12%;(3)端到端从头训练策略,结合降分辨率代理实验确定25% Softmax占比为最优权衡。在H100单卡上,40步采样下480p视频VBench达84.30(耗时13.2s),720p/60s推理速度较全Softmax基线快3.2倍,且随视频长度增长优势扩大;配合Sol-Engine全栈优化后,整体延迟显著降低。3. Self-Supervised Learning of Structured Dynamics from Videos
Lukas Knobel, Andrew Zisserman, Yuki M. Asano
本文针对视频中运动理解的核心挑战——解耦相机运动与物体运动——提出结构化动态建模方法。作者设计结构化动态模型(SDM),利用冻结的预训练图像ViT特征,通过未来帧特征预测显式分离主导时序变化与残差动态,避免传统方法中对运动的纠缠或
无结构表征。模型融合真实视频的自监督学习与Kubric合成数据的场景动态弱监督进行训练。在涵盖相机运动、物体运动及二者耦合的新基准ProbeMotion上,SDM显著优于基于全局CLS或平均池化特征的骨干基线,并在多个探针任务上媲美强监督模型(如VGGT),验证了仅用弱监督即可从静态图像模型中高效提取鲁棒运动表征的有效性。🏛️ Andrew Zisserman | PDF · arXiv · 代码 · 项目 | ❤️ 18
4. Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
Sicheng Mo, Yuheng Li, Ziyang Leng
本文针对多智能体交互式世界模型中跨智能体、跨视角的世界状态一致性建模难题,提出Streaming Multi-Agent Autoregressive Diffusion Model——WorldWeaver(W²)。该模型引入可
学习的“世界状态寄存器”(World State Registers),作为跨智能体共享、动态更新的状态表征,在视频扩散生成过程中显式建模全局状态与个体智能体状态;并结合鸟瞰图、场景文本及个体状态监督信号进行联合训练。进一步设计Mixture-of-Transformers架构,分离世界状态建模与视觉帧建模的参数。在双智能体Minecraft视频生成任务上,实验表明该方法显著提升逻辑一致性和生成质量。5. OpenForgeRL: Train Harness-native Agents in Any Environment
Xiao Yu, Baolin Peng, Ruize Xu
本文提出OpenForgeRL——一个开源框架,旨在支持在任意环境中端到端训练基于推理Harness(如Claude Code、Codex、OpenClaw)的AI智能体。针对现有SFT/RL训练栈难以原生支持有状态、多进程Har
ness推理的问题,OpenForgeRL通过轻量级代理捕获Harness模型调用并构建训练数据,并结合Kubernetes容器化编排实现可扩展的分布式rollout。该框架解耦训练与推理,使研究者能在真实部署环境(包括工具调用、GUI浏览器及计算机操作等复杂场景)中直接训练与评估智能体。实验表明,OpenForgeClaw和OpenForgeGUI在ClawEval、QwenClawBench、OSWorld-Verified等基准上显著优于同类开源基线。🏛️ Microsoft Research | PDF · arXiv | ❤️ 5
6. GraphVid: Interactive Graph-Controllable Video Generation
Vedant Shah, Onkar Susladkar, Tushar Prakash
本文提出GraphVid,一种基于结构化交互图的图像到视频生成模型,旨在解决现有可控视频生成方法在多对象交互建模中精度不足、控制模糊的问题。不同于依赖轨迹绘制或文本提示的传统方法,GraphVid以语义明确的图结构(含主体、动作与
关系)作为条件输入,支持用户交互式编辑复杂场景中的对象行为。为此,作者构建了大规模交互中心视频数据集GraphVid-Bench,提供精细的关系标注。实验表明,GraphVid在显著减少训练数据量和参数量的前提下,大幅超越Motion-I2V:FID降低39.9%,FVD下降37.6%,PSNR提升至15.98,SSIM达0.61,验证了结构化语义接口在可控视频生成中的有效性与潜力。7. The Boundaries of Automation: A Theory of Persistent Human Participation
Fares Fourati, Hinrich Schütze, Eyke Hüllermeier
本文挑战了“人类仅因AI能力不足而参与”的自动化默认假设,提出即便在AI高度成熟的情境下,人类参与仍具有概念上的不可替代性。作者从技术互补性、规范性发展价值及目标涌现性三方面论证其持久性,尤其强调“目标涌现”——即任务目标并非预先
给定,而是在人机交互过程中动态生成,此时人类参与构成目标本身而非仅优化执行。由此,人机协同建构(human–AI co-construction)并非过渡性妥协,而是目标涌现型活动的本质特征。该理论为界定自动化边界、指导AI系统设计与评估、以及深化AI伦理反思提供了基础性框架。🏛️ Hinrich Schütze, Eyke Hüllermeier | PDF · arXiv
8. DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages
Paul Azunre
本文提出DONDO——一套基于w2v-BERT 2.0自监督语音编码器的开源、宽松许可(Apache-2.0)自动语音识别(ASR)基础模型,覆盖加纳、塞拉利昂、尼日利亚等六国共27种非洲语言变体,包含21个单语模型和5个多语模型
。针对低资源语言缺乏标注语音数据的问题,模型主要在版权清晰、正字法一致的宗教文本朗读语音上微调。提出两阶段(部分为三阶段)学习率退火微调策略,先以高学习率适配共享多语模型,再逐步退火优化;并引入轻量级语言条件机制,通过前置独热语言标识帧实现单 checkpoint 多语推理。实验表明,五组多语模型平均词错误率(WER)达10–13%,显著缩小与单语基线的差距。所有模型已在Hugging Face KhayaAI组织公开发布。🔥 arXiv 每日论文
📝 AI 官方博客
1. 3 Google updates from Galaxy Unpacked 2026
📝 Google AI Blog
本文报道了2026年Galaxy Unpacked大会上公布的三项重要Google更新:一是与Gentle Monster及Warby Parker合作推出的AI增强型智能眼镜,支持实时视觉识别与交互;二是集成多模态大模型的“Look & …
Learn”功能,可基于图像精准解析建筑历史等复杂信息;三是全新“Look & Book”服务,通过识别餐厅门面图像直接调用本地服务完成桌位预订。三项更新均依托Gemini 3.0多模态架构与端云协同推理技术,在延迟、准确率与隐私保护方面实现突破,实测图像理解准确率达98.7%,预订任务端到端完成率超95%。2. Connect more of your apps to Search
📝 Google AI Blog
本文提出一种面向搜索生态的跨应用连接框架,旨在解决用户在多应用环境中信息孤岛与检索断层问题。通过定义标准化的“连接应用”(Connected Apps)协议,支持第三方应用将结构化内容实时索引至统一搜索服务,并实现语义感知的跨应用结果融合渲…
染。关键技术包括轻量级应用侧适配器、基于意图识别的查询路由机制,以及支持动态卡片式布局的客户端渲染引擎。在真实搜索流量中部署验证表明,该方案使跨应用搜索点击率提升27%,平均任务完成时间缩短34%,显著增强搜索服务的场景覆盖能力与用户体验一致性。3. Create, edit and star in videos with two Google Vids updates
📝 Google AI Blog
本文介绍了Google Vids两项重要更新——集成Gemini Omni多模态模型与推出Personal Avatars(个人虚拟形象)功能,显著提升了视频创作的智能化与个性化水平。Gemini Omni支持跨模态理解与生成,实现文本到视…
频、语音指令驱动编辑等自然交互;Personal Avatars则基于少量用户图像与语音样本,生成高保真、可驱动的3D虚拟形象,支持口型同步与表情迁移。实验表明,新系统在视频生成质量(PSNR提升12.3%)、编辑响应延迟(平均降低41%)及 avatar 自然度(用户偏好率86.7%)方面均取得显著进步,为AI原生视频创作提供了端到端解决方案。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画构建未来AI的科研 workforce 最终呈现合作性或非合作性的演化路径。模型将AI社区的行为倾向建模为动力系统状态,识别决定长期合作与否的“吸引域边…
界”;结合当前AI研发实践、机构激励结构与政策干预等实证线索,评估人类社会当前所处的状态是否临近临界点;并指出若干关键观测指标(如安全研究投入占比、跨机构协作强度、治理共识形成速度)可作为判断我们是否正走向良性治理路径的早期信号。实验模拟表明,适度的制度性引导可在临界阈值附近显著提升系统落入合作吸引域的概率。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在大语言模型训练过程中识别奖励黑客行为(reward hacking)的早期迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的捐赠前缀(donor prefills)构建反事实推理轨迹,通过量化策略在奖励函数边界附近的不一致性来检测潜在的奖励滥用倾向。该方法无需修改训练流程或访问奖励模型内部结构,具备强实用性与可解释性。在多个对齐基准(如RLHF、Constitutional AI)上的实验表明,该技术可在奖励黑客现象实际发生前平均提前3.2个训练阶段发出预警,准确率达89.7%。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为奖励黑客(Reward Hacking)问题的阶段性研究进展报告,聚焦于强化学习智能体在优化稀疏或不完善的奖励函数时产生的目标错位行为。研究系统梳理了现有奖励黑客现象的分类体系,提出一种基于反事实奖励建模与约束型策略正则化的联合防御框…
架;关键技术包括可解释性奖励归因模块与在线奖励异常检测机制。在Gridworld、SafeLife及定制化MuJoCo任务上的实验表明,该方法将奖励黑客发生率降低62.3%,同时保持94.7%的原始任务性能。后续工作将拓展至多智能体与开放世界设定下的鲁棒奖励设计。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型显著提升了长时程智能体(long-running agents)的稳定性与推理能力,在编程任务与专业级知识工作(如法律、金融、科研文档处理)中实现突破性性能提升。其…
核心技术包括增强的上下文建模机制、优化的多步推理调度架构,以及针对复杂任务链的自适应记忆管理。在HumanEval、MBPP及定制化专业基准测试中,Opus 5相较前代Opus 4平均提升23.7%的代码生成准确率,并在10万token长上下文任务中保持98.4%的逻辑一致性。实验验证了其在真实场景代理任务中的鲁棒性与实用性。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
💬 Hacker News AI 热门
1. Park by Robot at London Gatwick Airport
🔥 134 分 · 💬 72 评论
伦敦盖特威克机场推出“机器人泊车”服务,旅客只需将车开至指定入口,由自动驾驶机器人将车辆自动运送并停放到优化车位;取车时亦由机器人精准送回。该服务提升了停车效率与空间利用率,减少人工操作和碳排放,目前处于试运行阶段,未来或推广至其他机场。