AI 每日资讯 — 2026-07-26

AI 每日资讯 — 2026-07-26 🔥 HuggingFace 每日论文 1. Visual Contrastive Self-Distillation Yijun Liang, Yunjie Tian, Yijiang Li 本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦不依赖特权答案或显式视觉掩蔽的新型在线策略自蒸馏方法。VCSD通过指数移动平均(EMA)教师模型在相同提示与响应前缀下,分别基于原始图像和内容擦除图像生成两个词元分布,利用其逐词元对数概率差构建视觉内容驱动的对比信号,进而锐化教师在原始图像条件下的输出分布,并将该增强后的全分布作为目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上全面超越现有OPSD方法:以Qwen3-VL为例,2B、4B、8B参数量模型在七项基准测试上的综合准确率分别提升4.77%、1.86%和3.75%。 PDF · arXiv · 代码 · 项目 | ❤️ 41 2. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Junsong Chen, Jincheng Yu, Yitong Li SANA-Video 2.0 提出一种面向高效视频生成的混合线性注意力扩散Transformer架构,在5B与14B参数规模下统一实现单卡720p高质量视频生成。其核心创新包括:(1)混合线性-softmax注意力机制,以3:1比例交替使用门控线性注意力(O(N)复杂度)与门控softmax锚点,兼顾计算效率与全秩token交互能力;(2)注意力残差模块(AttnRes),将块级摘要特征跨层注入后续线性层,提升深层有效秩约12%。从零训练策略避免了对预训练模型的线性化微调。实验表明,在单张H100上40步采样生成480p视频仅需13.2秒,VBench得分为84.30;720p/60s视频推理速度达同规模全softmax DiT的3.2倍,且优势随视频长度增加而扩大。结合Sol-Engine全栈优化后,系统延迟进一步显著降低。 PDF · arXiv · 项目 | ❤️ 18 3. Self-Supervised Learning of Structured Dynamics from Videos Lukas Knobel, Andrew Zisserman, Yuki M....

七月 26, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-07-25

AI 每日资讯 — 2026-07-25 🔥 HuggingFace 每日论文 1. Visual Contrastive Self-Distillation Yijun Liang, Yunjie Tian, Yijiang Li 本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦不依赖特权答案或显式视觉证据的新型在线策略自蒸馏方法。VCSD通过在学生生成的响应前缀下,令EMA教师模型分别基于原始图像与内容擦除图像输出两个下一词分布,利用其逐词对数概率差构建视觉内容敏感的对比信号,进而锐化教师在原始图像条件下的预测分布,并将该增强后的全分布作为目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上全面超越现有OPSD方法:以Qwen3-VL为例,2B、4B、8B参数量模型在七项基准上的平均准确率分别提升4.77%、1.86%和3.75%。 PDF · arXiv · 代码 · 项目 | ❤️ 39 2. Self-Supervised Learning of Structured Dynamics from Videos Lukas Knobel, Andrew Zisserman, Yuki M. Asano 本文针对视频中运动理解的核心挑战——解耦相机运动与物体运动——提出结构化动态建模方法。作者设计结构化动态模型(SDM),利用冻结的预训练视觉Transformer特征,通过未来帧特征预测显式分离主导时序变化与残差动态,避免传统方法中运动表征的纠缠或无结构建模。模型结合真实视频的自监督学习与合成Kubric数据对场景动态的弱监督。在涵盖相机运动、物体运动及二者混合的新基准ProbeMotion上,SDM显著优于基于全局CLS或平均池化特征的基线,并在多项运动探针任务上媲美强监督模型(如VGGT),验证了仅用弱监督即可从图像模型中高效提取鲁棒运动表征的可行性。 🏛️ Andrew Zisserman | PDF · arXiv · 代码 · 项目 | ❤️ 12 3. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Junsong Chen, Jincheng Yu, Yitong Li...

七月 25, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-24

AI 每日资讯 — 2026-07-24 🔥 HuggingFace 每日论文 1. SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD Dongfang Li, Xiaodong Luo, Ruoyu Sun 本文针对万亿参数MoE大模型全参数后训练在昇腾NPU超算集群(SuperPOD)上面临的内存压力大、通信与计算难以重叠、内核执行效率低等系统级挑战,提出面向DeepSeek-V4系列模型的分层优化框架,涵盖模型并行策略、计算-通信协同调度及底层算子优化。所构建的SLAI T-Rex系统实现34.22%的模型FLOPs利用率,较开源基线提升2.93倍且保障训练稳定性。在此基础上,构建面向运筹学(OR)任务的CPT与SFT流程,融合领域真实数据与求解器验证的合成优化文档,构建含10K高质量样本、覆盖四类任务与三种问题表示的专用数据集。微调后的模型在零样本Pass@1评测中达71.81%,显著超越GPT-5.4-Mini及基座模型。 PDF · arXiv · 代码 | ❤️ 43 2. Self Gradient Forcing: Native Long Video Extrapolation Junhao Zhuang, Shiyi Zhang, Yuxuan Bian 本文针对自回归视频扩散模型中历史上下文与未来帧生成之间的梯度监督缺失问题(即“历史上下文-梯度鸿沟”),提出自梯度强制(Self Gradient Forcing, SGF)方法。SGF采用两阶段训练策略:第一阶段无梯度自回归 rollout,采样记录某去噪步的自生成上下文与对应噪声隐状态;第二阶段并行重建该步上下文的键值表示,并引入未来帧损失反向监督历史记忆的写入过程。该方法在不延长反向传播链路的前提下,将未来帧预测误差有效反馈至历史隐状态的记忆编码环节。实验表明,SGF在多种初始化设置下的长时序帧级与分块级视频外推任务中显著提升生成质量与一致性。 PDF · arXiv · 代码 · 项目 | ❤️ 28 3. ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion Cho In, Jeonghwan Cho, Mijin Yoo...

七月 24, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-23

AI 每日资讯 — 2026-07-23 🔥 HuggingFace 每日论文 1. ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU Fan Jiang, Zhaoxu Sun, Mengchao Wang 本文提出ABot-World-0,一种面向实时、长时程闭环交互的动作条件化视频世界模型。该模型依托覆盖AAA游戏、仿真引擎与互联网视频的多源数据基础设施,结合WorldExplorer驱动的数据采集、14项确定性质量校验与VLM辅助标注的统一预处理流程,实现可控世界动力学学习。通过双向教师模型到因果学生模型的渐进式蒸馏(含Teacher Forcing与ODE蒸馏),并引入LongForcing机制对齐长程自 rollout 与扩展时域教师预测,有效缓解分布偏移与自回归漂移。系统支持键盘动作统一控制场景漫游与第三人称角色交互,并借助参考角色记忆保障身份一致性。部署层面协同设计流式推理栈,集成轻量VAE解码器、高效注意力、内存感知调度及低比特DiT推理,在单块NVIDIA RTX 5090 GPU上实现720P视频最高16 FPS流式生成,动作至首帧延迟仅1.2秒,峰值显存占用约19GiB。在WorldRoamBench及扩展交互评测中展现出优异的可控性与长程连贯性。 PDF · arXiv · 代码 · 项目 | ❤️ 133 2. Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers Maohua Li, Qirui Li, Yanke Zhou 本文针对文本到图像扩散Transformer(DiTs)中语义表征机制不明确的问题,提出一种基于注意力分解与定向干预的因果可解释性框架。研究发现,提示模板类token虽在编码器输出端缺乏提示特异性信息,却在去噪过程中成为图像到文本注意力的主要汇聚点,并作为隐式语义寄存器维持生成对象的身份一致性。该语义身份并非直接来自文本提示,而是通过图像潜变量间接注入模板token。受此启发,作者设计了一种无需训练的剪枝策略:移除对提示token响应最强的注意力头,可减少20%注意力计算量,仅导致GenEval得分下降1.4分。进一步分析揭示了DiT中语义路由与视觉合成在层间与头间的分工机制。 PDF · arXiv · 代码 | ❤️ 65 3. Generative World Renderer at the Speed of Play Guixu Lin, Zheng-Hui Huang, Siqi Yang...

七月 23, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-22

AI 每日资讯 — 2026-07-22 🔥 HuggingFace 每日论文 1. SWE-Pruner Pro: The Coder LLM Already Knows What to Prune Yuhang Wang, Yuling Shi, Shaoqiu Zhang 本文针对编码智能体的长上下文剪枝问题,提出SWE-Pruner Pro方法。不同于依赖外部代码分类器的现有方案(如SWE-Pruner),该方法挖掘大语言模型自身在读取工具输出时产生的内部表征,直接在代理内部完成上下文剪枝。其核心是引入轻量级预测头,结合行数感知的嵌入,将内部隐状态映射为每行代码的保留/裁剪标签。实验表明,在两个开源权重基座模型与四个多轮基准任务上,该方法最多减少39%的提示与生成token,推理开销可控,且在MiMo-V2-Flash上使SWE-Bench Verified解决率提升3.8%,Oolong长上下文准确率提高2.2个百分点。 PDF · arXiv · 代码 | ❤️ 64 2. HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement Yiyang Cai, Nan Chen, Rongchang Xie 本文针对人-物中心视频个性化(HOCVP)任务中主体保真度与人-物交互准确性难以兼顾、以及跨模态参考信息(如OCR图、多视角图像)未被有效建模两大挑战,提出HOMIE框架。该方法通过改进多模态大语言模型(MLLM)与扩散模型的协同机制,在不牺牲文本可控性的前提下,引入全局多模态引导自注意力,实现MLLM语义特征与VAE隐空间令牌的对齐;并设计模态-参考嵌入模块,显式区分并关联不同来源的令牌。实验表明,HOMIE在多种HOCVP基准上达到SOTA性能。 PDF · arXiv · 代码 · 项目 | ❤️ 46 3. FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry Dingyun Zhang, Lixue Gong, Wei Liu...

七月 22, 2026 · 4 分钟 · Pan