AI 每日资讯 — 2026-07-26
AI 每日资讯 — 2026-07-26 🔥 HuggingFace 每日论文 1. Visual Contrastive Self-Distillation Yijun Liang, Yunjie Tian, Yijiang Li 本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦不依赖特权答案或显式视觉掩蔽的新型在线策略自蒸馏方法。VCSD通过指数移动平均(EMA)教师模型在相同提示与响应前缀下,分别基于原始图像和内容擦除图像生成两个词元分布,利用其逐词元对数概率差构建视觉内容驱动的对比信号,进而锐化教师在原始图像条件下的输出分布,并将该增强后的全分布作为目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上全面超越现有OPSD方法:以Qwen3-VL为例,2B、4B、8B参数量模型在七项基准测试上的综合准确率分别提升4.77%、1.86%和3.75%。 PDF · arXiv · 代码 · 项目 | ❤️ 41 2. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Junsong Chen, Jincheng Yu, Yitong Li SANA-Video 2.0 提出一种面向高效视频生成的混合线性注意力扩散Transformer架构,在5B与14B参数规模下统一实现单卡720p高质量视频生成。其核心创新包括:(1)混合线性-softmax注意力机制,以3:1比例交替使用门控线性注意力(O(N)复杂度)与门控softmax锚点,兼顾计算效率与全秩token交互能力;(2)注意力残差模块(AttnRes),将块级摘要特征跨层注入后续线性层,提升深层有效秩约12%。从零训练策略避免了对预训练模型的线性化微调。实验表明,在单张H100上40步采样生成480p视频仅需13.2秒,VBench得分为84.30;720p/60s视频推理速度达同规模全softmax DiT的3.2倍,且优势随视频长度增加而扩大。结合Sol-Engine全栈优化后,系统延迟进一步显著降低。 PDF · arXiv · 项目 | ❤️ 18 3. Self-Supervised Learning of Structured Dynamics from Videos Lukas Knobel, Andrew Zisserman, Yuki M....