AI 每日资讯 — 2026-07-25
AI 每日资讯 — 2026-07-25 🔥 HuggingFace 每日论文 1. Visual Contrastive Self-Distillation Yijun Liang, Yunjie Tian, Yijiang Li 本文提出视觉对比自蒸馏(VCSD),一种无需外部教师、亦不依赖特权答案或显式视觉证据的新型在线策略自蒸馏方法。VCSD通过在学生生成的响应前缀下,令EMA教师模型分别基于原始图像与内容擦除图像输出两个下一词分布,利用其逐词对数概率差构建视觉内容敏感的对比信号,进而锐化教师在原始图像条件下的预测分布,并将该增强后的全分布作为目标蒸馏至学生模型。在ViRL39K数据集上,VCSD在Qwen3-VL与Qwen3.5系列模型上全面超越现有OPSD方法:以Qwen3-VL为例,2B、4B、8B参数量模型在七项基准上的平均准确率分别提升4.77%、1.86%和3.75%。 PDF · arXiv · 代码 · 项目 | ❤️ 39 2. Self-Supervised Learning of Structured Dynamics from Videos Lukas Knobel, Andrew Zisserman, Yuki M. Asano 本文针对视频中运动理解的核心挑战——解耦相机运动与物体运动——提出结构化动态建模方法。作者设计结构化动态模型(SDM),利用冻结的预训练视觉Transformer特征,通过未来帧特征预测显式分离主导时序变化与残差动态,避免传统方法中运动表征的纠缠或无结构建模。模型结合真实视频的自监督学习与合成Kubric数据对场景动态的弱监督。在涵盖相机运动、物体运动及二者混合的新基准ProbeMotion上,SDM显著优于基于全局CLS或平均池化特征的基线,并在多项运动探针任务上媲美强监督模型(如VGGT),验证了仅用弱监督即可从图像模型中高效提取鲁棒运动表征的可行性。 🏛️ Andrew Zisserman | PDF · arXiv · 代码 · 项目 | ❤️ 12 3. SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Junsong Chen, Jincheng Yu, Yitong Li...