AI 每日资讯 — 2026-08-20

AI 每日资讯 — 2026-08-20 🔥 HuggingFace 每日论文 1. EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing Jiayi Song, Shijie Huang, Fangtai Wu 本文针对超高清图像编辑中扩散模型受限于二次注意力复杂度与显存瓶颈、难以直接处理1K以上分辨率的问题,提出EditBridge框架。该方法摒弃传统从噪声重建范式,将编辑建模为低分辨率编辑结果到原始高分辨率图像的结构化数据翻译过程,并显式以原始HR图像为条件以保持细节真实性。为高效引入HR先验,设计了先验引导的分块稀疏注意力机制,利用首阶段语义对应关系约束跨图像交互于空间对齐区域。实验表明,EditBridge在4K分辨率下实现高保真编辑,2K分辨率下提速3.6–8.4倍,4K编辑仅需61秒,显著优于现有两阶段方法。 PDF · arXiv · 代码 · 项目 | ❤️ 20 2. From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation Xingjian Wang, Zhao Wang, Taihang Hu 本文提出一种以生成能力为中心的数据设计范式,旨在解决大规模图像生成中多任务数据孤岛与能力依赖关系建模缺失的问题。作者构建了耦合能力特异性监督构建与能力对齐课程调度的数据基础设施,包含三大协同数据引擎,分别支持文本-图像对齐、图像间变换与图像-知识关联,并通过caption专家实现跨任务、跨粒度的监督对齐。该框架采用多阶段能力演进课程,联合优化任务组合、视觉概念分布、数据质量与图像分辨率,并以能力感知评估闭环指导检索、专家构造与缺陷感知重采样。实验基于440M文本-图像、120M编辑对及27M图像-实体样本训练3B/6B参数扩散模型,在CPI-Bench及多样化T2I与编辑任务上显著优于基线。 PDF · arXiv | ❤️ 9 3. StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows Liya Zhu, Xin Ma, Tao Liu...

八月 20, 2026 · 5 分钟 · Pan

AI 每日资讯 — 2026-08-14

八月 14, 2026 · 0 分钟 · Pan

AI 每日资讯 — 2026-08-13

AI 每日资讯 — 2026-08-13 🔥 HuggingFace 每日论文 1. ComBodied Agents: a New Paradigm of Human-Centric Agentic AI Qianggang Ding, Xingyao Wang, Rui Feng 本文提出“ComBodied Agents”这一以人为中心的具身智能体新范式,旨在弥合现有数字代理与具身代理在建模人类动态状态与能动性方面的结构性鸿沟。该框架以个体人类状态轨迹为建模核心,整合软件工具、传感器、可穿戴设备、机器人及人工服务作为多元行动通道;通过事件驱动的多模态感知、可修正的长时记忆、个性化世界模型(预测不同干预下的未来状态)以及符合伦理约束(知情同意、安全性、可逆性、用户控制)的适配干预策略,构建闭环人机协同系统。实验验证表明,该范式在老年用药支持等真实场景中显著提升干预适切性与用户信任度。 PDF · arXiv | ❤️ 152 2. AdvFD: Boosting Visual Generation via Adversarial Fr’echet Distance Loss Mingju Gao, Jingkai Zhou, Kun Gai 本文针对现有Fréchet距离损失在生成模型后训练中因依赖静态预训练特征空间而导致的“Fréchet欺骗”问题,提出对抗式Fréchet距离(AdvFD)损失。AdvFD通过引入可学习的对抗性特征映射,动态最大化真实与生成样本在适应性特征空间中的Fréchet差异,同时结合真实特征白化机制抑制特征放大、稳定极小-极大优化。实验表明,AdvFD在JiTB和pMF两类主流生成框架及不同模型规模下,均显著提升一步式后训练效果,兼顾分布对齐与视觉质量提升。 PDF · arXiv · 项目 | ❤️ 16 3. SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure Xiaofan Bai, Hongqiang Lin, Chao Liu...

八月 13, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-08-12

AI 每日资讯 — 2026-08-12 🔥 HuggingFace 每日论文 1. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning Björn Engdahl, Adrian Kosowski, Jan Chorowski 本文提出BDH-CQ模型,将上下文学习与循环隐式推理相结合:在推理阶段,输入持续更新模型的循环记忆,查询则通过高维隐空间中的迭代计算求解,无需显式生成中间推理步骤。在ARC-AGI-1基准上评估表明,150M参数版本在pass@2指标上达29.5%,单任务推理成本仅0.0007美元,显著突破既有成本-精度帕累托前沿,成为当前该基准下性价比最高的方法。进一步通过可控ARC类干预实验,系统分析了模型从示例中习得的变换规律、泛化一致性及仍具挑战性的抽象概念。 PDF · arXiv · 代码 · 项目 | ❤️ 156 2. Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA Mind Lab, Vin Bo, Asher Cai Macaron-V1 是面向开放持续学习(Open Continual Learning)的智能体模型家族,旨在实现部署后基于真实环境经验的自主迭代与多任务协同。其核心包括:(1)递归式模型-运行时协同设计框架,通过版本化模型-运行时对与外部契约(HCP)驱动自我改进;(2)混合LoRA(MoL)架构,在冻结大语言模型基座基础上动态路由任务专属LoRA适配器,支持可扩展、低干扰的持续专业化学习。实验表明,Macaron-V1-Venti(744B GLM-5.2基座)与Macaron-V1-Tall(50B Qwen3.6基座)在个人智能、GenUI及通用能力基准上显著优于前沿基线,验证了其在稳定性、适应性与协作性上的系统级优势。 🏛️ Mind Lab | PDF · arXiv | ❤️ 137 3. Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Diandian Zhang, Tingyu Song, Lin Fu...

八月 12, 2026 · 5 分钟 · Pan

AI 每日资讯 — 2026-08-11

AI 每日资讯 — 2026-08-11 🔥 HuggingFace 每日论文 1. SimWAM: A Simple World Action Model for End-to-End Autonomous Driving Zongchuang Zhao, Xin Zhou, Tianyang Xu 本文提出SimWAM——一种面向端到端自动驾驶的简易世界动作模型(WAM),旨在解决现有WAM方法在推理阶段需昂贵未来视频生成的问题。SimWAM将视频生成仅用作训练信号,通过联合流匹配协同训练预训练视频专家与轻量级动作专家,并引入隔离式注意力掩码确保动作预测不依赖未来帧,从而可在训练后移除视频分支,获得完全自包含的轨迹规划器。两专家无参数共享,仅通过统一注意力接口交互,支持模块解耦与独立扩展。进一步结合强化学习优化复合驾驶奖励,超越纯轨迹模仿。实验表明,SimWAM在NAV SIM上达91.5 PDMS,显著优于现有WAM方法且延迟更低,并实现零样本迁移至nuScenes。 PDF · arXiv · 代码 | ❤️ 22 2. Addressable Memory for Video World Models Xindi Wu, Sven Elflein, James Lucas 本文针对交互式视频世界模型中的视觉持久性问题,提出无需训练的WorldTrace内存框架。现有模型依赖KV缓存作为增长型视觉记忆,但在 rollout 超出训练时序范围后,因RoPE位置偏移超出训练分布导致注意力检索失效;且在RoPE旋转空间中直接压缩缓存会因相位混叠破坏记忆完整性。WorldTrace通过为每个摘要槽分配独立、符合训练分布的虚拟位置,保障压缩内存的可寻址性,并设计两种压缩策略:WorldTrace-Field增强时序一致性,WorldTrace-Landmark支持基于场景转换的片段式回忆。在新构建的LoopBench基准上,二者分别提升时间一致性15.5%和片段回忆准确率19.5%,显著延长视觉持久生成能力。 PDF · arXiv · 项目 | ❤️ 6 3. Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination Ruijie Hou, Yueyang Jiao, Zhao Wang...

八月 11, 2026 · 5 分钟 · Pan