AI 每日资讯 — 2026-08-10

AI 每日资讯 — 2026-08-10 🔥 HuggingFace 每日论文 1. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Varun Ursekar, Apaar Shanker, Yash Maurya 本文提出HarnessOpt-Bench,首个面向端到端harness优化的基准测试,旨在评估大语言模型(LLM)在受限预算下自主改进AI系统外围组件(如提示、工具、控制流与记忆机制)的能力。该基准采用可信执行环境,严格约束评估资源消耗,通过归一化增益衡量优化效果。实验涵盖5个前沿LLM作为优化器,在4类下游任务、111次运行中对比其在统一编码harness与原生harness下的表现。结果表明:模型自身能力差异显著大于harness差异影响;原生harness并不始终优于统一harness;优化增益存在显著任务依赖性。 PDF · arXiv | ❤️ 33 2. DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation Junfeng Li, Junjie He, Zhide Zhong 本文针对跨机器人本体(cross-embodiment)视觉-语言-动作(VLA)策略泛化难的问题,提出DyPES-VLA框架。该方法通过未来场景预测目标,在多本体数据上联合训练视觉语言模型,学习共享的动力学先验(如物体运动、接触与交互引发的场景变化);同时设计本体特异的混合专家(MoE)动作头,直接在各本体原生动作空间中解码控制指令,避免人工动作对齐。实验表明,DyPES-VLA在仿真与真实世界多本体操纵任务中均达到最优性能,平均成功率98.0%。 PDF · arXiv · 项目 | ❤️ 22 3. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks Fanzhe Meng, Guoxin Chen, Jiale Zhao...

八月 10, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-08-09

AI 每日资讯 — 2026-08-09 🔥 HuggingFace 每日论文 1. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Varun Ursekar, Apaar Shanker, Yash Maurya 本文提出HarnessOpt-Bench,首个面向端到端harness优化的基准测试,旨在评估大语言模型(LLM)在受限预算下自主改进AI agent运行环境(含提示、工具、控制流与记忆等)的能力。该基准采用黑盒、带噪声且高成本的评估机制,要求LLM作为优化器在固定评估次数内迭代改进初始harness,并以相对于种子harness在独立测试集上的归一化增益为最终得分。实验涵盖5个前沿LLM、4类下游任务及111次运行,结果表明:模型自身能力差异显著大于其所依托的编码harness差异;原生harness并不总是优于统一编码harness;不同任务间优化增益差异显著。 PDF · arXiv | ❤️ 27 2. DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation Junfeng Li, Junjie He, Zhide Zhong 本文针对跨形态机器人操纵中通用视觉-语言-动作(VLA)策略训练难的问题,提出DyPES-VLA框架。该方法通过在多形态数据上联合优化未来场景预测目标,使视觉语言模型学习可迁移的共享动力学先验(如物体运动、接触与交互引发的场景变化);同时设计形态特异的混合专家(MoE)动作头,直接在各机器人原生动作空间中解码控制指令,避免人工动作对齐。其注意力层共享以建模共性时序结构,而专家模块适配各异的运动学约束与控制语义。实验表明,DyPES-VLA在仿真与真实世界任务中均达到SOTA性能,平均成功率98.0%。 PDF · arXiv · 项目 | ❤️ 18 3. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks Fanzhe Meng, Guoxin Chen, Jiale Zhao...

八月 9, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-08-08

AI 每日资讯 — 2026-08-08 🔥 HuggingFace 每日论文 1. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Varun Ursekar, Apaar Shanker, Yash Maurya 本文提出HarnessOpt-Bench,首个面向端到端harness优化的基准测试,旨在评估大语言模型(LLM)在受限预算下自主改进AI代理harness(含提示、工具、控制流与记忆等)的能力。该基准采用昂贵且随机的评估机制,要求LLM优化器基于种子harness与反馈迭代编辑,并在不可见测试集上以归一化增益衡量最终性能;可信执行环境保障评估完整性与可审计性。实验涵盖5个前沿LLM、4类下游任务、111次运行,结果表明模型能力差异显著大于其依赖的编码harness差异,原生harness未必更优,且优化增益存在显著任务依赖性。 PDF · arXiv | ❤️ 20 2. DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation Junfeng Li, Junjie He, Zhide Zhong 本文针对跨机器人本体(embodiment)的视觉-语言-动作(VLA)通用策略学习难题,提出DyPES-VLA框架。该方法通过未来场景预测目标,在多本体数据上联合训练视觉语言模型,学习可迁移的动力学先验(如物体运动、接触与交互引发的场景变化);同时设计本体特异的混合专家(MoE)动作头,直接在各本体原生动作空间中解码控制指令,避免人工动作对齐。共享注意力层建模共性时序结构,专家网络适配各异的运动学约束与控制语义。在仿真与真实机器人实验中,DyPES-VLA以98.0%的成功率达到当前最优性能。 PDF · arXiv · 项目 | ❤️ 15 3. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks Fanzhe Meng, Guoxin Chen, Jiale Zhao...

八月 8, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-08-07

AI 每日资讯 — 2026-08-07 🔥 HuggingFace 每日论文 1. ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Yijun Lu, Rui Ye, Jiajun Wang 本文针对长周期搜索智能体训练中轨迹级监督稀疏、难以区分有效与冗余动作的问题,提出答案回溯式信用分配(ABC)框架。ABC通过答案回溯线索恢复与线索锚定步骤评分,将稀疏的二元结果监督转化为密集的步骤级奖励信号,从而在失败轨迹中仍能识别并强化有用动作。基于该框架,作者设计了ABC-SFT(重加权监督微调)和ABC-GRPO(基于步骤评分的强化学习算法),仅用8.5k样本训练出ABSeeker模型(基于Qwen3.5-4B)。实验表明,ABSeeker在BrowseComp和BrowseComp-ZH上分别达到37.3%和39.1%准确率,显著优于基线方法。 PDF · arXiv | ❤️ 52 2. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Yinghui He, Ling Yang, Jiarui Liu 本文针对大语言模型(LLM)在长程推理中跨技能切换能力不足的问题,提出“技能熵”(Skill Entropy)作为衡量技能转换难度的量化指标,并构建首个面向跨技能长程任务的基准数据集Skill²-Bench,覆盖9大领域、558项可验证与开放性技能。实验表明,主流模型在高熵任务上性能显著下降,揭示了普遍存在的“技能切换鸿沟”。进一步,作者将技能熵引入训练过程,提出Skill-Entropy RL强化学习框架,使模型在生成答案的同时显式预测每步所用技能,并联合优化正确性与技能序列对齐性。在Qwen3系列模型上的实证显示,该方法显著提升长程跨技能推理性能。 PDF · arXiv · 代码 · 项目 | ❤️ 20 3. HelloWorld: Enabling Socially Interactive Characters in Video World Models Liangyang Ouyang, Ruicong Liu, Xuangeng Chu...

八月 7, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-08-06

AI 每日资讯 — 2026-08-06 🔥 HuggingFace 每日论文 1. JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion Yicheng Xiao, Wenxun Dai, Xinran Qin 本文提出JoyAI-Video-Edit,一种面向实时、开放式视频编辑的16B参数自回归扩散框架,无需访问未来帧或预设视频长度。该方法通过分块自回归适配、源锚定分布匹配蒸馏(SA-DMD)与长时序自回归蒸馏,有效缓解训练—推理失配、保障源视频保真度,并抑制时序漂移。实验表明,其在自动与人工评估中显著优于现有流式编辑器,在短/长视频上均媲美强离线系统;整套系统可在单块NVIDIA B200 GPU上实现720p分辨率、约30 FPS的端到端实时编辑。 🏛️ JD-OpenSource | PDF · arXiv · 代码 | ❤️ 73 2. Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent Zhen Fang, Yu Zeng, Wenxuan Huang 本文提出Video-DeepResearch(Video-DR),一种面向连续视频流的下一代多模态深度研究智能体,旨在解决现有模型在动态时空定位与开放网络探索中的两大瓶颈:模态偏好(过度依赖文本搜索而忽略视觉工具)和参数化知识泄露(依赖内部记忆而非真实工具调用)。为此,Video-DR设计了感知—探索解耦架构与分阶段工具解锁机制,强制模型完成跨帧密集视觉定位后方可触发网络检索;并采用监督微调与组相对策略优化(GRPO)两阶段训练范式,突破模仿学习局限。为评估,作者构建了含200个复杂多跳视频问答实例的人机协同基准Video-DR-Bench。实验表明,Video-DeepResearch-35B-A3B以64.0%平均准确率创SOTA,显著超越Claude-4.5-Sonnet(59.0%)、GPT-5(52.5%)与Gemini 2.5 Pro(57.5%);30B-A3B变体亦达59.3%,验证方法在轻量级模型上的泛化有效性。 PDF · arXiv · 项目 | ❤️ 43 3. PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents Shuhan Xue, Zixin Ding, Yichen Shen...

八月 6, 2026 · 5 分钟 · Pan