每日技术进展追踪。
AI 每日资讯 — 2026-08-10
AI 每日资讯 — 2026-08-10 🔥 HuggingFace 每日论文 1. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Varun Ursekar, Apaar Shanker, Yash Maurya 本文提出HarnessOpt-Bench,首个面向端到端harness优化的基准测试,旨在评估大语言模型(LLM)在受限预算下自主改进AI系统外围组件(如提示、工具、控制流与记忆机制)的能力。该基准采用可信执行环境,严格约束评估资源消耗,通过归一化增益衡量优化效果。实验涵盖5个前沿LLM作为优化器,在4类下游任务、111次运行中对比其在统一编码harness与原生harness下的表现。结果表明:模型自身能力差异显著大于harness差异影响;原生harness并不始终优于统一harness;优化增益存在显著任务依赖性。 PDF · arXiv | ❤️ 33 2. DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation Junfeng Li, Junjie He, Zhide Zhong 本文针对跨机器人本体(cross-embodiment)视觉-语言-动作(VLA)策略泛化难的问题,提出DyPES-VLA框架。该方法通过未来场景预测目标,在多本体数据上联合训练视觉语言模型,学习共享的动力学先验(如物体运动、接触与交互引发的场景变化);同时设计本体特异的混合专家(MoE)动作头,直接在各本体原生动作空间中解码控制指令,避免人工动作对齐。实验表明,DyPES-VLA在仿真与真实世界多本体操纵任务中均达到最优性能,平均成功率98.0%。 PDF · arXiv · 项目 | ❤️ 22 3. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks Fanzhe Meng, Guoxin Chen, Jiale Zhao...