每日技术进展追踪。
AI 每日资讯 — 2026-08-31
AI 每日资讯 — 2026-08-31 🔥 HuggingFace 每日论文 1. UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Tianjie Ju, Zheng Wu, Yueqing Sun 本文针对多模态大语言模型(MLLM)在真实城市环境中从局部感知到持续空间决策的转化能力不足问题,提出UrbanGround——首个基于全港三维地理空间数据构建的、物理约束完备的城市级仿真沙盒。该平台支持第一人称视角闭环交互与交互式地图导航,使代理能在高保真香港城市场景中进行具身探索。通过三个递进研究问题,系统评估代理在场景定位、长距隐式导航及动态路径适应中的表现。实验表明,现有MLLM代理虽具备基础视觉识别与短程空间推理能力,但在方向判别、行人感知运动及长时程目标导向行为上仍不可靠,其核心缺陷在于局部能力难以有效组合,导致探索过程中误差累积且缺乏自校正机制。 PDF · arXiv · 代码 · 项目 | ❤️ 81 2. TTPO: Test-Time Policy Optimization Aozhe Wang, Zhengxi Lu, Jianze Wang 本文提出测试时策略优化(TTPO),解决大语言模型在无监督测试时训练(TTT)中因依赖多数投票伪标签而导致的脆弱性问题。TTPO构建非对称学习目标:对与伪标签一致的推理路径采用在线策略自蒸馏(OPSD)进行知识提炼,对不一致路径则通过分组强化学习(Grouped RL)施加惩罚;并引入词元级选择机制,分别对已收敛位置降权蒸馏、对高置信度错误强化惩罚。实验表明,TTPO在零标签条件下性能媲美有监督OPSD,在五个竞赛级数学推理基准上显著提升Qwen3-1.7B的TTT准确率(38.0%→45.2%),无需思维链即获+25.2%~+36.4%增益,且具备优异跨任务泛化能力。 PDF · arXiv · 代码 · 项目 | ❤️ 72 3. WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng...