AI 每日资讯 — 2026-08-31

AI 每日资讯 — 2026-08-31 🔥 HuggingFace 每日论文 1. UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Tianjie Ju, Zheng Wu, Yueqing Sun 本文针对多模态大语言模型(MLLM)在真实城市环境中从局部感知到持续空间决策的转化能力不足问题,提出UrbanGround——首个基于全港三维地理空间数据构建的、物理约束完备的城市级仿真沙盒。该平台支持第一人称视角闭环交互与交互式地图导航,使代理能在高保真香港城市场景中进行具身探索。通过三个递进研究问题,系统评估代理在场景定位、长距隐式导航及动态路径适应中的表现。实验表明,现有MLLM代理虽具备基础视觉识别与短程空间推理能力,但在方向判别、行人感知运动及长时程目标导向行为上仍不可靠,其核心缺陷在于局部能力难以有效组合,导致探索过程中误差累积且缺乏自校正机制。 PDF · arXiv · 代码 · 项目 | ❤️ 81 2. TTPO: Test-Time Policy Optimization Aozhe Wang, Zhengxi Lu, Jianze Wang 本文提出测试时策略优化(TTPO),解决大语言模型在无监督测试时训练(TTT)中因依赖多数投票伪标签而导致的脆弱性问题。TTPO构建非对称学习目标:对与伪标签一致的推理路径采用在线策略自蒸馏(OPSD)进行知识提炼,对不一致路径则通过分组强化学习(Grouped RL)施加惩罚;并引入词元级选择机制,分别对已收敛位置降权蒸馏、对高置信度错误强化惩罚。实验表明,TTPO在零标签条件下性能媲美有监督OPSD,在五个竞赛级数学推理基准上显著提升Qwen3-1.7B的TTT准确率(38.0%→45.2%),无需思维链即获+25.2%~+36.4%增益,且具备优异跨任务泛化能力。 PDF · arXiv · 代码 · 项目 | ❤️ 72 3. WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng...

八月 31, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-08-30

AI 每日资讯 — 2026-08-30 🔥 HuggingFace 每日论文 1. UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Tianjie Ju, Zheng Wu, Yueqing Sun 本文针对多模态大语言模型(MLLM)在真实尺度城市环境中实现持续空间代理能力的局限性,提出UrbanGround——首个基于全港三维地理空间数据构建的物理约束型城市沙盒平台。该平台支持第一人称视角闭环交互与交互式地图导航,使代理可直接在高保真3D城市中探索。通过三个递进研究问题,系统评估代理从局部场景理解、远距离目标导航到动态路径适应的能力。实验表明,当前MLLM代理虽具备基础视觉识别与短程空间推理能力,但在方向定位、行人感知运动及长程任务一致性方面表现脆弱;其核心缺陷在于局部能力难以组合为鲁棒的持续目标导向行为,且错误随探索进程累积而缺乏有效修正机制。 PDF · arXiv · 代码 · 项目 | ❤️ 72 2. TTPO: Test-Time Policy Optimization Aozhe Wang, Zhengxi Lu, Jianze Wang 本文提出测试时策略优化(TTPO),旨在解决大语言模型在数学推理任务中无监督测试时训练(TTT)的难题。针对现有方法依赖真实标签或易受多数投票伪标签错误影响的问题,TTPO构建了一种非对称优化目标:对与伪标签一致的推理路径采用在线策略自蒸馏(OPSD)进行知识提炼,对不一致路径则通过分组强化学习(Grouped RL)施加惩罚;并引入词元级选择机制,分别对已收敛位置降权蒸馏、对高置信度错误加强RL惩罚。实验表明,TTPO在无需任何标注的情况下,在五个竞赛级基准上媲美有监督OPSD,将Qwen3-1.7B的TTT性能从38.0%提升至45.2%,零思维链推理下提升25.2%–36.4%,且具备优异的跨任务泛化能力。 PDF · arXiv · 代码 · 项目 | ❤️ 69 3. WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng...

八月 30, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-08-28

八月 28, 2026 · 0 分钟 · Pan

AI 每日资讯 — 2026-08-27

AI 每日资讯 — 2026-08-27 🔥 HuggingFace 每日论文 1. Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses Zhaochen Yu, Yingcheng Wu, Zhenfei Yin 本文针对长时程任务中递归式自我提升(RSI)难以实现的问题,提出Recuris架构——一种递归演化的经验-工作记忆机制。其核心在于解耦工作记忆(追踪任务进展、指导技能调用)与经验记忆(存储历史技能知识),使技能选择聚焦于当前需求而非冗长历史;执行过程由此转化为结构化证据,支持故障定位与局部更新。通过元代理驱动的验证门控更新机制,形成有界递归记忆演化闭环。在四大长时程基准、十种模型上的实验表明,Recuris在35/37模型-任务对中显著提升成功率,推动GPT-5.6 Sol、Claude Opus 5等前沿模型达到SOTA水平,并在最长任务上实现+32.2点增益,典型长时程失败率降低达80%。 PDF · arXiv · 代码 · 项目 | ❤️ 19 2. From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms Jiangning Zhang, Haojun Chen, Yong Liu 本文首次系统性地将智能眼镜视为“第一人称智能平台”,提出统一框架以整合感知、状态建模、交互与行动闭环。作者 formalize 了第一人称数据流与受限任务效用,从八个可验证硬件维度刻画设备能力,围绕七大基础能力组织文献,并构建L0–L5层级化能力框架(涵盖采集、反应式感知、情境辅助、持久状态、受控执行与具身耦合)。基于九类典型应用场景,论文关联任务、数据集、系统实现、产品进展、利益相关方、失效后果及证据缺口,并提出九维部署框架,为构建可持续、可校正、可治理的端到端第一人称智能系统提供理论基础与实践指南。 PDF · arXiv · 代码 · 项目 | ❤️ 8 3. LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti...

八月 27, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-08-26

AI 每日资讯 — 2026-08-26 🔥 HuggingFace 每日论文 1. Apodex 1.1: Scaling Agentic Intelligence for Complex Work Apodex Team, B. An, B. Li 本文提出Apodex 1.1,旨在提升大语言模型在复杂现实任务中的“工作能力”——即面向真实目标的可持续、可验证进展。该系统沿环境扩展与智能体协同两个维度进行规模化:前者增强文件操作、搜索与代码执行环境的多样性与可验证性;后者通过任务分解、并行委派、异步结果整合与动态重规划提升长周期任务处理能力。依托统一执行框架AgentOS,系统实现跨工具与智能体的状态维护与行为溯源,并通过轨迹监督训练保障可靠性。实验表明,Apodex 1.1在专业工作、金融、科研、数学、编程与搜索等多领域达到前沿性能,且35B参数的Mini版本仍具备强本地部署工作能力,为构建面向长期复杂任务的“重型求解器”提供了坚实基础。 PDF · arXiv · 代码 · 项目 | ❤️ 165 2. Prime Agent: A Self-Improving RLM Harness Seth Karten, Alex L. Zhang, Kevin Thomas Prime Agent 是一种面向长周期智能体任务的开源框架,旨在突破语言模型固有上下文与权重限制,通过外部计算与信息交互提升其真实能力边界。其核心包含持久化 IPython REPL(支持递归语言模型抽象)、持续化记忆管理(Continual Harness)及递归子智能体协同机制,并提供可视化的人机交互界面(Agents View)。该框架标准化了执行、恢复、验证与资源计量流程,将策略生成权完全交予模型。实验表明,Prime Agent 将 ARC-AGI-3 RHAE 最佳准确率从 30% 显著提升至 95.5%,并在长上下文编程、GPU 核函数生成、仿真器构建及 nanoGPT 自主速通等任务中全面超越主流基线;在 Factorio 游戏中亦展现出持续技术演进与并行化任务处理能力。 PDF · arXiv · 代码 · 项目 | ❤️ 31...

八月 26, 2026 · 4 分钟 · Pan