AI 每日资讯 — 2026-08-25

AI 每日资讯 — 2026-08-25 🔥 HuggingFace 每日论文 1. Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence Yuyuan Feng, Zhishang Xiang, Chaobin Yang 本文针对大语言模型(LLM)从单智能体向复杂任务系统演进过程中面临的结构性瓶颈,提出“系统智能”(System Intelligence)概念,即多智能体协同完成目标所需的组织化、自适应整体能力。作者指出,个体智能在异构专长整合、子任务依赖管理、并行执行与独立验证等方面存在根本性局限,亟需超越单体优化的范式。为此,论文正式提出“图工程”(Graph Engineering)——一种以显式、动态、可演化图结构建模任务流、智能体角色与系统状态的新范式。实验表明,基于图工程构建的代理系统在多步骤推理、工具协同与长期任务保持等场景中,相较传统提示/上下文工程方法提升显著,验证了其作为下一代智能体系统基础设施的可行性与有效性。 PDF · arXiv · 代码 | ❤️ 29 2. OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs Xianyun Sun, Chaoyou Fu, Zhengye Zhang OmniAssistBench 是首个面向全模态大语言模型(Omni-LLMs)助手式交互能力的评测基准,旨在评估模型在实时视频环境中结合视觉感知、用户目标与先验知识进行主动引导的能力。针对交互路径发散与真实交互视频稀缺两大挑战,该基准通过逆向工程互联网视频构建多轮交互片段,并引入源视频导出的预定义先验路径以统一评估标准。数据集构建耗时超1000专家人时。实验表明,闭源模型 Gemini-3-Pro 得分为66.4/100,开源模型 Qwen3-Omni-Instruct 为51.2/100;当前模型虽能理解用户输入,但在处理手势等视觉提示及维持长程交互一致性方面仍存在显著缺陷。 PDF · arXiv · 代码 · 项目 | ❤️ 25 3. Llama-Mobile: Efficient 2....

八月 25, 2026 · 5 分钟 · Pan

AI 每日资讯 — 2026-08-24

八月 24, 2026 · 0 分钟 · Pan

AI 每日资讯 — 2026-08-23

八月 23, 2026 · 0 分钟 · Pan

AI 每日资讯 — 2026-08-22

AI 每日资讯 — 2026-08-22 🔥 HuggingFace 每日论文 1. 4DAnyone: Create Anyone in 4D from a Casual Monocular Video Yudong Jin, Tao Xie, Qihang Zhang 本文提出4DAnyone,一种从任意单目视频重建高保真4D人体的端到端框架。针对现有视频扩散模型在生成数十路目标视角时难以维持多视角一致性的关键瓶颈,作者将其归因为“有界注意力上下文”问题,并创新性地设计参考上下文压缩(RCP)与目标上下文路由(TCR)机制:RCP以O(1)复杂度将多参考视图编码为混合分辨率固定长度上下文,TCR通过噪声步长自适应的分组轮转策略实现跨组信息共享与细节稳定。基于自建MVGameHuman数据集及多源真实数据联合训练,实验表明4DAnyone在DNA-Rendering与DyMVHumans基准上显著优于现有方法,实现了高质量、几何一致的4D高斯溅射重建。 PDF · arXiv · 代码 · 项目 | ❤️ 47 2. WithEveryone: Unified Planning and Identity Grounding for Group Image Generation Hengyuan Xu, Qixun Wang, Yiji Cheng 本文针对多人场景下身份保持图像生成不可靠的问题,提出统一框架WithEveryone,支持最多十人身份的群体图像生成。该方法将各身份作为地址化token注入,并预测结构化的身份-布局规划,再将其渲染为视觉条件;核心创新包括基于标注人脸区域监督身份匹配的Layout-Grounded ID Loss,以及ID Representation Forcing机制,在合成前显式预测每个身份表征。在身份互斥基准测试中,WithEveryone将目标-上下文身份相似度从GPT-Image-2的0.462提升至0.499,复制粘贴伪影显著降低(0.169→0.055),身份覆盖率达97.3%,重复率仅2.8%,验证了显式身份-布局联合建模对大规模群体生成的有效性。 PDF · arXiv · 代码 · 项目 | ❤️ 34 3. MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use Mengru Wang, Haozhe Luo, Zhenqian Xu...

八月 22, 2026 · 5 分钟 · Pan

AI 每日资讯 — 2026-08-21

AI 每日资讯 — 2026-08-21 🔥 HuggingFace 每日论文 1. SPADE: Self-Play in Adaptive Synthetic Executable Environments Bo Liu, Simon Yu, Yiding Jiang SPADE提出了一种面向语言智能体的自演进强化学习框架,通过单一大语言模型(LLM)在自我博弈中同时扮演环境设计者与推理代理双重角色:前者生成可执行、长视野、带状态转移与验证逻辑的合成训练环境(类OpenAI Gym接口),后者在其中学习多步推理与工具调用。环境设计者基于大规模预训练语料进行知识 grounding,并维护累积环境记忆,其目标是动态生成位于代理能力边界的可行任务;推理代理的 regret 信号由有/无特权提示下的奖励差估计,驱动环境持续适配。在8个数学、科学、代码与通用推理基准上,30B参数规模的SPADE相较最强固定环境基线平均提升+5.3分,并显著增强工具使用能力。 PDF · arXiv · 代码 · 项目 | ❤️ 38 2. Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev 本文针对单步逆合成预测中固有的“一对多”特性难以被传统单答案评估范式有效刻画的问题,提出Top-K提示训练与推理新范式,以提升模型对多样化、化学合理反应路径的建模能力。基于约4560万条经验证反应数据(CREED-CCV-2+USPTO-XL),构建化学约束一致语言模型C3LM,并融合ChemCensor化学合理性判别器与新颖性奖励进行强化微调。在OOD URSA-expert-2026基准上达到SOTA性能;反应唯一性分析表明,LLM与传统模型覆盖互补的反应空间,支持构建集成式逆合成系统。该工作确立了化学合理性感知、Top-K驱动的训练范式作为下一代LLM合成规划的重要方向。 PDF · arXiv | ❤️ 29 3. Institutional Books - Enriched Text: A customizable multilingual open-source pipeline for denoising, deduplicating, and annotating OCR text at scale David Lowry-Duda, Matteo Cargnelutti, Catherine Brobston...

八月 21, 2026 · 4 分钟 · Pan