AI 每日资讯 — 2026-06-25

六月 25, 2026 · 0 分钟 · Pan

AI 每日资讯 — 2026-06-24

AI 每日资讯 — 2026-06-24 🔥 HuggingFace 每日论文 1. EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions Jincheng Zhong, Weizhi Wang, Che Jiang 本文提出EnterpriseClawBench——首个基于真实企业工作场景构建的智能体基准测试集,涵盖852个可复现任务,每个任务均配备恢复的运行环境、重写提示、角色与技能分类、硬性规则及语义评估标准。由于数据涉及企业敏感内容,作者未公开原始数据,而是开源了完整的构建与评估协议。实验表明,当前最优配置(Codex + GPT-5.5)仅达0.663得分,凸显单一指标评估的局限性;企业智能体评测需综合考察模型-执行环境组合、业务成果交付质量、视觉呈现效果、推理成本、响应时长及跨技能迁移能力。 PDF · arXiv · 代码 · 项目 | ❤️ 56 2. Self-Compacting Language Model Agents Tianjian Li, Jingyu Zhang, William Jurayj 本文针对长程智能体轨迹中因思维链与工具调用累积导致的上下文冗余及超出窗口限制问题,提出SelfCompact自压缩框架。该框架在推理时引入可调用的压缩工具与轻量级触发判据,使模型自主判断压缩时机(如子任务完成或轨迹收敛)与抑制条件(如推导中途或卡顿),无需微调或外部监督。在六项数学与代理搜索基准、七种开源模型上的实验表明,SelfCompact在显著降低30–70%每题token开销的前提下,性能持平或超越固定间隔压缩方法,在数学任务上较无压缩基线最高提升18.1分,搜索任务提升5–9分,揭示了大模型在自我元认知层面的关键局限。 PDF · arXiv | ❤️ 10 3. Causal Discovery in the Era of Agents Yujia Zheng, Vishal Verma, Mantej Gill 本文针对当前大语言模型(LLMs)与因果发现结合中存在的核心问题——混淆数据驱动证据与文本关联、提示偏差及幻觉机制——提出一种新型代理角色定位:代理应辅助而非替代因果推理。作者主张代理仅承担数据检查、上下文检索、假设阐释与结果解读等支持性任务,而因果边、方向、先验、约束及结论必须严格源于数据、显式假设、形式化算法、诊断评估及领域专家判断。基于该原则,作者构建了causal-learn+在线平台,集成数据预处理、方法推荐、专家知识融合、形式化因果发现与可解释性分析。在“大五人格”数据的案例研究中,该平台实现了可靠、透明、人机协同的因果发现流程,有效规避了LLM不可靠性对因果推断的污染。 PDF · arXiv · 代码 · 项目 | ❤️ 6...

六月 24, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-06-23

AI 每日资讯 — 2026-06-23 🔥 HuggingFace 每日论文 1. JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang 本文提出JanusMesh,一种无需训练、快速生成文本驱动3D视觉幻象的新框架。针对现有方法在几何一致性、语义隔离与生成效率上的不足,该方法采用两阶段策略:首先通过跨空间双分支去噪机制,在体素空间中协同实现CLIP引导的方向对齐与符号距离场(SDF)融合,保障几何无缝性;其次引入视角条件化纹理合成模块,将多视角2D扩散先验投影并聚合至融合几何表面。实验表明,JanusMesh可在3–5分钟内生成高保真、双语义一致的3D幻象,在几何完整性、语义可识别性与运行效率上显著优于现有方法。 PDF · arXiv · 代码 · 项目 | ❤️ 19 2. Current World Models Lack a Persistent State Core Jinpeng Lu, Dexu Zhu, Haoyuan Shi 本文指出当前世界模型缺乏持久化的内部状态核心,难以在无观测条件下持续演化物理世界状态。作者提出WRBench——首个系统性诊断基准,将相机运动视为可观测性的干预,并从交互执行、场景连续性与目标一致性三方面评估模型的世界状态演化能力。实验涵盖23种模型、9600段视频及四种控制范式,结果一致表明:现有模型仅维持“跟踪镜头”式表观连贯性,当目标短暂离开视野后返回时,其状态未随未观测时段推进,而是直接恢复至消失时刻的状态。该缺陷跨架构、跨规模普遍存在,表明鲁棒的世界状态演化无法仅通过模型扩容或训练优化自然获得。 PDF · arXiv | ❤️ 12 3. The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation Nicolas Dufour, Alexei A....

六月 23, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-06-22

AI 每日资讯 — 2026-06-22 🔥 HuggingFace 每日论文 1. JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang 本文提出JanusMesh,一种无需训练、快速生成文本驱动3D视觉幻觉(即单个网格从不同视角呈现截然不同语义)的框架。方法分为两阶段:首先通过跨空间双分支去噪机制,将3D潜在表示动态解码至体素空间,联合CLIP引导的方向对齐与符号距离场(SDF)融合,保障几何无缝一致性;其次引入视角条件纹理合成模块,将视角特异的2D扩散先验投影并聚合到融合几何上。实验表明,该方法仅需3–5分钟即可生成高保真、双语义3D幻觉,在几何完整性、语义可识别性与运行效率上显著优于现有方法。 PDF · arXiv · 代码 · 项目 | ❤️ 19 2. Current World Models Lack a Persistent State Core Jinpeng Lu, Dexu Zhu, Haoyuan Shi 本文指出当前世界模型缺乏持久化的内部状态核心,难以在未被观测时持续演化物理世界状态。作者提出WRBench——首个系统性诊断基准,将相机运动视为可观测性的干预,通过人类校准的三阶段评估链(交互执行、场景连续性、返回目标一致性)检验模型是否具备真正的世界状态演化能力。在涵盖23种模型、9600段视频的广泛实验中发现:无论控制范式、模型架构或参数规模如何,现有模型均表现为“跟踪镜头”式行为,即在目标离开视野后不推进事件演化,返回时仍恢复至离场时刻的状态。该缺陷揭示了世界模型向通用人工智能迈进的关键瓶颈。 PDF · arXiv | ❤️ 10 3. LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents Md Nayem Uddin, Amir Saeidi, Eduardo Blanco...

六月 22, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-06-21

AI 每日资讯 — 2026-06-21 🔥 HuggingFace 每日论文 1. Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages Maria Ivanova, Pavel Zadorozhny, Rodion Levichev 本文提出Multi-LCB,一个面向12种编程语言的扩展型代码生成基准,旨在突破原LiveCodeBench(LCB)仅支持Python的局限。Multi-LCB通过语义等价转换将LCB中的Python题目映射至其他语言,严格继承其污染控制机制与评估协议,并保持格式兼容性以自动同步未来LCB更新。在24个主流大语言模型上的实验表明,模型普遍存在Python过拟合、语言特异性污染及跨语言性能显著不均衡等问题。结果验证了Multi-LCB作为多语言代码能力评估新基准的严谨性与必要性,揭示了当前LLM在真实软件工程场景中泛化能力的关键短板。 PDF · arXiv · 代码 · 项目 | ❤️ 36 2. JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang 本文提出JanusMesh,一种无需训练、快速生成文本驱动3D视觉幻象(即单个网格从不同视角呈现截然不同语义)的零样本方法。针对现有优化方法速度慢、色彩过饱和及拼接法几何不连贯等问题,该框架采用两阶段策略:首先通过跨空间双分支去噪机制,在体素空间中联合实现CLIP引导的姿态对齐与符号距离场(SDF)融合,保障几何无缝性;其次引入视角条件化纹理合成模块,将2D扩散先验投影并聚合至融合几何表面。实验表明,本方法仅需3–5分钟即可生成高保真、双语义一致的3D幻象,在几何完整性、语义可识别性与生成效率上均显著优于现有方法。 PDF · arXiv · 代码 · 项目 | ❤️ 18 3. Current World Models Lack a Persistent State Core Jinpeng Lu, Dexu Zhu, Haoyuan Shi...

六月 21, 2026 · 3 分钟 · Pan