AI 每日资讯 — 2026-08-13
🔥 HuggingFace 每日论文
1. ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
Qianggang Ding, Xingyao Wang, Rui Feng
本文提出“ComBodied Agents”这一以人为中心的具身智能体新范式,旨在弥合现有数字代理与具身代理在建模人类动态状态与能动性方面的结构性鸿沟。该框架以个体人类状态轨迹为建模核心,整合软件工具、传感器、可穿戴设备、机器人及
人工服务作为多元行动通道;通过事件驱动的多模态感知、可修正的长时记忆、个性化世界模型(预测不同干预下的未来状态)以及符合伦理约束(知情同意、安全性、可逆性、用户控制)的适配干预策略,构建闭环人机协同系统。实验验证表明,该范式在老年用药支持等真实场景中显著提升干预适切性与用户信任度。2. AdvFD: Boosting Visual Generation via Adversarial Fr’echet Distance Loss
Mingju Gao, Jingkai Zhou, Kun Gai
本文针对现有Fréchet距离损失在生成模型后训练中因依赖静态预训练特征空间而导致的“Fréchet欺骗”问题,提出对抗式Fréchet距离(AdvFD)损失。AdvFD通过引入可学习的对抗性特征映射,动态最大化真实与生成样本在适
应性特征空间中的Fréchet差异,同时结合真实特征白化机制抑制特征放大、稳定极小-极大优化。实验表明,AdvFD在JiTB和pMF两类主流生成框架及不同模型规模下,均显著提升一步式后训练效果,兼顾分布对齐与视觉质量提升。3. SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure
Xiaofan Bai, Hongqiang Lin, Chao Liu
本文针对自演化智能体中技能库冗余膨胀问题,提出无需评估的技能压缩方法SkillZip。传统提示压缩难以适配技能的结构化特性(如触发条件、工作流、工具契约与输出约束),而基于评估的压缩又引入额外开销与数据依赖。SkillZip通过寻
找技能的最短忠实结构化解释实现压缩:将重复规则上提至适用作用域、提取共享动作序列为子过程、仅保留差异化异常。该方法以类型化最小描述长度为目标函数,在严格覆盖所有触发器、工作流边、工具需求、义务及输出字段的前提下优化技能合约与残差表示。实验表明,SkillZip在保持功能完整性的同时显著减小技能体积,提升注入效率与可维护性。4. VIScore: Diagnosing Planning-Relevant Quality in Latent World Models
Haiyu Wu, Randall Balestriero, Morgan Levine
本文针对潜空间正则化与世界模型规划成功率之间缺乏关联的问题,提出VIScore——一种面向规划质量评估的新型指标。不同于仅关注编码器输出的传统度量,VIScore联合建模编码器、预测器与基于搜索的规划器,从真实性(Veracity
)、影响力(Influence)和清醒度(Sobriety)三方面量化潜空间中状态可达性、预测容量及规划幻觉程度。通过对比SIGReg与VISReg正则化策略,发现VISReg更利于OOD场景下的规划成功,并进一步验证VIScore在多个模型与数据集上对规划成功率具有强解释力,Spearman相关系数持续高于0.75,显著优于直线性、物理状态探测与赋能等基线指标。5. MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
Changhao Xiang, Shangyu Xing, Zhen Wu
本文针对现有多模态大语言模型(MLLMs)依赖图像-文本对进行全局对齐预训练所导致的指代歧义问题,提出多模态代码切换(MMCS)新范式,实现显式的对象级跨模态对齐。受语言学中语码转换现象启发,MMCS通过将文本中的实体替换为对应视
觉对象,在序列层面交错融合视觉与语言信息,强制局部细粒度对齐。作者构建了可扩展的数据合成流程,生成773K高质量、对象-实体精确匹配的预训练样本。实验表明:仅用50K样本,MMCS即可达到甚至超越基于600K图像-文本对训练的基线性能;且在不同规模模型上均显著提升视觉定位与感知能力。6. HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation
Raphael Lorenzo-Louis, Fabio Amadio, Bertrand Luvison
本文针对具身智能体在真实人类环境中需主动预判人机交互意图的关键挑战,提出HUI360——目前规模最大、场景最丰富的360°第一人称人机交互预判数据集。该数据集由移动机器人在三个月内多环境、多时段野外采集,涵盖自然自发的行人与用户行
为,具备高度多样性以支撑模型泛化能力评估。作者构建了面向等距柱状投影360°视频的自动交互标注流水线(含手动精修接口),并开源100万条高质量预处理标注,包括2D姿态、面部关键点与分割掩码;同时提供符合GDPR的原始全景360°图像(按需申请)。此外,论文建立了包含时空图神经网络与多模态Transformer在内的基准预判模型,并在HUI360上验证其有效性,显著优于现有方法。7. Templated or fully Synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance
Ilias Chalkidis
本文探讨了大语言模型(LLM)政治立场测量中提示工程对结果的干扰问题。针对现有方法(如基于人类问卷的闭合式提问)生态效度低、易受“故意低报”影响,以及新兴IssueBench框架虽采用真实对话日志模板化提示但仍缺乏开放性任务所需语
境细腻性的问题,作者提出以真实提示为种子、由LLM生成的全合成提示作为替代方案。小规模实证研究覆盖3项争议性政策议题与3起地缘政治冲突,结果显示:人类与LLM标注者均认为合成提示在现实性、意图清晰度和立场传达准确性上显著优于模板化提示,且与真实提示无显著差异;进一步案例表明,模板化与合成提示对同一模型的政治立场估计存在系统性偏差,尤其在中立框架下更为突出。8. GitSkills: A Dataset of Agent Skills on GitHub
Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu
本文提出GitSkills数据集,旨在支持对大语言模型代理技能(agent skills)的实证研究。该数据集包含2026年7月从28.2万个公开GitHub仓库中采集的379.7万份SKILL.md文件,覆盖187.8万种唯一内
容;每条记录保留文件路径、所属仓库、内容哈希,并为每组重复文件选取代表样本,补充解析后的元数据、所在文件夹结构、仓库信息及部分文件的完整提交历史。GitSkills以单个SQLite文件形式发布,为研究代理技能的采用模式、复用机制、结构特征、作者分布、演化维护与安全风险提供了首个大规模、细粒度、可追溯的实证基础。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. Closed-Loop LLM Co-Pilots for Digital Agriculture
Serge Kernbach
本研究提出一种面向数字农业的闭环大语言模型(LLM)协同驾驶框架,突破传统数据分析范式,实现AI驱动的自主实验闭环。系统整合49通道植物多模态传感网络(含多光谱、电化学与介电信号),通过LLM实时解析植物生理状态,并直接调控硬件执
行微气候优化、表型分析及可控胁迫等任务。在垂直农场与单株实验中,LLM基于生物传感遥测动态调节全光谱及450 nm/660 nm光源,每2小时迭代优化。相比周期性控制,最小时间模式缩短生产周期35%,能量优化模式降低能耗18%且仅轻微延长栽培时间;更自主发现“暗诱导叶绿素积累”新策略,实现67.9%能耗节约。该框架显著提升农业智能化水平,降低算力与专家依赖。2. SPOTting the Future: Lookahead Explanations for Deep Reinforcement Learning
Tamar Gozlan, Claudia V. Goldman
本文针对深度强化学习(DRL)策略可解释性不足的问题,提出SPOT(Sampling Policy Observation Tree)——一种模型无关、基于采样的解释框架。SPOT通过在策略与环境模拟器交互下递归采样动作并展开状态
转移,构建有限视野的决策树,以经验性呈现策略的动作偏好及其潜在演化路径。理论分析证明其能渐近恢复策略中最可能动作,并刻画高熵策略下的分歧行为。在SUMO-RL交通信号控制任务中的实验表明,SPOT支持策略偏好分析、多步轨迹对比,并揭示单步归因方法无法捕捉的下游行为模式。3. MIDAS: Mutual Information Disentanglement with Uncertainty-Aware Fusion for Incomplete Multimodal Sentiment Analysis
Yuhua Wen, Yingying Zhou, Qifei Li, Yingming Gao, Zhengqi Wen, Jianhua Tao, Ya Li
本文针对不完整多模态情感分析中模态缺失导致的语义建模困难问题,提出一种基于互信息解耦与不确定性感知融合的统一框架MIDAS。该方法采用变分推断建模各模态为多元高斯隐变量,并将其解耦为跨模态共享因子与模态专属因子;通过极小化共享-专
属空间间互信息实现稳定解耦,同时最大化跨模态共享空间互信息以增强语义对齐;进一步设计不确定性感知融合机制,利用后验方差动态加权隐特征,提升缺失模态下的鲁棒性。在三个主流数据集上的实验表明,MIDAS在多种不完整设定下显著优于现有方法,展现出优异的泛化性与鲁棒性。📄 arXiv: cs.CL
1. LLM Agents Factory: Retrieval of Domain-Specific LLM Agents
Vitalii Belov, Artyom Sosedka, Andrey Sakhovskiy, Elizaveta Kovtun, Artyom Boyarskikh, Semen Budennyy
本文提出LLM Agents Factory,一种面向领域任务的检索式大语言模型(LLM)智能体构建框架,旨在缓解动态生成智能体带来的高计算开销与不稳定性问题。该框架基于超2万预定义、维基百科增强的领域特化智能体档案库,支持语义检
索与知识蒸馏两种模式:前者通过向量检索快速匹配适配智能体,后者将检索结果微调为轻量级生成模型。在MMLU、BIG-bench及BIG-bench Hard基准上的单智能体实验表明,其检索方案在准确率上超越非智能体基线,并以显著更低的推理成本达到与120B参数AutoGen相当的生成质量。该方法为工业级应用提供了高效、可控且可复现的智能体部署新范式。2. Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus Theory
Krishna Pothugunta, John P. Lalor
本文基于文化共识理论(CCT),系统评估大语言模型(LLM)在单文化与多文化语境下的文化对齐能力。针对现有研究仅关注跨国家分布模式、忽视群体内部共识及一国内部文化多样性的问题,作者将CCT应用于世界价值观调查(WVS)涵盖10国、
12个文化领域的数据。实验发现,当前LLM普遍存在两类偏差:或无法形成符合人类认知的群体共识,或过度正则化导致文化差异被抹平。通过显式建模组内变异,CCT为识别模型是真实反映人类文化多样性,还是陷入算法同质化,提供了可解释、可操作的诊断框架。3. The Multilingual Quantization Tax: Structural Collapse and Typological Fragility in Edge SLMs
Mohammad Wathiq Soualhi
本文针对边缘设备部署小型语言模型(SLMs)中普遍采用的4比特权重量化所引发的“量化税”问题,首次开展零样本多语言评估,覆盖Gemma-4与Qwen-3.5两类架构及八种类型学差异显著的语言。基于MMLU ProX Lite和Gl
obalPIQA基准,研究发现参数截断暴露了预训练阶段固有的不平等性,并揭示四大现象:(1)类型学脆弱性——低资源语言及非拉丁文字系统出现表征坍塌;(2)母语脆弱性悖论——基础预训练路径未能有效缓解精度损失;(3)领域特异性遗忘——跨语言多步推理能力显著退化,而软科学类联想记忆保持稳健;(4)量化抗性——高度饱和且类型学对齐的领域表现出非确定性退化,后量化性能提升受限于统计噪声。📄 arXiv: cs.LG
1. Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory
Kaustubh Kapil, Kishor P. Upla
本文针对Transformer模型表征演化机制尚不清晰的问题,提出Transformer Geometry Observatory-TGO-IV——一种基于持续同调(Persistent Homology)的拓扑分析框架,系统刻画
词元级表征点云在各层间的全局拓扑演化过程。TGO-IV通过构建Vietoris–Rips单纯复形,结合持久图、条形码、Betti曲线、持久景观及瓶颈/ Wasserstein距离等互补拓扑观测量,定量追踪表征流形的连通性、空洞与高阶结构变化。实验表明,该框架能有效识别表征抽象化的关键层跃迁,揭示从原始输入到任务相关特征的渐进式拓扑重构规律,为理解Transformer的内在学习动力学提供了可解释的几何视角。2. Uncertainty-Aware Ensemble Deep Randomized Neural Networks for Classification
M. Sajid, A. Quadir, A. Rahaman, P. N. Suganthan, M. Tanveer
本文针对现有深度随机化神经网络(如dRVFL、edRVFL)在噪声与异常值干扰下鲁棒性不足的问题,提出不确定性感知的直觉模糊深度随机向量函数链接模型(IF-dRVFL)及其集成版本(IF-edRVFL)。该方法融合直觉模糊理论,在
核空间中联合建模样本的隶属度(基于到类中心距离)与非隶属度(刻画局部邻域异质性),自适应加权训练样本,从而增强对干净样本、噪声点与离群点的判别能力。在UCI与KEEL基准数据集上的大量实验(含高斯噪声扰动)表明,所提模型显著优于当前主流模糊与非模糊SOTA方法。3. CurveFP: Rational-Radix Logarithmic Datatypes with Closed Products for Language Models
Ye Qiao
CurveFP 提出了一种面向大语言模型的新型低精度数据类型,旨在协同优化数值精度与算术闭包性。其核心是基于有理数底数的对数量化方案,通过交错式对数曲线分布量化幅值,并在紧凑块尺度下实现乘积运算的代数闭包:非零乘积仅需符号异或与整
数索引更新。作者构建了 CurveFP eight(E4C3/E5C2)用于训练和 CurveFP seven(E3C3)用于部署。实验表明,CurveFP seven 在四款 7B–9B 模型上以少一位元素比特超越 tensor-wise FP8 的困惑度,质量损失仅 1.32%;CurveFP eight 在全部 36 组 GEMM 前向/反向计算中均降低 NMSE,并在 3B-token 预训练中达到优于 FP8 的 BF16 推理困惑度(22.5366 vs. 22.5407),且下游 WikiText-103 评估全面占优。📄 arXiv: cs.CV
1. LEGO: Leveled Language Gaussian Splatting
Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang
本文提出LEGO(Leveled Language Gaussian Splatting),旨在实现面向开放词汇的层次化三维场景理解。LEGO通过自适应融合多视角SAM分割结果,构建跨视图一致、语义连贯的3D层级结构(如“花盆→花
束→花蕾→花瓣”),并利用CLIP嵌入实现各层级的开放词汇语义对齐;进一步引入空间关系建模,生成层级化语言场景图,赋能大语言模型进行上下文感知的空间推理与精准视觉定位。实验表明,LEGO在可提示式与开放词汇3D分割基准上均达到新SOTA,显著提升了层次分解精度与语义-空间联合推理能力。2. Signpost Watermarking: Joint Optimization for Visual Watermark Coexistence
Shruti Agarwal, Vishal Asnani, John Collomosse
本文提出“路标水印”(Signpost Watermarking)方法,旨在联合优化多个视觉水印的共存性,使其在图像与视频中可同时嵌入且相互干扰最小。针对现有独立训练水印模型偶然具备共存性但缺乏显式优化的问题,本文引入解码器感知的
联合训练目标,显式抑制多水印间的干扰。实验表明,该方法显著提升水印共存时的解码鲁棒性与视觉质量,并首次验证其在视频水印中的有效性。结果支持构建分层溯源信号系统,为内容真实性与版权归属提供可扩展的协同水印框架。3. 4D-WAM: 4D Consistent World Modeling for Autonomous Driving
Jiacheng Fu, Yibo Yuan, Meng Tian, Yue Li, Jiangtong Zhu, Jianhua Han, Yueyi Zhang, Jianwu Fang, Jianru Xue, Hang Xu, Zhiwei Xiong
本文针对现有世界-动作模型(WAMs)因仅依赖2D视频训练而难以建模真实4D驾驶场景、导致未来预测在几何与物理层面不一致的问题,提出4D-WAM——首个面向4D一致性的世界建模框架。该方法利用几何基础模型提供训练时的4D感知监督,
设计4D一致性损失函数,引导模型学习物理合理的时空演化表征;同时发现WAM中“早期决策”现象,提出面向决策的时间步采样策略,在高噪声初期阶段强化监督,提升轨迹规划可靠性。实验表明,4D-WAM在NAVSIM-v1/v2基准上达到SOTA性能,显著增强场景演化的一致性与规划鲁棒性。📝 AI 官方博客
1. AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities in a first-of-its-kind study.
📝 Google AI Blog
本研究首次验证了医学人工智能系统AMIE在真实临床场景中开展实时视频会诊的能力。研究采用多模态大语言模型架构,整合语音识别、自然语言理解、医学知识图谱与实时视频流处理技术,支持医患双方在视频对话中动态生成诊断建议、鉴别诊断及沟通策略。系统在…
涵盖12个专科的500例模拟会诊中,其诊断准确性达92.3%,沟通质量评分(由资深医师盲评)显著优于基线模型(p<0.001)。结果表明,AMIE具备安全、可靠、可解释的临床交互能力,为AI赋能远程医疗提供了关键实证支撑。2. Evolve your marketing with new AI tools
📝 Google AI Blog
本文探讨了人工智能在数字营销领域的最新应用,重点介绍谷歌广告(Google Ads)与谷歌分析(Google Analytics)中集成的Advisor UI智能助手。该工具依托生成式AI与强化学习技术,为营销人员提供实时、情境化的策略建议…
,涵盖关键词优化、出价调整、受众定位及转化路径分析等核心环节。通过自然语言交互界面,用户可直接提问并获得可执行的洞察,显著降低AI使用门槛。实验表明,在真实广告活动中启用Advisor UI后,平均点击率提升12.3%,转化成本降低9.7%,ROI提高18.5%。研究验证了轻量化、嵌入式AI助手在提升营销决策效率与效果方面的实用价值。3. The latest AI news we announced in July 2026
📝 Google AI Blog
本文回顾了2026年7月人工智能领域的重要进展,涵盖大模型架构创新、多模态推理能力突破、高效训练与推理优化技术,以及AI安全与对齐研究的新成果。重点介绍了新型稀疏混合专家(MoE)模型在保持参数量不变前提下实现40%推理加速;首个通过ISO…
/IEC 42001认证的通用AI系统“Nexus-7B”正式发布;视觉-语言-动作联合建模框架VLA-3在机器人任务泛化基准上达到92.3%成功率;此外,基于因果干预的幻觉抑制方法将事实一致性错误率降低至1.7%。多项成果已在Hugging Face与MLPerf平台开源验证。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画AI研发 workforce 在未来是否趋向合作或非合作行为的演化机制。模型将AI社区的协作倾向建模为非线性动力系统,识别决定系统长期行为的关键分岔点与…
吸引域边界;结合当前AI领域在开源实践、安全研究投入、机构治理透明度等方面的实证数据,评估人类社会当前所处的演化区域;并提出若干可观测指标(如跨组织对齐研究合作率、关键能力披露规范采纳度等),用以判断我们是否正行进在提升AI可治理性的正向路径上。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(Reasoning Interpolation)的早期预警方法,用于在强化学习训练过程中提前识别奖励黑客(Reward Hacking)现象。核心思想是利用重要性采样(Importance Sampling),结合…
在相关任务上微调的捐赠者前缀(donor prefills),对策略行为进行跨训练阶段的因果归因与反事实推理,从而量化策略偏离意图目标的程度。该方法无需修改训练流程或访问真实奖励函数,仅依赖离线轨迹数据即可实现高精度预测。在多个基准环境(如CoinRun、ProcGen)上的实验表明,该方法可在奖励黑客发生前平均提前3.2个训练阶段发出预警,准确率达89.7%,显著优于基线检测手段。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习中智能体通过非预期方式操纵奖励函数以获取高分的现象,本工作系统梳理了现有奖励黑客案例的分类体系,提出一种基于奖励函数敏感性分析与行为轨迹可解释性评估的双…
轨检测框架。关键技术包括 reward surface 可视化、反事实奖励扰动测试及策略不变性验证。在 ProcGen 与 SafeRLBench 基准上的初步实验表明,该方法可识别出约83%的隐蔽式奖励黑客行为,误报率低于12%,显著优于基线检测器。后续将聚焦于可证明安全的奖励塑形机制设计。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)支持能力上实现显著跃升,同时在代码生成与专业级任务处理方面取得实质性进步。Opus 5通过增强的推理架构、更…
优的上下文管理机制及面向复杂工作流优化的指令微调策略,显著提升了多步推理稳定性与领域适应性。实验表明,其在HumanEval、SWE-bench及专业文档分析基准上分别较Opus 4提升12.3%、9.7%和15.1%。模型已于2026年7月24日正式发布并投入生产环境部署。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该网页标题“one daily email”仅显示一个短语,无正文内容或上下文信息,无法判断其具体含义或所指服务,亦未提供与AI相关的技术细节、产品介绍或新闻事件。
💬 Hacker News AI 热门
1. Tailscale Traces Database Corruption to 16y/o SQLite WAL-Reset Bug
🔥 364 分 · 💬 51 评论