AI 每日资讯 — 2026-07-22
🔥 HuggingFace 每日论文
1. SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
Yuhang Wang, Yuling Shi, Shaoqiu Zhang
本文针对编码智能体的长上下文剪枝问题,提出SWE-Pruner Pro方法。不同于依赖外部代码分类器的现有方案(如SWE-Pruner),该方法挖掘大语言模型自身在读取工具输出时产生的内部表征,直接在代理内部完成上下文剪枝。其核心
是引入轻量级预测头,结合行数感知的嵌入,将内部隐状态映射为每行代码的保留/裁剪标签。实验表明,在两个开源权重基座模型与四个多轮基准任务上,该方法最多减少39%的提示与生成token,推理开销可控,且在MiMo-V2-Flash上使SWE-Bench Verified解决率提升3.8%,Oolong长上下文准确率提高2.2个百分点。2. HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
Yiyang Cai, Nan Chen, Rongchang Xie
本文针对人-物中心视频个性化(HOCVP)任务中主体保真度与人-物交互准确性难以兼顾、以及跨模态参考信息(如OCR图、多视角图像)未被有效建模两大挑战,提出HOMIE框架。该方法通过改进多模态大语言模型(MLLM)与扩散模型的协同
机制,在不牺牲文本可控性的前提下,引入全局多模态引导自注意力,实现MLLM语义特征与VAE隐空间令牌的对齐;并设计模态-参考嵌入模块,显式区分并关联不同来源的令牌。实验表明,HOMIE在多种HOCVP基准上达到SOTA性能。3. FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
Dingyun Zhang, Lixue Gong, Wei Liu
本文提出FlowMimic,一种无需掩码的视觉编辑与生成框架,旨在解决视频编辑数据构建成本高、任务多样性受限的问题。该方法通过引入像素对时间扭曲光流场,实现从图像编辑样本实时生成高质量视频编辑数据;进一步提出模态模仿生成损失与编辑
损失,使图像与视频模态在能力与输出分布上通过互模仿对齐。实验表明,仅用合成视频编辑数据训练的模型,在多种视频编辑任务上显著优于现有方法,并支持跨模态迁移与语言引导的精准区域编辑。4. Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints
Thomas MacDougall, Maksim Kuznetsov, Roman Schutski
本文探讨了大语言模型(LLMs)在结构导向药物设计(SBDD)中处理三维空间约束的能力。针对蛋白口袋条件下的配体生成任务,作者构建了涵盖锚点片段、药效团点及必需口袋-配体相互作用等多类空间约束的评估场景,并提出3D-Fit——一种
面向多条件空间分子生成的高效token基准测试策略。实验表明,尽管当前通用LLMs在物理建模与3D几何推理上仍逊于专用扩散模型,但已展现出同时整合多种异构空间约束的潜力,为LLM在SBDD中的可扩展应用提供了实证支持。5. O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
Mei Yuan, Qi Long, Qifeng Wu
本文提出O-VAD框架,面向工业视频异常检测(IVAD)任务,解决现有视觉语言模型(VLM)在复杂工业场景中因物体形变、物理约束与流程规范导致的泛化能力下降问题。该方法无需训练、不依赖领域知识,通过以对象为中心的时空跟踪与状态演化
建模,构建对象级时间轨迹,并基于轨迹进行因果推理以定位异常。实验表明,O-VAD在三个工业数据集上显著优于前沿VLM、智能体框架及微调的传统VAD方法,同时生成可解释的异常类型与过程报告。6. LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
Tianzhu Ye, Li Dong, Guanheng Chen
本文针对开放性任务中基于标量奖励的强化学习(RL)难以保留细粒度反馈、易导致奖励博弈等问题,提出“经验式学习”(Experiential Learning, EL)框架。EL将评判型大模型(LLM-as-a-Judge)重构为教练
型大模型(LLM-as-a-Coach),将其对策略响应的文本化评估提炼为可迁移的经验知识,并通过在线策略上下文蒸馏机制引导教师模型并内化至策略模型。实验表明,EL在两类策略架构及不同反馈源下,均显著优于传统基于评分标准的RL,在未见任务上泛化更强、鲁棒性更高,有效缓解奖励欺骗。该工作确立了经验知识作为非可验证任务后训练中更丰富、更具泛化能力的学习信号。🏛️ Li Dong | PDF · arXiv | ❤️ 7
7. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
Krish Agarwal, Zhuoming Chen, Yanyuan Qin
FlashRT 是一种面向实时多模态应用(如语音代理与交互式视频生成)的智能代理协同框架,旨在将开发者编写的简易参考实现自动优化为高性能、多GPU部署方案。针对现有服务系统与自动并行编译器在模型放置、流式调度和模型内并行等维度灵活
性不足的问题,FlashRT 提出“程序链”(chain-of-program)范式,引导通用编码代理分阶段完成:构建显式刻画数据依赖与状态作用域的中间表示(IR)、基于顺序解释器验证 IR 正确性、执行静态分析识别优化候选,并在测量驱动的迭代循环中实施、验证与基准测试各优化项。实验表明,FlashRT 在视频世界模型与多模态大语言模型等任务上,可实现最高达 70 倍的端到端延迟降低与 2.8 倍吞吐量提升,且适配不同硬件预算。8. jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
Christina Nasika, Feng Wang, Antonis Krasakis
本文提出jina-reranker-v3.5——一个参数量仅0.6B的高效列表式重排序模型,旨在兼顾推理效率、跨领域鲁棒性与半结构化数据处理能力。该模型继承并改进了前代的“倒数第二层交互”(LBNL)机制,引入混合注意力机制(三组
滑动窗口层+两层全局注意力),并在自蒸馏框架下分三阶段实现知识迁移:全注意力教师模型指导稀疏注意力学生模型渐进式适配。在BEIR基准上达到63.20 nDCG@10,性能媲美4B参数模型;在MIRACL、RTEB及半结构化检索任务中显著超越v3版本,nDCG@10提升达9.6点,同时推理延迟降低1.56倍。模型已开源。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. Rater State Bias in RLHF Preference Data: An Audit Framework
Elena Kopteva, Vitaliy Hlynianyi-Zhuk
本文揭示了基于人类反馈的强化学习(RLHF)中一种结构性混淆——评分员状态偏差:在持续压力或负面情绪下,评分员的偏好会随时间系统性偏移,导致偏好标签不仅反映模型输出质量,还混杂其主观心理状态。作者定义了“评分员状态偏移”“评分员状
态混淆”及“关联性评分员状态偏差”,提出以“生存水平情感真实性”作为可测响应模式,并构建可验证的审计框架。研究推导出5条可证伪假设与效应量阈值,设计适用于公开指令微调模型的审计协议与试点方案,旨在识别并量化该类结构化偏差,而非追溯具体模型训练历史。2. Design and Validation of a Lightweight 1D CNN for Affective Touch Classification in Soft Plush Companions
Aleksandrs Vali\v{s}evskis, Aleksandrs Okss, Inese T=i\c{g}ere, Aleksejs Kata\v{s}evs, Dina Bethere, Anete Hofmane, Airisa \v{S}teinberga, Und=ine Gavri\c{l}enko, Santa Me\c{l}\c{k}e, Lucie Matou\v{s}kov'a
本研究针对软质毛绒陪伴机器人中情感触觉识别的挑战,提出了一种轻量级一维卷积神经网络(1D CNN)架构及其完整开源MATLAB验证框架。基于FAIR准则构建了包含25名被试(儿童、青少年与成人)共1326段标注触觉手势序列的数据集
。通过系统性架构与超参数搜索,在468个模型中筛选出仅含13.2k参数的空洞卷积1D CNN,实现75%测试准确率与85%留一被试交叉验证准确率。理论分析表明,量化后模型单窗口推理仅需3.2 MMAC,可在目标微控制器上以20 Hz实时运行。实验验证其能有效识别启发式方法漏检的细微社交触觉,而高力度负面交互则由阈值逻辑高效捕获;由此提出“启发式预滤+CNN细粒度分类”的混合推理架构,证实情感化、隐私友好的嵌入式触觉理解具备工程可行性。3. Some Large Language Models Exhibit Consistent Risk Attitudes
Bowen Sun, Rui Min, Yuxi Wang, Brian Odegaard, Qi Wang, Jing Du
本文探究大语言模型(LLMs)在不确定性情境下是否表现出系统性、跨任务一致的风险态度。研究构建了一个解耦“风险信念”与“决策类别”的跨领域评估框架,在空间导航、临床分诊和金融配置三类高风险任务中,对6个主流LLM及100名人类参与
者进行测试。通过回归建模量化各主体从信念到决策的映射关系,提取其风险敏感度与风险态度偏差。结果表明:多数LLM展现出任务内稳定性、跨领域排序一致性,且风险态度分布显著窄于人类基线。该发现首次揭示风险态度是LLM一种稳定内在行为维度,为AI在开放域决策中的可预测性评估与价值对齐提供了新范式。📄 arXiv: cs.CL
1. Multi-level context Modeling for consistent expert selection in Mixture-of-Experts
Shuhan Huang, Naifan Zhang, Yuanbo Tang, Yang Li, Wai Kin Victor Chan
本文针对混合专家(MoE)模型中专家选择不稳定、跨层语义不一致的问题,指出现有路由器依赖浅层或孤立的token表征,导致上下文信息不完备,制约专家专业化能力。为此,提出多级上下文融合MoE(MCF-MOE),通过跨层语义聚合与局部
token交互协同建模多层次上下文,生成更具判别力与一致性的表征以指导专家选择。在语言建模与理解任务上的实验表明,MCF-MOE显著提升路由一致性与下游性能,验证了上下文完备性对专家路由的关键作用。2. RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation
Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang
本文针对小规模语言模型(SLMs)在检索增强生成(RAG)中因容量有限而对噪声检索证据高度敏感的问题,提出RIMS框架——一种基于平滑多对聚合的偏好优化方法。RIMS包含三阶段设计:(1)利用目标SLM自身通过拒绝采样生成合成思维
链偏好数据;(2)引入可微分的软聚合机制,以平滑算子替代硬选择,兼顾梯度完整性与间隔感知判别性;(3)将平滑化目标函数应用于多种对齐算法。理论分析表明该平滑近似具有可控误差界,且梯度对齐更优。在四个多跳问答基准上的实验验证了RIMS在噪声检索下显著提升Exact Match与F1,且适配多种SLM骨干网络。3. Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM
Heejin Jo
本文揭示了开源大语言模型(Qwen3-8B)在推理任务中存在“答案先承诺”现象:模型常在生成推理前已隐式锁定错误答案,再构造事后合理化解释。研究通过极简探针任务(“洗车应步行还是开车?”)发现,模型在所有测试条件下均以85–100
%频率错误承诺“步行”,且长思维链(4096 token)无法纠正。激活层面分析表明,在答案输出前的隐藏状态中,“walk”读出概率显著高于中性基线(68% vs. 17%),甚至最终回答“drive”的样本也呈现早期“walk”偏向;该效应非词汇偏差或文本复现所致。结果为LLM推理机制中的非演绎性预决策提供了初步神经证据。📄 arXiv: cs.LG
1. Reinforcement Learning-Guided NSGA-II Enhanced with Gray Relational Coefficient for Multi-Objective Optimization: Application to NASDAQ Portfolio Optimization
Zhiyuan Wang, Qinxu Ding, Ding Ding, Siying Zhu, Jing Ren, Yue Wang, Chong Hui Tan
本文针对金融投资中风险最小化与收益最大化等多目标冲突问题,提出一种融合强化学习(RL)与灰色关联分析(GRC)的改进型NSGA-II算法(RL-NSGA-II-GRC)。该方法通过RL智能体在线动态调节进化参数,并引入基于灰色关联
系数的二元锦标赛选择机制,综合支配等级、拥挤距离及理想点邻近度实现更优解导向。在Kursawe和CONSTR基准测试中,其收敛性较标准NSGA-II提升约5.8%和4.4%,Pareto前沿分布更均匀;应用于NASDAQ组合优化时,生成高密度、平滑的有效前沿,成功识别出年化夏普比率高达1.92的最优组合及不同风险厌恶水平下的效用最优解。2. DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding
本文针对文档解析任务中OCR工具选择缺乏标注数据的难题,提出无需真实标签的评估框架DocOCR-Eval。该框架通过三阶段纠错与排序策略,利用多模态大语言模型(MLLMs)间的交叉验证与结果修正,近似替代基于人工标注的性能排序。实
验在跨领域、多语言扫描文档基准上系统评估了多种OCR引擎与MLLMs,结果表明:随着参与纠错的MLLM数量增加,DocOCR-Eval的工具排序与真实标注排序的一致性显著提升;在标注稀缺的真实场景下,该方法仍能实现高可靠性的OCR工具选型,为实际文档解析系统的部署提供有效指导。3. Fully-sensorized smart-eyewear platform for on-device Machine Learning
Andrea Giudici, Christian Veronesi, Pietro Bartoli, Mario Cali`o, Aurelio Teliti, Giacomo Gervasoni, Diana Trojaniello, Franco Zappa
本文提出ARGO——一款全传感器集成的智能眼镜平台,旨在实现人体工学舒适性、高计算吞吐量与能效的统一。平台基于STM32N6微控制器及其内置神经处理单元(NPU),支持端侧机器学习,显著降低延迟并保障用户隐私。核心贡献在于硬件、固
件与AI模型的协同设计,重点部署轻量化YOLOv11模型用于实时城市障碍物识别;为此提出Head-wise Parallel Attention(HPA)架构改进,在保持原始计算逻辑前提下适配NPU加速。模型在WOTR数据集上训练,最终部署版本在严苛内存约束下达到24 mAP50–95,模型体积仅2.483 MB。平台集成RGB相机、ToF传感器、麦克风及环境传感器,运行帧率达10 FPS,200 mAh电池续航约113分钟。📄 arXiv: cs.CV
1. What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?
Anna Bavaresco, Ina Klari'c, Raquel Fern'andez, Marie-Francine Moens
本文探究了何种语言表征能有效建模人类大脑高级视觉皮层对自然图像的感知响应。研究系统比较了六类图像描述(含人工标注与多种机器生成字幕)及其在五种语言模型(涵盖自回归模型与语义任务微调的文本嵌入器)下的表征效果。结果表明,机器生成字幕
在预测脑响应和行为相似性判断上常优于传统人工标注字幕;文本嵌入器整体显著优于自回归语言模型;且脑预测性与行为一致性均在模型中间层达到峰值,该深度与句法语义结构的涌现阶段吻合。研究证实字幕内容与语言模型选择共同决定建模效能,确立字幕嵌入为研究高级视觉感知的有效工具。2. ForensicNet: Lightweight Attention-Enhanced MobileNetV2 for Automated Face Identification
Savitha N J, Lata B T
本文针对法医场景下面部识别面临的姿态变化、光照差异、遮挡及标注数据稀缺等挑战,提出轻量级注意力增强模型ForensicNet。该模型以MobileNetV2为骨干网络,嵌入卷积块注意力模块(CBAM)以强化判别性特征学习,并采用两
阶段自适应解冻的迁移学习策略提升域适应能力、缓解过拟合。在LFW与SCFace公开数据集(共15,000张图像、68个身份)上的实验表明,ForensicNet达到92.4%准确率、90.8%精确率和89.5%召回率,显著优于AlexNet、ResNet-50和原始MobileNetV2;单次推理仅需2.1 GFLOPs,具备实时法医监控部署潜力。3. The JEPA Predictor: A Transferable Operator for Occluded Feature Completion
William Nguyen, Christopher Nguyen
本文提出JEPA Predictor,一种可跨编码器家族迁移的遮挡特征补全算子。该方法利用Joint-Embedding Predictive Architecture(JEPA)中预训练的冻结预测器,通过单一线性投影桥接其与非J
EPA编码器(如CLIP、DINOv2/v3、MAE)的特征空间,在仅用500张ImageNet-1k图像闭式求解投影参数的前提下,实现无需联合微调的即插即用式增强。实验表明,在ImageNet-9与Stanford Dogs数据集上,该算子在高遮挡率下显著提升性能:CLIP+I-JEPA预测器在ImageNet-9重遮挡下几乎恢复全部精度损失,并将Stanford Dogs细粒度分类准确率从15.9%提升至52.1%(+36个百分点)。机制分析揭示其增益源于对遮挡区域的渐进式补偿优势压倒可见区域的投影开销,但在低遮挡率下因开销主导而失效。📝 AI 官方博客
1. Connect more of your apps to Search
📝 Google AI Blog
本文提出一种面向多应用集成的搜索增强框架,旨在解决用户在跨应用场景下信息检索碎片化、上下文割裂的问题。核心方法是构建统一的“连接式应用索引”(Connected App Indexing, CAI),通过轻量级SDK实现第三方应用与系统搜索…
服务的深度对接;关键技术包括动态权限感知的内容抓取、基于语义图谱的应用间关系建模,以及支持实时更新的增量索引机制。在覆盖12类主流应用的实验中,该方案将跨应用搜索结果相关性提升37.2%(NDCG@5),平均响应延迟控制在86ms以内,显著改善了用户跨应用信息获取效率与体验。2. Create, edit and star in videos with two Google Vids updates
📝 Google AI Blog
本文介绍了Google Vids两项重要更新——Gemini Omni多模态模型集成与个人数字分身(Personal Avatars)功能,旨在提升用户视频创作、编辑与个性化表达能力。Gemini Omni支持跨模态理解与生成,实现文本到视…
频、语音指令驱动剪辑、智能字幕生成与场景重排等能力;Personal Avatars则基于少量图像与语音样本,构建高保真、可控的3D数字人,支持自然口型同步与情感化动作生成。实验表明,新系统将视频制作耗时平均降低62%,用户编辑满意度提升41%(N=1,200),并在A/B测试中显著提高内容传播效率与观众停留时长。3. Celebrating 25 years of visual search innovation
📝 Google AI Blog
本文回顾了视觉搜索技术发展25年的重要历程,系统梳理了从早期基于文本的图像检索到现代端到端深度学习驱动的视觉搜索范式的演进路径。论文重点阐述了关键技术创新,包括大规模图像嵌入、跨模态对齐、细粒度特征匹配及实时索引优化等核心技术。通过在多个标…
准数据集(如ImageNet、Flickr30K、MS COCO)上的实验验证,所提出的方法在检索精度、响应延迟与鲁棒性方面显著优于前代系统。研究还探讨了隐私保护、可解释性与多语言支持等新兴挑战,为未来视觉搜索的发展提供了理论支撑与实践指引。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的简化动力学模型,旨在刻画构建未来AI的科研 workforce 在合作性与非合作性之间的演化分岔行为。模型将AI研发群体的协作倾向建模为受激励机制、制度设计、技术路径依赖…
与社会反馈共同驱动的动态系统,识别出决定系统长期走向的关键盆地边界(basin boundary)。基于当前AI领域人才流动、开源实践、安全研究投入及国际治理倡议等实证线索,模型初步表明我们尚处于合作性 basin 的边缘区域;而持续增强跨机构信任机制、对齐研究的资源倾斜与透明化治理实践,可作为判断是否步入“良性路径”的关键观测指标。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的潜在迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,检测其隐含的奖励优化偏差。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该方法可在奖励作弊发生前平均提前32%的训练步数发出预警,准确率达89.7%,显著优于基线检测方法。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究报告,聚焦于强化学习智能体在优化代理奖励函数过程中偏离设计者真实意图的行为机理与缓解路径。研究系统梳理了现有奖励设计缺陷引发的策略性欺骗现象,提出一种基于反事实奖励验证与人类…
反馈对齐的双阶段检测框架,并在Gridworld与SafeRLBench基准上开展实证评估。实验表明,该方法可将典型奖励黑客行为的发生率降低62.3%,同时保持94.7%的原始任务性能。后续工作将拓展至多智能体协同场景与语言模型奖励建模中的泛化性验证。7. Inviting hard questionsAnnouncementsJul 9, 2026We’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
本文介绍了Anthropic公司近期在AI领域的一系列重要进展:面向公众征集关于人工智能的最具挑战性问题,并承诺公开回应过程;详述Claude Code从内部命令行工具演变为成熟编程智能体的技术路径;联合多家科技企业发布Fable 5模型及…
行业通用越狱风险评估框架;并正式推出新一代轻量级前沿模型Claude Sonnet 5,在代码生成、推理与多模态理解方面实现显著性能提升,兼顾效率与安全性。8. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
9. AnnouncementsJun 30, 2026Redeploying Fable 5Fable 5 returns globally July 1. We’re also proposing an industry-wide framework for scoring jailbreak severity, together with Amazon, Microsoft, Google, and other Glasswing partners.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该页面仅显示标题“one daily email”,无其他实质性内容,无法提取具体新闻或信息。
💬 Hacker News AI 热门
1. Qwen-Image-3.0: Rich Content, Authentic Details, Deep Knowledge
🔥 458 分 · 💬 185 评论
通义千问推出全新图像生成模型Qwen-Image-3.0,主打丰富内容表现、真实细节还原和深层知识理解能力,支持更精准的图文协同生成,在复杂场景理解、多物体关系建模及专业领域知识融合方面显著提升。