AI 每日资讯 — 2026-07-05

AI 每日资讯 — 2026-07-05 🔥 HuggingFace 每日论文 1. Program-as-Weights: A Programming Paradigm for Fuzzy Functions Wentao Zhang, Liliana Hotsko, Woojeong Kim 本文提出“模糊函数编程”范式,旨在解决日志告警、JSON修复、意图排序等难以用精确规则描述的编程任务,避免依赖云端大模型API带来的隐私、可复现性与成本问题。作者设计“程序即权重”(Program-as-Weights, PAW)方法:利用在自建1000万样本FuzzyBench数据集上训练的4B参数编译器,为冻结的轻量级0.6B Qwen3解释器生成参数高效的适配器。实验表明,PAW在MacBook M3上以30 token/s速度运行,推理内存仅为Qwen3-32B直接提示的1/50,性能却与之相当。该范式将基础模型从逐输入求解器转变为一次性函数构建工具,产出可离线、低成本复用的紧凑神经程序。 PDF · arXiv · 代码 · 项目 | ❤️ 68 2. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments Zhilin Wang, Han Song, Runzhe Zhan 本文提出EvoPolicyGym,旨在评估自主智能体在交互环境中对可执行策略的自主演化能力。针对现有评测方法将策略优化过程简化为单一终局分数或混同于通用软件工程进展的问题,作者构建了“自主策略演化”这一受控评测范式:智能体需在固定交互预算下反复编辑并提升策略。EvoPolicyGym基于轻量级强化学习环境构建,支持16个任务的迭代策略优化评测。实验表明,GPT-5.5在整体排名与各任务前两名表现上均最优;进一步的轨迹级分析揭示,高效策略演化依赖于机制发现能力与受限反馈下的参数化调优,而非单纯任务胜率。 PDF · arXiv | ❤️ 41 3. WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory Hanlin Wang, Hao Ouyang, Qiuyu Wang...

七月 5, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-07-04

AI 每日资讯 — 2026-07-04 🔥 HuggingFace 每日论文 1. Program-as-Weights: A Programming Paradigm for Fuzzy Functions Wentao Zhang, Liliana Hotsko, Woojeong Kim 本文提出“模糊函数编程”范式,旨在将自然语言描述的非精确计算任务(如日志告警、JSON修复、意图排序)编译为轻量、可本地执行的神经程序。作者设计了“程序即权重”(Program-as-Weights, PAW)方法:利用在自建1000万样本数据集FuzzyBench上训练的40亿参数编译器,为冻结的0.6B参数Qwen3解释器生成参数高效的适配器。实验表明,PAW在MacBook M3上以30 token/s速度运行,推理内存仅为Qwen3-32B直接提示的1/50,却达到同等性能。该范式将大模型从逐输入求解器转变为一次性函数构建器,显著提升可复现性、隐私性与成本效益。 PDF · arXiv · 代码 · 项目 | ❤️ 46 2. EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments Zhilin Wang, Han Song, Runzhe Zhan 本文提出EvoPolicyGym,旨在评估自主智能体在交互环境中对可执行策略的自主演化能力。针对现有评测方法将策略优化过程简化为单一终局分数或混同于通用软件工程进展的问题,作者构建了“自主策略演化”这一受控评测范式:智能体需在固定交互预算下反复编辑并优化策略。EvoPolicyGym基于轻量级强化学习环境构建,支持16个任务的迭代策略改进评测。实验表明,GPT-5.5在整体排名与各环境Top-2性能上均表现最优;进一步的轨迹级诊断揭示,高效策略演化依赖于对任务适配机制的发现及在有限反馈下的参数化精调,而不仅限于单次任务成功。 PDF · arXiv | ❤️ 39 3. WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory Hanlin Wang, Hao Ouyang, Qiuyu Wang...

七月 4, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-03

AI 每日资讯 — 2026-07-03 🔥 HuggingFace 每日论文 1. Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning Hongxing Li, Xiufeng Huang, Dingming Li 细粒度视觉推理对现有视觉语言模型仍具挑战性,尤其当关键视觉线索隐匿于高分辨率图像中时。本文提出Perceive-to-Reason(P2R)框架,将该任务解耦为感知与推理两个阶段:先由“感知器”定位问题相关局部证据,再由“推理器”基于原始图像及裁剪区域生成答案。为适配此解耦范式,我们设计感知-推理交替的GRPO(PRA-GRPO)强化学习策略,仅依赖最终答案监督实现角色感知的交替优化。在Qwen3-VL-Instruct系列模型上验证表明,P2R-4B在V-Star、HR-Bench-4K和HR-Bench-8K上分别达93.2%、81.9%和80.5%,显著超越基线;其增益亦泛化至更广泛的多模态推理任务,证实解耦感知与推理的有效性。 PDF · arXiv · 代码 | ❤️ 10 2. The State-Prediction Separation Hypothesis Giovanni Monea, Nathan Godey, Kianté Brantley 本文提出“状态-预测分离假说”,指出Transformer中同一前向计算流同时承担下一词元预测与隐状态维护两项功能,存在内在耦合;若将二者解耦,可提升语言建模性能。为此,作者设计了一种双计算流Transformer变体,分别处理状态保持与词元预测。在多尺度预训练实验中,该模型显著提升数据与计算效率,验证损失持续降低,并在下游任务上平均超越标准Transformer 2–3个百分点。详尽的梯度分析与消融实验排除了潜在混杂因素,证实其优化动力学的本质差异。 PDF · arXiv | ❤️ 7 3. Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models Yue Han, Chong Li, Zhening Liu...

七月 3, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-02

AI 每日资讯 — 2026-07-02 🔥 HuggingFace 每日论文 1. GEAR: Guided End-to-End AutoRegression for Image Synthesis Bin Lin, Zheyuan Liu, Chenguo Lin 本文提出GEAR(Guided End-to-end AutoRegression),一种面向图像合成的端到端联合训练框架,旨在解决传统两阶段生成模型中tokenizer与生成器解耦导致的表征不匹配问题。GEAR通过双路码本分配机制实现可微训练:硬分支提供one-hot离散索引以支持自回归建模,软分支则引入可微表征对齐损失,反向引导向量量化(VQ)tokenizer优化。该机制使tokenizer主动适配AR模型的预测偏好,显著提升索引分布的可建模性。实验表明,GEAR在ImageNet上将gFID收敛速度提升至LlamaGen-REPA基线的10倍,同时增强局部块级特征质量与空间一致性,并兼容多种量化器(VQVAE、LFQ、IBQ)及文本到图像任务。 PDF · arXiv · 代码 · 项目 | ❤️ 27 2. Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona 本文针对大语言模型(LLMs)在元认知能力上的系统性缺陷——如高置信度幻觉、知识边界识别失败及内在不确定性表达失真——提出强化学习结合元认知反馈(RLMF)的新范式。该方法利用模型对自身输出质量的自我判断作为偏好优化中的反馈信号,辅以基于元认知评估的数据选择策略,显著提升训练样本效率。研究聚焦于“忠实校准”(Faithful Calibration)这一本质元认知任务,采用两阶段解耦框架:先校准模型自报告置信度的准确性,再通过目标导向的输出编辑映射为自然、上下文自适应的语言化不确定性表达。实验表明,RLMF在多个基准上实现泛化性强、SOTA级别的不确定性表达忠实度提升。 PDF · arXiv · 代码 | ❤️ 14 3. QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina...

七月 2, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-06-27

六月 27, 2026 · 0 分钟 · Pan