AI 每日资讯 — 2026-07-21
AI 每日资讯 — 2026-07-21 🔥 HuggingFace 每日论文 1. Loop the Loopies! Zitian Gao, Yilong Chen, Yihao Xiao 本文提出Loopie——迄今最强大的循环式Transformer模型。Loopie采用双规模混合专家(MoE)架构,包含20B总参/2B激活参数与6B总参/0.6B激活参数两个版本,突破了传统循环Transformer中“计算量线性增长不如参数量线性增长”的瓶颈。通过创新的后训练推理增强流程,Loopie在同等预训练计算预算下显著超越同规模标准Transformer基线(如30B-A3B)。实证表明,其在2025年国际数学与物理奥林匹克竞赛中无需外部工具即达金牌水平,验证了循环架构与推理优化协同设计的有效性。 PDF · arXiv | ❤️ 53 2. Understanding Reasoning from Pretraining to Post-Training Jingyan Shen, Ang Li, Salman Rahman 本文探究了从预训练到后训练(RL)全过程对大语言模型推理能力的影响,以国际象棋为可控实验平台,系统研究模型规模、预训练数据量与RL计算投入之间的交互关系。作者构建了涵盖5M至10亿参数的模型族,在人类棋谱上预训练,经合成推理轨迹监督微调(SFT),再在可验证奖励的棋题上进行强化学习。实验发现:RL后性能可由预训练损失良好预测,且RL奖励曲线斜率近似线性依赖于预训练token数量;RL并非简单优化SFT策略,而是在简单题目中放大已有正确偏好,在难题中挖掘SFT几乎忽略的正确动作。 PDF · arXiv · 代码 | ❤️ 17 3. When Does Muon Help Agentic Reinforcement Learning? Kai Ruan, Jinghao Lin, Zihe Huang 本文探究了优化器 Muon 在稀疏奖励智能体强化学习(Agentic RL)中的有效性。基于 ALFWorld 环境与 Qwen2.5-0.5B-Instruct 模型,作者在 Group-in-Group Policy Optimization(GiGPO)等策略优化框架下,开展单种子对照实验,对比 Muon 与 AdamW 的性能。结果表明:仅将 Muon 应用于隐藏层权重矩阵即可显著提升验证成功率(如 GiGPO 下从 0....