每日技术进展追踪。
Tech News
AI 每日资讯 — 2026-07-14
AI 每日资讯 — 2026-07-13
AI 每日资讯 — 2026-07-12
AI 每日资讯 — 2026-07-12 🔥 HuggingFace 每日论文 1. Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation Yifan Zhou, Qihao Yang, Yan Li 本文针对当前AI系统在科学思想谱系推理与谱系驱动创意生成方面的能力缺失问题,提出IdeaGene-Bench(IG-Bench)基准。该基准基于IdeaGene框架,将论文或提案建模为类型化、证据支撑的“思想基因组”(Idea Genome)对象,并通过GenomeDiff刻画继承、突变、丢失、外源引入与新颖插入等六类演化操作。IG-Bench涵盖10个学科领域的1961条黄金谱系链、1085个标注基因组对象及920对GenomeDiff记录,支持两项评测:IG-Exam(42类任务、1029实例)评估闭式谱系推理能力;IG-Arena基于谱系条件下的群体演化得分(PES)评估生成质量。在14个LLM科学家上的实验表明,现有模型存在显著组合瓶颈,最优系统仅达27.3%准确率。 PDF · arXiv · 代码 · 项目 | ❤️ 28 2. UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks Zhekai Chen, Chengqi Duan, Kaiyue Sun 本文提出UniClawBench,首个面向主动式智能体的通用能力驱动型基准,旨在克服现有评测在沙箱环境、单轮评估及任务分类混杂等方面的局限。该基准围绕技能调用、探索能力、长上下文推理、多模态理解与跨平台协同五大核心能力,构建了400个双语真实世界任务,并在动态Docker容器中通过细粒度步骤级检查点进行实时评估。其创新性闭环评估框架包含执行者、隐藏监督者与用户代理,模拟真实多轮人机交互且不泄露评分标准。实验覆盖多种主流模型与代理框架,有效解耦基础模型能力与系统设计影响。 PDF · arXiv · 代码 · 项目 | ❤️ 26 3. LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang...
AI 每日资讯 — 2026-07-11
AI 每日资讯 — 2026-07-11 🔥 HuggingFace 每日论文 1. UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks Zhekai Chen, Chengqi Duan, Kaiyue Sun 本文提出UniClawBench——首个面向真实世界任务的通用型主动式智能体能力驱动评测基准。针对现有基准依赖沙盒环境、单轮评估、任务分类混杂等局限,该基准围绕技能调用、探索能力、长上下文推理、多模态理解与跨平台协同五大基础能力,构建了400个双语真实场景任务。所有任务在实时Docker容器中执行,采用细粒度分步完成检查点进行动态评估,并设计包含执行器、隐式监督者与用户代理的闭环评估框架,模拟真实多轮人机交互反馈。实验在多种主流模型与代理框架上验证了其有效性与可扩展性。 PDF · arXiv · 代码 · 项目 | ❤️ 21 2. Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation Yifan Zhou, Qihao Yang, Yan Li 本文针对当前AI系统在科学思想谱系推理与谱系驱动创意生成方面的能力缺失问题,提出IdeaGene-Bench(IG-Bench)基准。该基准基于IdeaGene框架,将论文或提案建模为类型化、证据支撑的“思想基因组”(Idea Genome)对象,并通过GenomeDiff刻画继承、变异、丢失、外部引入与新颖插入等六类演化操作。基准涵盖10个学科领域的1961条黄金谱系链、1085个 curated 思想基因组及920对GenomeDiff记录。其包含两项评测:IG-Exam(42类任务、1029实例)评估闭式谱系推理能力;IG-Arena以谱系条件化的群体演化得分(PES)评估生成质量。实验表明,现有14种LLM科学家模型存在显著组合瓶颈,最优系统仅达27.3%准确率。 PDF · arXiv · 代码 · 项目 | ❤️ 20 3. LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang...