每日技术进展追踪。
Tech News
AI 每日资讯 — 2026-07-15
AI 每日资讯 — 2026-07-14
AI 每日资讯 — 2026-07-13
AI 每日资讯 — 2026-07-12
AI 每日资讯 — 2026-07-12 🔥 HuggingFace 每日论文 1. Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation Yifan Zhou, Qihao Yang, Yan Li 本文针对当前AI系统在科学思想谱系推理与谱系驱动创意生成方面的能力缺失问题,提出IdeaGene-Bench(IG-Bench)基准。该基准基于IdeaGene框架,将论文或提案建模为类型化、证据支撑的“思想基因组”(Idea Genome)对象,并通过GenomeDiff刻画继承、突变、丢失、外源引入与新颖插入等六类演化操作。IG-Bench涵盖10个学科领域的1961条黄金谱系链、1085个标注基因组对象及920对GenomeDiff记录,支持两项评测:IG-Exam(42类任务、1029实例)评估闭式谱系推理能力;IG-Arena基于谱系条件下的群体演化得分(PES)评估生成质量。在14个LLM科学家上的实验表明,现有模型存在显著组合瓶颈,最优系统仅达27.3%准确率。 PDF · arXiv · 代码 · 项目 | ❤️ 28 2. UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks Zhekai Chen, Chengqi Duan, Kaiyue Sun 本文提出UniClawBench,首个面向主动式智能体的通用能力驱动型基准,旨在克服现有评测在沙箱环境、单轮评估及任务分类混杂等方面的局限。该基准围绕技能调用、探索能力、长上下文推理、多模态理解与跨平台协同五大核心能力,构建了400个双语真实世界任务,并在动态Docker容器中通过细粒度步骤级检查点进行实时评估。其创新性闭环评估框架包含执行者、隐藏监督者与用户代理,模拟真实多轮人机交互且不泄露评分标准。实验覆盖多种主流模型与代理框架,有效解耦基础模型能力与系统设计影响。 PDF · arXiv · 代码 · 项目 | ❤️ 26 3. LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang...