AI 每日资讯 — 2026-07-10

AI 每日资讯 — 2026-07-10 🔥 HuggingFace 每日论文 1. Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning Chen Tang, Yizhou Wang, Jianyu Wu 本文针对结构-性质关系建模中表征与推理的协同挑战,提出SciReasoner——一种面向蛋白质、小分子和无机晶体的多模态科学基础模型。该模型将原子坐标、拓扑结构与周期性连接性离散化为统一的“结构感知词表”,将结构单元作为可寻址的证据单元进行原生推理。在基因本体(GO)预测中,其在低同源性及孤儿类蛋白的细胞组分注释上将Fmax从0.42提升至0.55;在化学逆合成任务中,单步准确率由0.63提高到0.72,并生成可解释的片段级断键路径与前体验证轨迹;在材料科学中,其表征能有效区分元素/化合物相态,并清晰分辨高低带隙区域,显著增强跨学科结构-性质理解的准确性、可解释性与透明度。 PDF · arXiv · 代码 · 项目 | ❤️ 69 2. Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation Hongyu Qu, Jianzhe Gao, Xiaobin Hu 本文针对现有视觉-语言-动作(VLA)模型在长时序、强时序依赖机器人操作任务中因马尔可夫假设导致的历史信息利用不足问题,提出LaMem-VLA框架。该框架首次将历史经验完全映射至VLA原生的连续潜在嵌入空间,构建双层级潜存记忆(短时与长时),并通过策展器、检索器、压缩器与编织器四模块协同实现记忆的组织、上下文感知检索、紧凑表征及与当前多模态输入的无缝融合。在RT-1-X与OpenVLA基准上的实验表明,LaMem-VLA显著提升长程任务成功率(+12.7%),且推理延迟可控,验证了潜存记忆原生集成对VLA泛化性与时序推理能力的有效增强。 PDF · arXiv · 代码 | ❤️ 44 3. Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence Shuailei Ma, Jiaqi Liao, Xinyang Wang...

七月 10, 2026 · 5 分钟 · Pan

AI 每日资讯 — 2026-07-09

AI 每日资讯 — 2026-07-09 🔥 HuggingFace 每日论文 1. RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Haoyu Zhao, Xingyue Zhao, Siteng Huang 本文针对开放世界机器人操作中场景动态建模的挑战,提出RynnWorld-4D——一种基于RGB-D输入与语言指令生成未来4D(RGB+深度+光流)序列的具身世界模型。该模型采用三支路扩散架构,融合跨模态注意力与帧级3D旋转位置编码(RoPE),确保外观、几何与运动的一致演化。为支撑训练,构建了包含2.54亿帧的Rynn4DDataset 1.0,涵盖第一人称人类与机器人操作视频,并配备高质量伪标注深度与光流。进一步设计RynnWorld-4D-Policy,直接利用模型内部4D表征进行单次前向推理,实现高效策略输出,在多个仿真与真实机器人操作任务中显著优于现有基线。 PDF · arXiv · 代码 · 项目 | ❤️ 72 2. RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation Haoyu Zhao, Xingyue Zhao, Hangyu Li 本文提出RynnWorld-Teleop,一种面向数字遥操作的动作条件化世界模型,旨在突破物理遥操作在数据采集中的硬件与时空瓶颈。该方法以单张参考图像为起点,通过深度感知的骨骼条件建模与视频扩散Transformer,将操作者手部姿态流实时映射为高保真第一人称机器人视角视频;生成的姿态序列作为具身无关的动作标签,可经标准重定向适配任意目标机器人,从而构建无需物理设备的完整状态-动作轨迹。系统采用流式自回归蒸馏实现单次推理,达40+ FPS实时性能。实验表明,仅用合成数据训练的策略即可实现零样本Sim2Real迁移,并在灵巧双臂任务中显著提升真实世界数据集的泛化性能。 PDF · arXiv | ❤️ 66 3. Vision as Unified Multimodal Generation Xiaoyang Han, Jianhua Li, Kewang Deng 本文提出将计算机视觉统一建模为多模态生成任务,摒弃传统任务专属架构,转而依托统一的多模态大模型,在原生文本与图像生成空间中直接表达各类异构视觉任务。为此,作者构建了SenseNova-Vision模型,通过自然语言指令与可选视觉提示灵活指定任务类型、目标区域及解码范式,输出形式涵盖纯文本(符号化结果)、纯图像(稠密空间预测)或图文混合(组合型任务)。为支撑大规模训练,作者构建了SenseNova-Vision语料库,将多样化视觉标注自动转化为适配该生成空间的指令-响应样本。模型基于现成预训练多模态基座,仅通过该语料及辅助多模态数据微调,无需新增预测头或结构修改。实验表明,该单一模型在检测、OCR、关键点估计、分割、深度/法向量预测、点云、相机位姿估计等十余类任务上达到与专用模型相当的性能,并支持语言定义的细粒度任务变体。 PDF · arXiv · 代码 | ❤️ 30...

七月 9, 2026 · 5 分钟 · Pan

AI 每日资讯 — 2026-07-08

AI 每日资讯 — 2026-07-08 🔥 HuggingFace 每日论文 1. PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space Sensen Gao, Zhaoqing Wang, Qihang Cao 本文提出PixWorld,首次在像素空间统一3D场景生成与重建任务。针对现有方法依赖潜在空间扩散、需预训练VAE/RAE且存在几何信息损失等问题,PixWorld直接在渲染图像上定义扩散目标,避免潜在编码带来的信息失真。进一步引入基于预训练3D基础模型的几何感知损失,在几何感知特征空间对齐渲染视图与真实视图,实现显式3D结构监督。实验表明,PixWorld在生成质量上显著超越现有潜在空间方法,在重建精度上媲美最先进重建模型,验证了像素空间统一范式的有效性与优越性。 PDF · arXiv · 代码 · 项目 | ❤️ 44 2. Multiplayer Interactive World Models with Representation Autoencoders Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary 本文提出了首个面向高动态、强耦合物理交互环境的多人世界模型,突破了传统单人世界模型将其他智能体视为环境一部分的局限。该模型以多智能体动作流为条件,通过表征自编码器学习场景变化与各玩家行为间的因果归因,在《火箭联盟》这一复杂竞技环境中实现了四人实时协同与对抗建模。基于10,000小时机器人对战数据训练的50亿参数潜在扩散模型,可在单块NVIDIA B200 GPU上以20 FPS生成高质量视频序列;其rollout稳定性远超训练时长——分布质量在5分钟内保持稳定,实际运行中可持续数小时无崩溃。研究系统分析了视频编解码器、生成目标函数与多人条件机制等核心设计,并揭示了模型与数据规模扩展下的能力涌现规律与持续存在的失效模式;同时构建了聚焦物理理解而非仅视觉保真度的专项评测体系。 PDF · arXiv · 代码 · 项目 | ❤️ 11 3. LLM-as-a-Verifier: A General-Purpose Verification Framework Jacky Kwok, Shulu Li, Pranav Atreya...

七月 8, 2026 · 4 分钟 · Pan

AI 每日资讯 — 2026-07-07

AI 每日资讯 — 2026-07-07 🔥 HuggingFace 每日论文 1. Program-as-Weights: A Programming Paradigm for Fuzzy Functions Wentao Zhang, Liliana Hotsko, Woojeong Kim 本文提出“模糊函数编程”范式,旨在将自然语言描述的非精确任务(如日志告警、JSON修复、意图排序)编译为轻量、可本地执行的神经程序。作者设计了“程序即权重”(Program-as-Weights, PAW)方法:利用在自建1000万样本数据集FuzzyBench上训练的40亿参数编译器,为冻结的0.6B参数Qwen3解释器生成参数高效的适配器。实验表明,PAW在MacBook M3上以30 token/s速度运行,推理内存仅为Qwen3-32B直接提示的1/50,性能却与之相当。该范式将大模型从逐输入求解器转变为一次性函数构建工具,显著提升可复现性、隐私性与成本效益。 PDF · arXiv · 代码 · 项目 | ❤️ 94 2. Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots Ling Xu, Chuyu Han, Borui Li 本文针对具身智能模型(如VLA与WAM)在异构机器人边缘设备上部署碎片化、缺乏统一运行时支持的问题,提出轻量、可移植的C++推理运行时Embodied.cpp。其基于典型模型架构分析,抽象出五层通用执行路径(输入适配器、序列构建器、主干执行、头插件、部署适配器),支持模块化多速率执行、低延迟批大小为1的融合推理,以及可扩展的算子与I/O接口。实验表明,在HY-VLA和pi0.5两个VLA模型上实现100.0%与91.0%闭环任务成功率;在初步WAM基准测试中,LingBot-VA Transformer模块内存占用从312.2 MiB降至88.1 MiB,验证了其高效性与跨平台适应能力。 PDF · arXiv · 代码 | ❤️ 34 3. WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory Hanlin Wang, Hao Ouyang, Qiuyu Wang...

七月 7, 2026 · 3 分钟 · Pan

AI 每日资讯 — 2026-07-06

AI 每日资讯 — 2026-07-06 🔥 HuggingFace 每日论文 1. Program-as-Weights: A Programming Paradigm for Fuzzy Functions Wentao Zhang, Liliana Hotsko, Woojeong Kim 本文提出“模糊函数编程”范式,旨在将自然语言描述的非精确计算任务(如日志告警、JSON修复、意图排序)编译为轻量、可本地执行的神经程序。作者设计了“程序即权重”(Program-as-Weights, PAW)方法:利用在自建数据集FuzzyBench(1000万样本)上训练的4B参数编译器,为冻结的0.6B Qwen3解释器生成参数高效的适配器。实验表明,PAW程序在MacBook M3上以30 token/s速度运行,推理内存仅为Qwen3-32B直接提示的1/50,且性能相当。该范式将大模型从逐输入求解器转变为一次性函数构建工具,显著提升可复现性、隐私性与成本效益。 PDF · arXiv · 代码 · 项目 | ❤️ 81 2. WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory Hanlin Wang, Hao Ouyang, Qiuyu Wang 本文提出WorldDirector,一种面向可控视频世界建模的新型框架,旨在实现持久化的动态对象记忆与无约束视角探索。区别于现有将物理动力学与像素渲染耦合、依赖连续视觉观测维持运动的世界模型,WorldDirector显式解耦语义运动编排与视觉生成:利用大语言模型(LLM)协同规划3D物体轨迹与相机运动,并将其作为视频生成的控制信号。该设计保障了严格的物理逻辑一致性与外观稳定性,即使动态对象长时间离开视野后重新出现,其视觉身份仍被精确保留。实验表明,该方法在复杂长时序事件合成中展现出前所未有的可控性与动态对象记忆持久性。 PDF · arXiv | ❤️ 22 3. From SRA to Self-Flow: Data Augmentation or Self-Supervision? Dengyang Jiang, Mengmeng Wang, Harry Yang...

七月 6, 2026 · 3 分钟 · Pan