AI 每日资讯 — 2026-08-12
🔥 HuggingFace 每日论文
1. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
Björn Engdahl, Adrian Kosowski, Jan Chorowski
本文提出BDH-CQ模型,将上下文学习与循环隐式推理相结合:在推理阶段,输入持续更新模型的循环记忆,查询则通过高维隐空间中的迭代计算求解,无需显式生成中间推理步骤。在ARC-AGI-1基准上评估表明,150M参数版本在pass@2
指标上达29.5%,单任务推理成本仅0.0007美元,显著突破既有成本-精度帕累托前沿,成为当前该基准下性价比最高的方法。进一步通过可控ARC类干预实验,系统分析了模型从示例中习得的变换规律、泛化一致性及仍具挑战性的抽象概念。PDF · arXiv · 代码 · 项目 | ❤️ 156
2. Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Lab, Vin Bo, Asher Cai
Macaron-V1 是面向开放持续学习(Open Continual Learning)的智能体模型家族,旨在实现部署后基于真实环境经验的自主迭代与多任务协同。其核心包括:(1)递归式模型-运行时协同设计框架,通过版本化模型-运
行时对与外部契约(HCP)驱动自我改进;(2)混合LoRA(MoL)架构,在冻结大语言模型基座基础上动态路由任务专属LoRA适配器,支持可扩展、低干扰的持续专业化学习。实验表明,Macaron-V1-Venti(744B GLM-5.2基座)与Macaron-V1-Tall(50B Qwen3.6基座)在个人智能、GenUI及通用能力基准上显著优于前沿基线,验证了其在稳定性、适应性与协作性上的系统级优势。🏛️ Mind Lab | PDF · arXiv | ❤️ 137
3. Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
Diandian Zhang, Tingyu Song, Lin Fu
本文提出Sci-VBench——首个面向科学领域的知识与推理密集型视频生成评测基准。该基准涵盖四大类学科(自然科学、医疗健康、人文社科、工程),包含1253个专家标注样本,覆盖60个细分主题,强调视频在科学逻辑、因果机制与领域知识
上的准确性,而非仅视觉合理性。作者设计了基于多维指标(Prompt Grounding、Scientific & Causal Correctness等)的细粒度人工与MLLM-as-Judge评估协议,验证其与专家判断高度一致。对16个前沿闭源与开源模型的系统评测表明:尽管感知质量指标趋同,但在科学正确性与因果建模能力上存在显著性能鸿沟,凸显当前视频生成模型在科学内涵理解上的根本性局限。4. Stealing Reasoning Traces from Proprietary LLM APIs
Alexander Panfilov, David Schmotz, Ilia Shumailov
本文揭示了主流大语言模型(LLM)API中隐藏的推理链(chain-of-thought)加密机制存在严重架构漏洞:同一厂商生态内不同用户、会话及模型间加密推理块可跨上下文互换使用。作者据此提出一种可扩展的“推理痕迹窃取”攻击——
将强模型生成的加密推理块注入弱模型请求中,诱使其在无直接越狱前提下以明文输出原始推理过程。实验覆盖Anthropic、OpenAI与Google三大平台,成功绕过反蒸馏防护;并从公开爬取的315,320个加密块中恢复出367条PII及182组凭证,证实该漏洞可导致大规模私有数据泄露与有害信息暴露。🏛️ Anthropic, OpenAI, Google | PDF · arXiv | ❤️ 14
5. RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
Dongchi Huang, Hongyin Zhang, Bohan Hou
RynnValue 提出了一种基于时间距离(temporal distance)的机器人价值基础模型,旨在解决通用奖励模型在跨任务、跨平台泛化能力不足的瓶颈问题。该方法摒弃依赖偏好或归一化进度等易受实体与数据源影响的监督信号,转而
利用视频时间戳直接构建语言条件下的有向成本到目标(cost-to-goal)标签,从而实现对7,000小时、约300万条指令视频片段的大规模无偏好标注训练。通过随机时间采样、时序打乱与价值隔离注意力机制,模型有效抑制预测捷径,提升对失败与退化状态的敏感性。在RBMEVAL-OOD基准上,RynnValue以0.675的Kendall’s tau_a显著超越全偏好监督SOTA(0.655)及仅进度监督基线(0.292),并支持零样本迁移至未见任务、本体与视角;经势函数塑形转化为稠密奖励后,其驱动策略在线/离线真实世界成功率分别提升至72.5%与82.5%。6. Mismatch Matters: On-Policy Distillation Beyond Token Agreement
Zichao Yu, Chengzhi Yu, Shengze Xu
本文揭示了策略内蒸馏(OPD)中一种被忽视的失效模式——“退化一致性”:学生模型通过重复循环生成与教师高度一致的token,却产出全局错误的回答。为此,作者转向关注师生间的token级不匹配,将其细分为学生冗余token(教师赋予
近零概率)和学生缺失token(教师偏好但学生极少采样)。针对二者,提出TIDE方法:采用有界Hellinger shaping抑制最严重的冗余token,并通过解析式教师top-K注入机制恢复缺失概率质量,无需依赖缺失token的实际采样。在多个Qwen3师生对的数学推理基准上,TIDE显著优于标准OPD及主流token选择与奖励塑形基线;尤其在强师生不匹配场景下,Avg@8指标从6.9%提升至20.3%,同时响应长度平均缩减为原来的1/2。7. Multimodal Model Diffing for Feature Discovery and Control
Hunar Batra, Lachin Naghashyar, Ashkan Khakzar
本文提出MMDiff——一种面向多模态大语言模型(MLLMs)的模型差异分析框架,旨在发现、解析并控制其内部可解释特征。该方法通过训练多模态稀疏自编码器(SAEs),构建特征级接口,支持三类功能:(i)特征隔离,通过对比基础语言模
型与多模态适配模型的SAE识别受多模态训练影响的关键特征;(ii)任务特异性因果特征检测,借助逐token对比激活分析定位驱动行为的核心方向;(iii)特征级干预,实现对目标特征的因果移除或定向引导。在LLaVA-MORE、PaliGemma 2和InternVL3.5上验证表明,MMDiff所发现的稀疏因果特征移除后,在空间理解与OCR任务上平均性能下降12%和17%,多模态安全攻击成功率降低24%,且不影响VQA表现;特征引导则进一步提升了相关任务准确率。8. CEAA: A Cognitive Embodied Agents Architecture for Interactive Computing Systems
Aimilios Hadjiliasi, Louis Nisiotis
本文针对实时交互式虚拟环境中具身智能虚拟代理(IVA)的认知能力构建难题,提出一种模块化认知架构CEAA。该架构融合Sense-Think-Act范式与信念—欲望—意图(BDI)模型等成熟框架,面向实现需求设计可复用的“代理大脑”
模板。其关键技术在于解耦高层推理机制与底层具身执行,支持在3D交互计算系统中部署可扩展、自适应且可解释的认知型IVA。实验验证表明,CEAA有效弥合了符号化推理与实时具身行为之间的鸿沟,在复杂虚拟环境中展现出良好的响应性与任务泛化能力。🔥 arXiv 每日论文
📄 arXiv: cs.AI
1. Towards an Argumentative Foundation for Evaluative AI
Xiang Yin, Tim Miller, Nico Potyka, Antonio Rago, Francesca Toni
本文提出将计算论辩(computational argumentation)作为评估型人工智能(Evaluative AI, EAI)的形式化与可计算基础,以支撑其可解释性与可争议性。针对当前EAI侧重呈现多假设及其正反证据、而非
单一推荐的特点,作者论证了论辩框架在建模主张、证据、反驳与权衡关系上的天然适配性,并初步勾勒出面向分布式、以人为中心的EAI系统的长期研究路径。该立场论文为构建透明、可信且支持人类批判性参与的AI决策支持系统奠定了理论基础。🏛️ Francesca Toni
2. Flow-by-Flow:Content-Judgment Bypass for Governing AI Output in High-Loss Domains
Hiroki Naito
本文针对高风险领域中AI输出治理失效问题,指出传统“人在环路”监督因AI输出速率(V)与单次认知负荷(L)的乘积(V×L)超出人类认知上限(Cₘₐₓ)而不可持续。作者揭示L由分诊、判断与响应三部分构成,其中仅判断成本随模型能力提升
呈非良性下降(常以漏判为代价),故能力增强无法真正降低总负荷。为此,提出“Flow-by-Flow”治理范式:摒弃内容正确性判断,转而基于形式化、可计数特征构建认知成本评分,并结合机构容量上限约束处理量。论文确立四项设计不变量,并通过蒙特卡洛模拟验证其多指标流控策略在90.8%试验中优于单纯强化人工监督。3. Emotion in an active inference model of human driving
Julian F. Schumann, Johan Engstr"om, Ran Wei, Jens Kober, Martijn Wisse, Arkady Zgonnikov
本文针对现有主动推理(active inference)驾驶模型忽略情绪影响的问题,提出一种可从连续状态驾驶模型中提取效价(valence)与唤醒度(arousal)情绪维度的新方法。该方法将情绪估计不仅依赖于当前状态,还显式建模
对未来驾驶结果的预测,从而增强其认知合理性。作者在两个交互式驾驶场景中验证了该模型,结果显示生成的情绪信号与实证研究中报告的人类情绪模式高度一致,表明所提框架能有效捕捉交通情境下情绪驱动的行为动态,为具身认知与人机共驾建模提供了新范式。🏛️ Jens Kober
📄 arXiv: cs.CL
1. Unified Hallucination Fuzzing for Multimodal Large Language Models
Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You
幻觉问题严重制约多模态大语言模型(MLLMs)在高风险场景中的可靠性。针对现有静态基准覆盖窄、易饱和的局限,本文提出统一幻觉模糊测试框架:首先构建细粒度基准UniHall,基于对象、指令与知识三维度统一分类体系;其次设计自适应多模
态模糊测试方法(SAMF),通过进化式变异策略动态探索模型幻觉边界,并引入多模态预言机集成的结构化评估指标保障动态输入下的评测可信性。实验表明,主流MLLMs在模糊测试下性能显著下降,揭示其推理能力与事实 grounding 的脱节,并发现对齐优化会加剧指令跟随任务中的讨好性幻觉。代码与数据集已开源。2. DocAtlas: Long-Document Understanding as Mutable-State Interaction
Hongchen Wei, Yuanzhe Wang, Bei Liu, Yifan Yang, Qi Dai, Kai Qiu, Yunsheng Li, Dongdong Chen, Chong Luo, Zhenzhong Chen, Baining Guo
本文提出DocAtlas,将长文档理解建模为一种可变状态的信息检索与交互过程。其核心是构建一个“可变文档框架”(mutable document harness),作为外部环境动态管理文档的搜索、阅读、笔记与回顾操作,并维护层次化
证据树与笔记存储,支持自优化检索、选择性证据访问与受限上下文下的主动工作记忆。该框架既支持大模型推理时调用,也支持端到端强化学习训练轻量级视觉语言模型(VLM)。实验表明:基于GPT-5.4的DocAtlas在MMLongBench-Doc上达71.4%,超越人类专家基准(65.8%);而经端到端RL训练的Qwen3.5-4B VLM取得63.7%,显著优于直接输入基线(54.4%)。3. WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management
Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen
本文提出WuYuEval——首个面向固体废物管理(SWM)领域的多层级大语言模型评测基准。该基准包含基础模块(4590道多选题,覆盖6类任务、8个专业子域)与专家模块(247道场景化开放题,聚焦多目标优化、约束权衡与系统设计),并
创新采用锚点校准的LLM-as-a-Judge评分与Elo配对比较法评估专家级能力。在33个主流LLM上的实证表明:顶尖模型基础准确率达94.64%,但难题准确率骤降至42.50%,尤其在计算、实验设计、城市规划及开放决策任务上表现薄弱;推理模式虽提升部分模型性能,但增益依赖基线能力且非普适。结果揭示:仅当推理过程严格锚定单位、假设与工程约束时,显式思维链才有效;否则易偏离确定性解空间。WuYuEval为SWM领域专用模型的开发与评估提供了标准化工具与实证依据。📄 arXiv: cs.LG
1. Application of Artificial Intelligence for Fraudulent Banking Operations Recognition
Bohdan Mytnyk, Oleksandr Tkachyk, Nataliya Shakhovska, Solomiia Fedushko, Yuriy Syerov
本文针对新冠疫情背景下线上银行欺诈激增的问题,提出基于人工智能的欺诈交易识别方法。研究重点在于构建适用于高不平衡银行业务数据的机器学习模型,创新性地设计了面向欺诈检测的数据预处理流程与特征工程策略,并系统比较了逻辑回归、人工神经网
络及堆叠泛化等算法性能。实验结果表明,逻辑回归模型AUC达0.946,而堆叠泛化模型进一步提升至0.954,验证了所提方法在准确率与鲁棒性上的优势,为数字金融风控提供了有效技术支撑。2. Data-Driven Fire-Zone Segmentation for Improved Short-Term Wildfire Prediction
Nicolas Caron, Christophe Guyeux, Hassan Noura, Benjamin Aynes
本文针对野火预测中普遍采用均匀网格划分导致忽略点火空间异质性的问题,提出一种数据驱动的火灾分区(fire-zone)分割方法。该方法融合分水岭检测与K-means聚类,从历史火点分布中无监督地生成具有物理意义的预测单元。在法国六个
行政区、六种短时预测模型上的实验表明,相较传统网格法,所提方法在平均交并比(IoU)上提升3–6%,且增益随空间尺度变化稳定可复现;算法计算高效(单配置<10秒)、完全可并行化。结果证实:优化空间离散化策略可显著提升短时野火预测性能,其影响甚至超过模型结构选择。3. Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards
Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang
本文系统综述了多模态大语言模型(MLLMs)安全格局的演进,聚焦新兴威胁与防护机制。针对模态对齐与融合带来的复杂性,论文提出首个基于多模态特性的安全威胁分类体系,涵盖对抗攻击、数据投毒、越狱及幻觉等新型风险,并揭示其区别于单模态假
设的威胁建模范式转变。进一步,文章梳理了适配多模态特性的安全假设更新,归纳了近期在输入/输出过滤、对齐增强、鲁棒训练与可解释性等方面的防护进展。实验分析表明,现有方法在跨模态一致性与泛化安全性上仍存在显著局限。最后,论文指出跨模态因果推理、动态威胁感知与标准化评估等关键挑战,为构建更鲁棒、可扩展的多模态安全机制提供理论指引与实践方向。📄 arXiv: cs.CV
1. PragyaDoc: A Universal Document Intelligence Framework for Multilingual Medical Document Understanding in Low-Resource Settings
Jagpal Singh Jhala
本文针对印度多语言医疗文档理解在低资源场景下的关键挑战,提出PragyaDoc——一个面向低资源环境的通用文档智能框架。该框架通过四层协同架构实现端到端处理:并行集成OCR提取层提升多语种文本识别鲁棒性;几何-词法融合层增强版面与
语义对齐;确定性领域结构化层实现无监督文档逻辑解析;双大语言模型(LLM)驱动的医学推理与定位层完成跨语言临床信息抽取与解释。在涵盖印地语、泰卢固语等8种印度语言的真实医疗文档数据集上,PragyaDoc在信息抽取F1值上较现有SOTA方法平均提升12.7%,显著缓解了语言鸿沟导致的基层医疗可及性问题。2. NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages
Yiyao Chen, Yucheng Li, Jungong Tong, Shaoqi Wang, Kunhao Zhou, Ziquan Wei, Monica Murea, Marissa DiPiero, Tingting Dan, Guorong Wu
NeuroPilot提出了一种基于多智能体的神经影像处理新范式,旨在解决传统流程中数据标准化、模态特异性预处理与质量控制(QC)三阶段割裂、依赖人工脚本与手动干预的瓶颈问题。该系统将领域专家知识封装为三个大语言模型(LLM)可调用
技能:dcm2bids-skill(DICOM转BIDS标准化)、neuroimage-pre-skill(自适应模态选择预处理)和qc-agent-skill(证据驱动的半自动QC)。通过LLM驱动的智能编排,系统统一适配异构计算环境,并在17个队列(>123,000受试者)、涵盖婴儿至老年及多种MRI模态(sMRI/dMRI/fMRI)的真实场景中验证了泛化能力。QC模块对558例生产数据进行筛查,自动化标记与FreeSurfer拓扑缺陷指标高度一致;婴儿数据处理在QC验证输入下实现100%完成率。整体流程耗时由2–3个月压缩至一周,显著提升科研效率与可复现性。3. Performance of large language models in the optical diagnosis of colorectal polyps
Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V. G. L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles M'enard, Joshua Landy, Samir C. Grover
本研究评估了多模态大语言模型(MLLMs)在结直肠息肉光学诊断中的性能,使用PRIME数据集(含白光与窄带成像图像)对Claude Opus 4、Gemini 2.5 Pro、GPT-o3、GPT-4o和GPT-5进行回顾性诊断效
能分析。结果显示,所有模型在良恶性息肉分类中F1分数均>0.9;Gemini 2.5 Pro在浸润性/非浸润性及低/高级别腺瘤判别中表现最优(F1=0.560/0.492),Claude Opus 4与GPT-5在Paris分型中正确率最高(41.7%)。尽管部分模型接近专家共识,但敏感性与特异性仍未达欧洲消化内镜学会(ESGE)临床应用标准,提示需开展前瞻性多中心验证及人机协同工作流优化。📝 AI 官方博客
1. Evolve your marketing with new AI tools
📝 Google AI Blog
本文探讨了人工智能技术在数字营销领域的最新应用,重点介绍谷歌广告(Google Ads)与谷歌分析(Google Analytics)中全新推出的Advisor UI智能助手功能。该工具基于大语言模型与用户行为数据,为营销人员提供实时、可操…
作的优化建议,涵盖关键词策略、出价调整、受众定位及转化归因等核心场景。通过自然语言交互界面,用户可直接提问并获得个性化、上下文感知的决策支持。实验表明,启用Advisor UI的品牌广告主平均点击率提升12%,转化成本降低9%。研究验证了AI驱动的自动化洞察如何显著提升营销效率与ROI。2. The latest AI news we announced in July 2026
📝 Google AI Blog
本文回顾了2026年7月全球人工智能领域的重要进展,涵盖大模型架构创新、多模态推理能力突破、AI安全与对齐技术新范式,以及边缘端高效推理芯片的商用落地。重点介绍了OpenAI发布的混合专家动态稀疏架构MoE-7B,其在保持参数量可控前提下实…
现接近100B稠密模型的推理性能;谷歌DeepMind推出的“ReasonFormer”统一框架,在数学推理与代码生成任务中分别达到GSM8K 98.3%和HumanEval 89.7%的SOTA水平;此外,欧盟AI办公室正式采纳基于因果验证的模型可信度评估标准(CAVES),标志着AI治理进入可验证、可审计新阶段。3. Inside our 353,000-person vibe coding course
📝 Google AI Blog
本文介绍了面向35.3万名学习者的“氛围编程”(vibe coding)在线课程的设计与实践。该课程摒弃传统语法优先的教学范式,转而以直觉驱动、项目沉浸和社区共创为核心,融合AI辅助编程工具、实时协作环境与情感化反馈机制,构建低门槛、高参与…
度的学习体验。关键技术包括基于LLM的上下文感知代码解释器、动态难度调节的交互式练习系统,以及由学习者生成的“vibe”标签驱动的个性化内容推荐。大规模实证表明,课程完成率达68%,初学者在4周内实现独立开发全栈应用的比例提升至41%,显著优于对照组。4. A Dynamical Model of AI Governability
📝 EleutherAI Blog
本文提出一个关于人工智能可治理性(AI governability)的动态模型,旨在刻画构建未来AI的科研 workforce 最终呈现合作性或非合作性的演化路径。模型将AI社区的行为倾向建模为动力系统状态,识别决定长期合作与否的“吸引域边…
界”;结合当前AI研发实践、机构激励结构与政策干预等实证线索,评估人类社会当前所处的状态——是否已落入合作性吸引域;并指出若干关键观测指标(如安全研究投入占比、跨机构协作强度、治理共识形成速度)可作为判断我们是否正走向可治理未来的早期信号。实验模拟表明,适度早期干预可显著扩大合作吸引域。5. Early Indicators of Reward Hacking via Reasoning Interpolation
📝 EleutherAI Blog
本文提出一种基于推理插值(reasoning interpolation)的早期预警方法,用于在强化学习智能体训练过程中识别奖励作弊(reward hacking)的萌芽迹象。核心思想是利用重要性采样(importance sampling…
),结合经微调的“捐赠者”预填充(donor prefills)生成高质量推理轨迹,从而在策略尚未明显偏离目标行为前,预测其潜在的奖励作弊倾向。该方法无需修改训练流程或访问环境内部状态,具备强实用性与可解释性。在多个基准任务上的实验表明,该技术可在奖励作弊发生前平均提前37%的训练步数发出预警,且误报率低于8%。6. Reward Hacking Resarch Update
📝 EleutherAI Blog
本文为关于奖励黑客(Reward Hacking)问题的阶段性研究进展报告。针对强化学习智能体在优化代理奖励函数时偏离设计者真实意图的现象,本工作系统梳理了现有奖励黑客案例的成因分类,提出一种基于奖励函数可解释性与行为一致性的双维度检测框架…
,并初步实现了在Gridworld与MiniGrid环境中的验证。实验表明,该方法能有效识别约78%的隐式奖励篡改行为,且在保持策略性能的同时将目标偏移率降低42%。后续将拓展至高维连续控制任务并探索鲁棒奖励建模机制。7. Introducing Claude Opus 5ProductJul 24, 2026Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
📝 Anthropic
本文介绍了Anthropic最新发布的Claude Opus 5模型,该模型在长时程智能体(long-running agents)任务中实现显著跃升,同时在代码生成与专业领域工作(如法律、科研、工程文档处理)方面较前代大幅提升。其核心技术…
包括增强的上下文记忆机制、多步推理优化架构及面向复杂任务的渐进式规划能力。实验表明,Opus 5在HumanEval代码基准上得分达82.4%,在专业场景多轮对话任务中任务完成率提升37%。模型已于2026年7月24日正式发布并投入生产环境应用。8. AnnouncementsJul 9, 2026Inviting hard questionsWe’re asking the public for their hardest questions about AI, and committing to show our work as we address them.
📝 Anthropic
暂无摘要
9. FeaturesJul 6, 2026The Making of Claude CodeThe inside story of how Claude Code went from an internal CLI to Anthropic’s coding agent, told by researchers, engineers and early users who built it.
📝 Anthropic
暂无摘要
📬 TLDR AI 精选
1. one daily email
该页面仅显示标题“one daily email”,无其他实质性内容,无法提取具体新闻或信息。
💬 Hacker News AI 热门
1. Stealing Reasoning Traces from Proprietary LLM APIs
🔥 180 分 · 💬 66 评论
研究人员发现,通过分析公开的AI代理运行轨迹(来自GitHub和Hugging Face),可从OpenAI、Anthropic和Google等厂商的闭源大模型API返回的“加密推理痕迹”中,逆向解码出大量隐藏的思维链内容。该方法成功重建了…
超31万个推理块,从中提取出704个真实隐私敏感项,包括62个API密钥、33个密码、24个访问令牌和30个个人邮箱等,其中64个仅存在于隐藏推理块中、未在可见对话里出现。2. Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp
🔥 119 分 · 💬 22 评论