
Seventy3
642 episodes — Page 4 of 13

【第487期】EGGROLL:基于低秩学习的大规模演化策略优化
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Evolution Strategies at the HyperscaleSummary我们提出 EGGROLL(Evolution Guided General Optimization via Low-rank Learning,基于低秩学习的进化引导通用优化),一种进化策略(Evolution Strategies,ES)算法,旨在将无需反向传播的优化方法扩展到适用于拥有数十亿参数的现代大型神经网络架构和超大规模种群规模。ES 是一类强大的黑盒优化方法,能够有效处理不可微或含噪目标函数,并可通过并行化实现良好的扩展性。然而,朴素的 ES 在大规模场景下成本极高,其瓶颈主要来自生成矩阵扰动 E∈Rm×nE∈Rm×n 所需的计算与内存开销,以及为计算每个种群成员前向传播而进行的批量矩阵乘法。EGGROLL 通过生成随机矩阵 A∈Rm×rA∈Rm×r 与 B∈Rn×rB∈Rn×r(其中 r≪min(m,n)r≪min(m,n)),并以低秩矩阵扰动 AB⊤AB⊤ 替代全秩扰动 EE,从而有效克服了上述瓶颈。由于整体参数更新是对 NN 个工作节点的结果进行平均,最终得到的更新仍然具有较高秩,但在内存与计算开销上实现了显著节省:与全秩 ES 相比,每一层的辅助存储从 mnmn 降低至 r(m+n)r(m+n),单次前向传播的计算复杂度也从 O(mn)O(mn) 降低至 O(r(m+n))O(r(m+n))。理论分析表明,该低秩更新能够以快速的 O(1/r)O(1/r) 收敛速率逼近全秩更新。实验结果显示:(1)尽管速度更快,EGGROLL 在从零开始(tabula rasa)的强化学习设置中并未牺牲 ES 的性能;(2)在提升大语言模型推理能力方面,其表现可与 GRPO 相媲美;(3)EGGROLL 使得完全基于整数数据类型运行的非线性循环语言模型实现稳定的预训练成为可能。原文链接:https://arxiv.org/abs/2511.16652

【第486期】HunyuanOCR:通用端到端视觉语言模型技术报告
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:HunyuanOCR Technical ReportSummary本文提出 HunyuanOCR,一款面向 OCR 任务的商用级、开源且轻量化(10 亿参数)视觉—语言模型(Vision-Language Model,VLM)。其架构由原生视觉 Transformer(ViT)与轻量级大语言模型(LLM)组成,并通过 MLP 适配器进行连接。HunyuanOCR 展现出卓越性能,全面超越商业 API、传统 OCR 流水线以及更大规模的模型(如 Qwen3-VL-4B)。在感知类任务(文本检测与识别、文本解析)上,其性能优于当前公开方案;在语义类任务(信息抽取、图像文本翻译)上同样表现突出,并在 ICDAR 2025 DIMT 挑战赛(小模型赛道)中获得第一名。此外,HunyuanOCR 在 OCRBench 上取得了参数规模小于 30 亿的 VLM 中的最优(SOTA)成绩。HunyuanOCR 在以下三个关键方面实现了突破: 通用性与效率的统一:在轻量化框架下,模型全面支持文本检测与识别、解析、信息抽取(IE)、视觉问答(VQA)以及翻译等核心能力,弥补了传统“专用 OCR 模型”能力单一以及“通用 VLM”效率低下的不足。 简洁的端到端架构:采用纯端到端范式,消除了对版面分析等预处理模块的依赖,从根本上解决了传统流水线中常见的误差累积问题,并显著简化了系统部署。 数据驱动与强化学习策略:验证了高质量数据在 OCR 任务中的关键作用,并首次在工业界证明,引入强化学习(Reinforcement Learning,RL)策略能够为 OCR 任务带来显著的性能提升。HunyuanOCR 已在 HuggingFace 上正式开源。同时,我们提供了基于 vLLM 的高性能部署方案,使其在生产环境中的效率跻身业界第一梯队。我们期望该模型能够推动前沿研究的发展,并为工业级应用提供坚实基础。原文链接:https://arxiv.org/abs/2511.19575

【第485期】大语言模型扩展的理论极限与约束综述
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:On the Fundamental Limits of LLMs at ScaleSummary大语言模型(Large Language Models,LLMs)从规模化发展中获得了巨大的性能提升,但这些收益最终受到五个根本性限制的约束:(1)幻觉问题,(2)上下文压缩,(3)推理能力退化,(4)检索脆弱性,以及(5)多模态失配。尽管现有综述对这些现象进行了经验性描述,但尚缺乏将其与计算、信息与学习的基础极限相联系的严格理论综合。本文通过提出一个统一的、以证明为支撑的理论框架,弥补了这一空白,系统刻画了 LLM 规模化所面临的内在理论上限。首先,可计算性与不可计算性理论表明,误差的存在不可消除:对于任何可枚举的模型族,基于对角化原理,总存在某些输入使得至少一个模型必然失败;而不可判定查询(如停机问题类型的任务)则会为所有可计算预测器诱导出无限的失败输入集合。其次,信息论与统计学约束限定了即便在可判定任务上所能达到的最高精度;有限的描述长度不可避免地引入压缩误差,而对长尾事实性知识的学习则需要极其高昂的样本复杂度。再次,几何与计算层面的效应会使长上下文在实际表示中被压缩到远低于其名义长度的规模,其原因包括位置相关训练不足、编码衰减以及 softmax 拥挤效应。此外,我们进一步表明,基于似然的训练目标更倾向于模式补全而非真正的推理;在 token 预算受限的条件下,检索过程容易受到语义漂移与耦合噪声的影响;而多模态规模化则继承了跨模态对齐较为浅层的问题。全文通过将形式化定理与经验证据相结合,系统勾勒出规模化在哪些方面能够持续带来收益、在哪些方面趋于饱和、以及在哪些方面无法再取得进展,并在此基础上提出了若干切实可行的缓解路径,例如受限预言机检索(bounded-oracle retrieval)、位置感知训练课程(positional curricula),以及稀疏或层级化注意力机制。原文链接:https://arxiv.org/abs/2511.12869

【第484期】LAMP:赋能经济决策的语言增强多智能体强化学习
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-MakingSummary经济决策不仅依赖于价格、税收等结构化信号,还深受同伴交流与媒体叙事等非结构化语言信息的影响。尽管多智能体强化学习(Multi-Agent Reinforcement Learning,MARL)在优化经济决策方面展现出潜力,但其在处理语言所固有的语义歧义性和上下文丰富性方面仍面临显著挑战。我们提出 LAMP(Language-Augmented Multi-Agent Policy,语言增强型多智能体策略) 框架,将语言系统性地融入经济决策过程,从而缩小与真实世界场景之间的差距。LAMP 采用 Think–Speak–Decide(思考–表达–决策) 的流水线式架构: Think(思考):对数值型观测进行解释,提取短期冲击与长期趋势,并缓存高价值的推理轨迹; Speak(表达):基于推理结果生成并交换策略性语言信息,通过解析同伴通信来更新自身信念; Decide(决策):将数值数据、推理过程及反思信息进行融合,形成 MARL 策略,以优化语言增强条件下的决策行为。在经济仿真实验中,LAMP 在多项指标上均显著优于传统 MARL 方法和仅依赖大语言模型(LLM-only)的基线方法,包括累计回报(分别提升 63.5% 与 34.0%)、鲁棒性(分别提升 18.8% 与 59.4%)以及可解释性。这些结果表明,语言增强型策略在构建更加高效且稳健的经济决策方案方面具有显著潜力。原文链接:https://arxiv.org/abs/2511.12876

【第483期】Seer:面向同步大型语言模型强化学习的在线上下文学习系统
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Seer: Online Context Learning for Fast Synchronous LLM Reinforcement LearningSummary强化学习(Reinforcement Learning,RL)已成为推动现代大语言模型(Large Language Models,LLMs)发展的关键技术。然而,现有的同步式 RL 系统面临严重的性能瓶颈。占据端到端迭代时间主要部分的 rollout 阶段,由于固有的工作负载不均衡,存在显著的长尾时延以及资源利用率低下的问题。我们提出了 Seer,一种新颖的在线上下文学习系统,通过挖掘此前被忽视的特性来应对上述挑战:对于共享相同提示(prompt)的请求,其输出长度和生成模式之间往往具有高度相似性。基于这一观察,Seer 引入了三项关键技术:用于动态负载均衡的分割式 rollout、上下文感知调度,以及自适应的分组推测解码(speculative decoding)。这些机制协同作用,在 rollout 过程中显著降低了长尾时延并提升了资源效率。在生产级 RL 工作负载上的评测结果表明,与当前最先进的同步 RL 系统相比,Seer 将端到端 rollout 吞吐量提升了 74% 至 97%,同时将长尾时延降低了 75% 至 93%,从而显著加速了 RL 训练迭代。原文链接:https://arxiv.org/abs/2511.14617

【第482期】SAM3:Segment Anything with Concepts
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:SAM 3: Segment Anything with ConceptsSummary我们提出了 Segment Anything Model(SAM)3,这是一种统一模型,能够基于概念提示在图像和视频中进行目标检测、分割与跟踪。我们将概念提示定义为:简短的名词短语(例如“黄色校车”)、图像示例,或二者的组合。可提示概念分割(Promptable Concept Segmentation,PCS)以此类提示为输入,输出所有匹配目标实例的分割掩码及其唯一身份标识。为推动 PCS 的发展,我们构建了一个可扩展的数据引擎,生成了一个高质量数据集,涵盖图像和视频中的 400 万个独特概念标签,并包含具有挑战性的负样本。我们的模型由图像级检测器和基于记忆的视频跟踪器组成,二者共享同一个主干网络。通过引入存在性头(presence head),实现了识别与定位的解耦,从而提升了检测精度。在图像和视频 PCS 任务上,SAM 3 的准确率均达到现有系统的两倍,同时也在视觉分割任务上显著提升了以往 SAM 的能力。我们对 SAM 3 以及全新的 Segment Anything with Concepts(SA-Co) 基准数据集进行了开源,用于可提示概念分割研究。原文链接:https://arxiv.org/abs/2511.16719

【第481期】GPT-5已成科研共同作者
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Early science acceleration experiments with GPT-5Summary像 GPT-5 这样的 AI 模型正日益成为科学家的一项重要工具,但仍有许多人尚未充分了解前沿 AI 的能力。我们展示了一组简短的案例研究,说明 GPT-5 如何在数学、物理学、天文学、计算机科学、生物学以及材料科学等多个领域的持续研究中,提出了新的、具体的研究推进步骤。在这些案例中,作者既强调了 AI 如何加速了他们的工作,也指出了其不足之处;既说明了在哪些环节节省了专家时间,也明确了哪些地方仍然离不开人类的关键投入。我们记录了人类作者与 GPT-5 的交互过程,作为与 AI 进行高效协作的示范性案例。值得注意的是,本文包含了四项新的数学结果(均由人类作者进行了严格验证),这凸显了 GPT-5 在帮助人类数学家解决此前未解问题方面的潜力。尽管这些成果在规模上相对有限,但鉴于前沿 AI 的发展速度,其所蕴含的意义却十分深远。原文链接:https://arxiv.org/abs/2511.16072

【第480期】AsyncThink:学习组织语言模型的智能体协作AI
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:The Era of Agentic Organization: Learning to Organize with Language ModelsSummary我们设想一个全新的 AI 时代,称为智能体化组织(agentic organization):多个智能体通过协作与并发工作来解决复杂问题,从而实现超越单一智能体能力的结果。为实现这一愿景,我们提出了一种新的大语言模型推理范式——异步思考(Asynchronous Thinking,AsyncThink),其核心思想是将内部思考过程组织为可并发执行的结构。具体而言,我们提出了一种思考协议:由一个组织者(organizer)动态地将子查询分配给多个工作者(workers),整合中间知识,并生成连贯一致的最终解答。更重要的是,该协议中的思考结构还可以通过强化学习进一步优化。实验结果表明,与并行思考(parallel thinking)相比,AsyncThink 在数学推理任务中不仅将推理延迟降低了 28%,还同时提升了准确率。此外,AsyncThink 能够将其学到的异步思考能力进行泛化,在无需额外训练的情况下,有效应对未见过的新任务。原文链接:https://arxiv.org/abs/2510.26658

【第479期】AlphaProof:深度强化学习形式化数学证明
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Olympiad-level formal mathematical reasoning with reinforcement learningSummary人工智能的一个长期目标,是构建能够在广阔领域中进行复杂推理的系统,而数学正是这一目标的典型代表:它拥有无穷无尽的概念,并且要求严格的形式化证明。近年来的 AI 系统往往依赖人工生成的数据,通常缺乏形式化验证,因此难以保证推理结果的正确性。相比之下,诸如 Lean¹ 这样的形式化语言提供了一个能够将推理过程严格锚定的交互式环境,而强化学习(RL)则为在此类环境中进行学习提供了有效机制。我们提出了 AlphaProof,一个受 AlphaZero² 启发的智能体,通过在数百万道自动形式化的问题上进行强化学习训练,学会寻找形式化证明。对于最困难的问题,AlphaProof 采用了一种称为“测试时强化学习”(Test-Time RL)的方法:在推理阶段生成并从数百万个相关问题变体中进行学习,从而实现深度的、针对具体问题的自适应能力。AlphaProof 在历史数学竞赛题目上显著超越了当前最先进的方法。在 2024 年国际数学奥林匹克(IMO)竞赛中,以 AlphaProof 作为核心推理引擎的 AI 系统成功解出了五道非几何题中的三道,其中包括本届竞赛中最困难的一题。结合 AlphaGeometry 2³,该系统在多天计算资源支持下取得了相当于银牌得主的成绩,这也标志着 AI 系统首次达到任何奖牌级别的表现。我们的工作表明,在有坚实约束的环境中进行大规模经验学习,能够产生具备复杂数学推理策略的智能体,为构建可靠的复杂数学问题求解型 AI 工具铺平了道路。原文链接:https://www.nature.com/articles/s41586-025-09833-y

【第478期】Intelligence Per Watt:本地人工智能的智能功耗效率测量
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Intelligence per Watt: Measuring Intelligence Efficiency of Local AISummary大语言模型(LLM)的查询目前主要由集中式云基础设施上的前沿模型来处理。需求的快速增长正在给这一范式带来压力,云服务提供商也难以按同样的速度扩展其基础设施。两项进展使我们能够重新思考这一范式:其一,小型语言模型(≤200 亿活跃参数)如今在许多任务上已能达到与前沿模型相当的性能;其二,本地加速器(如 Apple M4 Max)能够以交互式延迟运行这些模型。这引出了一个问题:本地推理是否能够可行地将需求从集中式基础设施中重新分配出来?要回答这一问题,需要衡量本地语言模型是否能够准确回答真实世界的查询,以及它们在受功耗约束的设备(即笔记本电脑)上是否具备足够的效率以实现实际应用。我们提出“每瓦智能”(Intelligence Per Watt,IPW)这一指标,即任务准确率除以单位功耗,用于评估不同模型–加速器组合下本地推理的能力与效率。我们开展了一项大规模实证研究,覆盖 20 余个最先进的本地语言模型、8 种加速器,以及一组具有代表性的 LLM 流量:100 万条真实世界的单轮聊天与推理查询。对于每一条查询,我们测量其准确率、能耗、延迟和功率。分析结果揭示了三点发现。第一,本地语言模型能够准确回答 88.7% 的单轮聊天与推理查询,且准确率因应用领域而异。第二,在 2023–2025 年间,IPW 提升了 5.3 倍,本地查询覆盖率从 23.2% 提高到 71.3%。第三,在运行相同模型的情况下,本地加速器的 IPW 至少比云端加速器低 1.4 倍,显示出显著的优化空间。这些发现表明,本地推理能够在实质上将需求从集中式基础设施中重新分配出来,而 IPW 是衡量和跟踪这一转变的关键指标。我们同时发布了 IPW 性能分析工具,用于系统化的“每瓦智能”基准测试。原文链接:https://arxiv.org/abs/2511.07885

【第477期】代码大语言模型:训练、评估与应用
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:From Code Foundation Models to Agents and Applications: A Practical Guide to Code IntelligenceSummary大型语言模型(LLMs)通过实现自然语言描述到功能性代码的直接转换,已经从根本上改变了自动化软件开发,并通过 GitHub Copilot(微软)、Cursor(Anysphere)、Trae(字节跳动)以及 Claude Code(Anthropic)等工具驱动了商业落地。该领域从基于规则的系统演进到基于 Transformer 的架构,性能在基准测试(如 HumanEval)上从个位数成功率提升至超过 95%。在本研究中,我们对代码 LLM 进行系统性的综述与实践指南(涵盖一系列分析性与探测性实验),全面考察从数据筛选、预训练到后训练阶段的完整模型生命周期,包括高级提示范式、代码预训练、监督微调、强化学习以及自主编程代理。我们分析了通用 LLM(GPT-4、Claude、LLaMA)与代码专用 LLM(StarCoder、Code LLaMA、DeepSeek-Coder、QwenCoder)的代码能力,并对其技术、设计选择与权衡进行了批判性审视。此外,我们明确了学术研究(如基准测试与任务)与真实世界部署(如软件相关代码任务)之间的差距,包括代码正确性、安全性、大规模代码库的上下文理解,以及与开发工作流的整合,并将具潜力的研究方向映射到实际需求。最后,我们开展了一系列实验,对代码预训练、监督微调与强化学习进行了全面分析,涵盖缩放律、框架选择、超参数敏感性、模型架构以及数据集对比等方面。原文链接:https://arxiv.org/abs/2511.18538

【第476期】多智能体经济:A2A协议增强与微支付
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Towards Multi-Agent Economies: Enhancing the A2A Protocol with Ledger-Anchored Identities and x402 Micropayments for AI AgentsSummary本研究文章提出了一种全新的架构,通过解决新兴的 Agent2Agent(A2A)通信协议的两项关键限制——去中心化的代理可发现性与代理间小额支付(micropayments)——从而增强多代理经济系统的能力。通过集成分布式账本技术(DLT),该架构使代理卡(AgentCards)能够作为智能合约在链上进行防篡改发布,从而提供安全且可验证的代理身份。该架构进一步通过 x402 开放标准扩展 A2A,利用 HTTP 402 状态码实现区块链无关的、基于 HTTP 的小额支付机制。由此,自治代理能够跨越组织边界,实现无缝的发现、认证和支付。本研究同时给出了全面的技术实现与评估,验证了基于 DLT 的代理发现与小额支付机制的可行性。所提出的方法为安全、可扩展且具有经济可行性的多代理生态系统奠定基础,推动代理型人工智能在可信的自治经济交互方向持续发展。原文链接:https://arxiv.org/abs/2507.19550

【第475期】bBoN:让AI操作赶上人
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:The Unreasonable Effectiveness of Scaling Agents for Computer UseSummary计算机使用代理(CUAs)在自动化日常数字任务方面具有潜力,但其不稳定性和高方差阻碍了其在长时程、复杂任务中的应用。我们提出 Behavior Best-of-N(bBoN),一种通过生成多条 rollout 并使用描述代理行为的行为叙事对其进行选择,从而实现对代理进行可扩展性的方式。该方法同时支持广泛探索与基于原理的轨迹选择,显著提升了鲁棒性和成功率。在 OSWorld 上,我们的 bBoN 扩展方法达成了新的 SOTA(State of the Art):69.9%,显著优于先前方法,并接近 72% 的人类水平表现。全面的消融实验验证了关键设计选择的有效性。我们进一步在 WindowsAgentArena和 AndroidWorld 上展示了对不同操作系统的强泛化性能。关键在于,我们的结果强调:当方法得当时,对 CUAs 的扩展具有“非合理的有效性”。有效的扩展需要对轨迹进行结构化理解与选择,而 bBoN 提供了一个实现这一点的实用框架。原文链接:https://arxiv.org/abs/2510.02250

【第474期】苹果SALT:如何用笨老师教出顶尖AI
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Rethinking JEPA: Compute-Efficient Video SSL with Frozen TeachersSummary视频联合嵌入预测架构(Video Joint Embedding Predictive Architectures, V-JEPA)通过在潜在空间中预测被遮蔽的区域、并采用指数移动平均(EMA)更新的教师网络,来学习可泛化的现成视频表征。尽管 EMA 能避免表征坍缩,但它使得大规模模型选择更加复杂,并使教师与学生的架构耦合在一起。我们重新审视了掩码潜在预测,并证明冻结教师即可满足需求。具体而言,我们:(i)使用简单的像素重建目标在 V-JEPA 的掩码机制下训练一个目标编码器作为教师;然后(ii)将该教师冻结,并训练一个学生来预测教师在被遮蔽区域的潜在表示。由此形成了一个两阶段、无正则化的训练方案,我们称之为 SALT(Static-teacher Asymmetric Latent Training,静态教师的非对称潜在训练)。SALT 将优化过程解耦为像素重建(教师)与掩码潜在预测(学生),提升了透明性、效率与可扩展性,同时保持了冻结评估条件下的表征泛化能力。在实证层面,我们的学生模型在冻结骨干网络评估中,跨多个基准任务优于最新提出的 V-JEPA 2 编码器。同时,它们在计算上更为高效:在相同的预训练 FLOPs 下,我们的方法实现了更高的 probing 精度,其 scaling 曲线在精度-FLOPs 的帕累托前沿上全面优于 V-JEPA。最后,我们发现学生模型的性能对教师质量具有显著鲁棒性:即便教师较小且次优,高性能的学生仍能涌现。这表明在计算预算分配上应大幅度偏向学生阶段。这些结果说明,SALT 是一种相较于基于 EMA 的自蒸馏机制更为简单、可扩展且计算高效的视频表征学习替代方案。原文链接:https://arxiv.org/abs/2509.24317

【第473期】DeepSeek稀疏注意力提升长上下文效率
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:DeepSeek-V3.2-Exp: Boosting Long-Context Efficiency with DeepSeek Sparse AttentionSummary我们介绍 DeepSeek-V3.2,这一模型在高计算效率与卓越的推理及智能体性能之间实现了协调统一。DeepSeek-V3.2 的关键技术突破包括:(1) DeepSeek 稀疏注意力机制(DSA):我们提出 DSA,这是一种高效的注意力机制,在长上下文场景中显著降低计算复杂度,同时保持模型性能。(2) 可扩展强化学习框架:通过实施稳健的强化学习协议并扩展后训练(post-training)计算规模,DeepSeek-V3.2 的表现可与 GPT-5 比肩。值得注意的是,我们的高计算版本 DeepSeek-V3.2-Speciale 超越了 GPT-5,并展现出可与 Gemini-3.0-Pro 比拟的推理能力,在 2025 年国际数学奥林匹克竞赛(IMO)和国际信息学奥林匹克竞赛(IOI)中均达到了金牌水平。(3) 大规模智能体任务合成管线:为将推理能力融入工具使用场景,我们构建了一种全新的合成管线,可系统化、大规模生成训练数据。该方法支持可扩展的智能体后训练,使模型在复杂互动环境中的泛化能力和指令跟随稳健性均获得显著提升。原文链接:https://arxiv.org/abs/2512.02556

【第472期】LLM-JEPA:大语言模型联结嵌入预测架构
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:LLM-JEPA: Large Language Models Meet Joint Embedding Predictive ArchitecturesSummary大型语言模型(LLM)的预训练、微调与评测依赖于输入空间的重建与生成能力。然而,在计算机视觉领域已有观察表明,基于嵌入空间的训练目标(例如联合嵌入预测架构,Joint Embedding Predictive Architectures, JEPAs)远优于基于输入空间的方法。语言与视觉在训练方式上的这种差异引出了一个自然的问题:语言模型的训练方法是否能够从视觉模型中借鉴一些技巧?缺乏 JEPA 风格的 LLM 本身证明了为语言设计此类目标的困难。在本研究中,我们朝这一方向迈出了第一步,提出了 LLM-JEPA,一种基于 JEPA 的解决方案,可应用于 LLM 的微调与预训练。到目前为止,LLM-JEPA 在多个模型上显著优于标准的 LLM 训练目标,并且对过拟合表现出稳健性。这些结果已在多个数据集(NL-RX、GSM8K、Spider、RottenTomatoes)以及来自 Llama3、OpenELM、Gemma2 和 Olmo 系列的多种模型上得到验证。代码:this https URL。原文链接:https://arxiv.org/abs/2509.14252

【第471期】AI当同事:为什么我的AI你不许碰
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Collaborative Document Editing with Multiple Users and AI AgentsSummary当前的人工智能写作支持工具主要面向个人设计,这使得协作变得复杂:共同作者需要离开共享写作空间以使用 AI,然后再沟通并重新整合结果。我们提出将 AI 代理直接集成到协同写作环境中。我们的原型通过两个新的共享对象——代理配置文件和任务——使 AI 的使用变得透明且可定制。代理的回应以熟悉的评论功能呈现。在一项用户研究中(N=30),14 个团队在一周时间内开展写作项目。交互日志和访谈显示,各团队将代理纳入其现有的作者身份、控制和协调规范之中,而不是将代理视为团队成员。代理配置文件被视为个人领地,而创建的代理和其产出则成为共享资源。我们讨论了面向团队的 AI 交互的相关启示,强调了在协同工作中将 AI 视为共享资源的机会和边界。原文链接:https://arxiv.org/abs/2509.11826

【第470期】上下文学习:脆弱的统计学家
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Is In-Context Learning Learning?SummaryIn-context learning(ICL) 使某些自回归模型能够通过下一 token 预测来解决任务,而无需进一步训练。这导致了一个常见论断:这些模型能够在提示中仅通过少量示例(few-shot exemplars)就解决(学习)未见过的任务。然而,推理能力并不必然意味着学习,因为 ICL 并不会显式编码给定的观测数据;相反,模型依赖其已有的先验知识以及(若存在)提示中的示例。我们提出,从数学角度来看,ICL 的确构成一种学习方式,但其完整特征化仍需依赖实证研究。为此,我们开展了大规模 ICL 分析,通过消除或控制记忆效应、预训练影响、分布偏移、提示风格和措辞方式等因素进行系统实验。我们发现,ICL 是一种有效的学习范式,但在学习和泛化到未见任务方面具有明显局限性。值得注意的是,当示例数量趋于增多时,模型的准确率对示例分布、模型类型、提示风格以及输入的语言特征变得不敏感。相反,模型会从提示中的规律性中推断模式,这导致显著的分布敏感性,特别是在 chain-of-thought 等提示风格中尤为明显。鉴于模型在形式上类似的任务中表现出截然不同的准确率,我们得出结论:自回归模型的临时式(ad-hoc)编码机制并不稳健,并暗示其通用泛化能力有限。原文链接:https://arxiv.org/abs/2509.10414

【第469期】K2-Think:小模型的大推理能力
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:K2-Think: A Parameter-Efficient Reasoning SystemSummaryK2-Think 是一个推理系统,在 32B 参数规模下实现了 SOTA 表现,达到或超过诸如 GPT-OSS 120B 和 DeepSeek v3.1 等更大模型的水平。基于 Qwen2.5 基座模型构建,我们的系统展示出:通过结合先进的后训练技术与测试阶段的计算优化,小型模型同样能够在高性能推理任务中竞争。这一方法基于六个关键技术支柱:长链路思维(Chain-of-thought)监督微调、可验证奖励的强化学习(RLVR)、推理前的代理式规划、测试时扩展(Test-time Scaling)、推测式解码(Speculative Decoding)、以及推理优化硬件,全部依托公开的开源数据集。K2-Think 在数学推理方面表现突出,在开源模型的公共基准上取得了 SOTA 成绩,同时在代码和科学等其他领域也表现强劲。我们的结果证实,像 K2-Think 32B 这样参数更高效的模型,能够通过包含长链路思维训练与战略性推理阶段增强的综合后训练方案,与最先进系统竞争,使开源推理系统更加易用且具成本效益。K2-Think 已免费开放获取,可通过 Cerebras Wafer-Scale Engine 实现每个请求超过 2,000 tokens/s 的顶级推理速度。原文链接:https://arxiv.org/abs/2509.07604

【第468期】LiveMCP-101:多步工具调用的基准测试与分析
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging QueriesSummary工具调用已成为 AI 代理与现实世界交互并解决复杂任务的一项关键能力。尽管 Model Context Protocol(MCP)提供了一个强大的标准化工具集成框架,但在基准测试方面仍存在显著缺口:缺乏能够评估 AI 代理在真实、动态情境中利用多样 MCP 工具有效完成多步骤任务的能力衡量体系。在这项工作中,我们提出了 LiveMCP-101,一个包含 101 个经过精心筛选的真实世界查询的基准测试集。这些查询经过迭代的 LLM 重写与人工审查,要求协调使用多种 MCP 工具,包括网页搜索、文件操作、数学推理和数据分析。此外,我们引入了一种新的评估方法:利用真实执行计划而非原始 API 输出,以更好地反映真实环境不断变化的特性。实验表明,即使是最前沿的 LLM,其成功率也不足 60%,凸显了工具编排方面的重大挑战。详尽的消融实验与错误分析进一步揭示了不同的失败模式和 token 使用低效等问题,为提升现有模型的能力提供了具体方向。LiveMCP-101 为评估真实世界代理能力设定了严格标准,推动了朝向能够通过工具使用可靠执行复杂任务的自主 AI 系统的发展。原文链接:https://arxiv.org/abs/2508.15760

【第467期】强化学习中LLM的层次推理与HICRA
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Emergent Hierarchical Reasoning in LLMs through Reinforcement LearningSummary强化学习(Reinforcement Learning, RL)已被证明在提升大型语言模型(LLM)的复杂推理能力方面非常有效,但其成功背后的内在机制仍然大多不透明。我们的分析揭示,诸如“顿悟时刻”(aha moments)、“长度扩展”(length-scaling)以及熵动态等令人困惑的现象,并非彼此孤立,而是一个新兴推理层级结构的标志,类似于人类认知中高层次战略规划与低层次程序执行之间的分离。我们揭示了一个引人注目的两阶段动态:在初始阶段,模型受制于程序正确性,必须提升其低层技能;随后学习瓶颈发生决定性转移,性能提升主要由对高层战略规划的探索与掌握驱动。这一洞见暴露了现有 RL 算法(如 GRPO)中的核心低效性:它们以一种与层次无关的方式施加优化压力,使得学习信号在所有 token 间被稀释。为解决这一问题,我们提出了 Hierarchy-Aware Credit Assignment(HICRA),一种将优化努力集中在高影响力规划 token 上的算法。我们的大量实验证实了 HICRA 显著优于强基线方法,并通过战略性探索的视角,对推理能力如何进步提供了深刻洞察。原文链接:https://arxiv.org/abs/2509.03646

【第466期】AI自我进化_三定律与活组织
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:A Comprehensive Survey of Self-Evolving AI AgentsSummary大型语言模型的最新进展引发了人们对能够解决复杂现实任务的 AI 智能体的广泛兴趣。然而,大多数现有的智能体系统依赖于人工设计的配置,这些配置在部署后保持静态,限制了其在动态和不断演化的环境中进行适应的能力。为此,近期研究探索了智能体进化技术,旨在基于交互数据和环境反馈自动增强智能体系统。这一新兴方向为自进化 AI 智能体奠定了基础,它将基础模型的静态能力与终身智能体系统所需的持续适应能力结合起来。在本综述中,我们对现有的自进化智能体系统技术进行了全面审查。具体而言,我们首先提出了一个统一的概念框架,用于抽象自进化智能体系统设计背后的反馈循环。该框架强调四个关键组成部分:系统输入、智能体系统、环境和优化器,为理解和比较不同策略提供了基础。在此框架基础上,我们系统性地回顾了针对智能体系统不同组件的一系列自进化技术。我们还考察了为特定领域(如生物医学、编程和金融)开发的领域专属进化策略,这些策略的优化目标与领域约束紧密耦合。此外,我们对自进化智能体系统的评估、安全性和伦理考量进行了专门讨论,这些因素对于确保其有效性和可靠性至关重要。本综述旨在为研究人员和实践者提供对自进化 AI 智能体的系统性理解,为构建更加适应性强、自主化和持续进化的智能体系统奠定基础。原文链接:https://arxiv.org/abs/2508.07407

【第465期】AI如何“心算”:隐性推理三大范式
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Implicit Reasoning in Large Language Models: A Comprehensive SurveySummary大型语言模型(LLMs)已经在广泛任务上展现出强大的泛化能力。利用 LLMs 进行推理对于解决多步骤问题和复杂决策至关重要。为了支持高效推理,近期研究已从显式的思维链提示转向隐式推理,在隐式推理中,推理过程通过潜在结构在内部静默地发生,而不输出中间的文本步骤。隐式推理带来了诸多优势,包括更低的生成成本、更快的推理速度,以及与内部计算更好的对齐。尽管先前的综述已在推理背景下讨论过潜在表示,但尚缺乏对推理如何在 LLMs 内部展开的专门化、机制层面的系统考察。本综述通过引入一个以执行范式为核心的分类体系填补了这一空白,将关注点从表示形式转移到计算策略上。我们根据 内部计算如何以及在何处展开 将现有方法组织为三类执行范式:潜在优化、信号引导控制和层级循环执行。我们还回顾了支持 LLMs 中存在隐式推理的结构性、行为性和基于表示的证据。此外,我们提供了对现有工作中用于评估隐式推理的有效性与可靠性的评价指标和基准的系统性概述。我们在以下地址持续更新该项目:this https URL.原文链接:https://arxiv.org/abs/2509.02350

【第464期】视觉故事写作:可视化编辑叙事文本
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Visual Story-Writing: Writing by Manipulating Visual Representations of StoriesSummary我们将“视觉化故事写作”定义为:利用故事要素的视觉表示来支持叙事文本的写作与修改。为展示这一方法,我们开发了一款文本编辑器,能够自动将实体之间的交互关系、实体在不同地点之间的移动,以及故事事件的时间线进行图形化呈现。与这些可视化内容进行交互会产生相应的文本编辑建议:例如,在图中连接两个角色会在文本中生成他们之间的一次互动;移动某个实体会更新其所描述的位置;重新排列时间线上的事件则会重组叙事的顺序。通过两项关于叙事文本编辑与写作的用户研究,我们发现,可视化方式在支持参与者进行高层次修订规划、跟踪故事要素以及探索故事变体方面具有显著作用,并且能够以促进创造力的方式发挥效果。总体而言,我们的工作为写作支持奠定了基础,这种支持不仅依赖文字,也同样依赖视觉形式。原文链接:https://arxiv.org/abs/2410.07486

【第463期】(NVIDIA)UDR:AI研究告别黑箱_人类制定策略
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Universal Deep Research: Bring Your Own Model and StrategySummary深度研究工具是当今最具影响力、也最为常见的代理型系统之一。然而,我们观察到,迄今为止提出的每一种深度研究代理都被硬编码为执行某一种特定的研究策略,并且使用的是固定的一组工具。我们提出了通用深度研究(Universal Deep Research,UDR),这是一种通用型代理系统,可以封装在任何语言模型之上,使用户无需进行任何额外的训练或微调,就能够创建、编辑并不断完善完全自定义的深度研究策略。为展示该系统的通用性,我们为 UDR 配备了示例性的最小化、扩展型和高强度研究策略,并提供了一个用户界面,以便用户对系统进行实验和探索。原文链接:https://arxiv.org/abs/2509.00244

【第462期】Fhevm:全同态加密机密智能合约协议
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Fhevm: A cross-chain protocol for confidential smart contractsSummaryZama 的 fhEVM 是一种跨链协议,利用全同态加密(Fully Homomorphic Encryption,FHE)在任何 L1 和 L2 上实现机密智能合约。它为链上应用提供端到端加密,在保证机密性与隐私性的同时,仍然保持完全的可组合性、可验证性以及无许可特性。fhEVM 通过协处理器来执行高开销的 FHE 计算,使用门限多方计算(threshold MPC)来保障解密密钥的安全,并配套一组可部署在 Rollup 或 L1 上的智能合约,用于协调和编排各个不同的系统组件。原文链接:https://github.com/zama-ai/fhevm/blob/main/fhevm-whitepaper.pdf

【第461期】AI科学家如何独立完成颠覆性科研发现
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:From AI for Science to Agentic Science: A Survey on Autonomous Scientific DiscoverySummary人工智能(AI)正在重塑科学发现的方式,其角色正从专用的计算工具演进为自主的科研合作伙伴。我们将 Agentic Science(具身智能科学/代理型科学) 定位为“科学中的人工智能(AI for Science)”这一更大范式中的关键发展阶段,在这一阶段,AI 系统从部分辅助逐步走向具备完整科学主体性的自主体。得益于大语言模型(LLMs)、多模态系统以及集成化科研平台,代理型 AI 已展现出在假设生成、实验设计、实验执行、结果分析以及迭代优化等方面的能力——这些行为过去被普遍认为是人类科学家的独有特征。本文综述以领域为导向,系统回顾了生命科学、化学、材料科学和物理学中自主科学发现的研究进展。我们通过一个综合性框架,统一了此前相对割裂的三种视角——以流程为导向、以自主性为导向以及以机制为导向——将基础能力、核心过程与具体领域实现有机衔接。在此框架基础上,本文进一步:(i)梳理了 AI for Science 的演进历程;(ii)识别了支撑科学主体性的五项核心能力;(iii)将科学发现建模为一个动态的四阶段工作流程;(iv)综述了上述多个学科领域中的应用实例;以及(v)综合分析了关键挑战与未来机遇。本研究构建了一个面向领域的自主科学发现综合视角,并将 Agentic Science 定位为推动 AI 驱动科研发展的结构化范式。原文链接:https://arxiv.org/abs/2508.14111

【第460期】Memento:无须微调大模型的LLM智能体记忆学习范式
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Memento: Fine-tuning LLM Agents without Fine-tuning LLMsSummary本文提出了一种用于自适应大型语言模型(LLM)智能体的全新学习范式,该范式无需对底层 LLM 进行微调。现有方法往往存在两类局限:要么依赖静态、人工设计的反思工作流,灵活性不足;要么计算成本高昂,需要对 LLM 模型参数进行梯度更新。相比之下,我们的方法通过基于记忆的在线强化学习,实现了低成本的持续自适应。我们将该过程形式化为一种记忆增强的马尔可夫决策过程(Memory-augmented Markov Decision Process,M-MDP),并引入一个神经化的案例选择策略来指导行动决策。历史经验被存储在情景记忆中,该记忆既可以是可微的,也可以是非参数化的。策略通过一种记忆重写机制,基于环境反馈持续更新;而策略改进则通过高效的记忆读取(检索)来实现。我们在深度研究(deep research)场景中实例化了该智能体模型,命名为 Memento。该模型在 GAIA 验证集上取得了第一名(Pass@3 为 87.88%),在测试集上达到 79.40%。在 DeepResearcher 数据集上,其 F1 值为 66.6%,PM 为 80.4%,超过了当前最先进的基于训练的方法;同时,基于案例的记忆机制在分布外任务上带来了 4.7% 至 9.6% 的绝对性能提升。总体而言,我们的方法为构建具备持续、实时学习能力且无需梯度更新的通用型 LLM 智能体提供了一条可扩展且高效的路径,推动了机器学习在开放式技能获取和深度研究场景中的发展。代码已在上述 HTTPS 链接中公开。原文链接:https://arxiv.org/abs/2508.16153

【第459期】Anemoi:基于A2A通信的半中心化多智能体系统
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Anemoi: A Semi-Centralized Multi-agent System Based on Agent-to-Agent Communication MCP server from Coral ProtocolSummary近年来,通用型多智能体系统(Multi-Agent Systems,MAS)的研究进展主要遵循“上下文工程 + 集中式”的范式,即由一个规划智能体通过单向提示传递来协调多个执行智能体。尽管在规划智能体能力较强时该设计较为有效,但其存在两个关键局限:(1)对规划智能体能力的高度依赖,当规划智能体由规模较小的语言模型(LLM)驱动时,系统性能会显著下降;(2)智能体之间的通信受限,协作主要依赖提示的简单拼接,而非通过结构化讨论实现真正的结果细化与改进。为应对上述挑战,我们提出了 Anemoi——一种基于 Coral Protocol 的 Agent-to-Agent(A2A)通信 MCP 服务器构建的半集中式多智能体系统。与传统设计不同,Anemoi 支持结构化且直接的智能体间协作,使所有智能体能够实时监控任务进展、评估阶段性结果、识别瓶颈并提出改进建议。该范式降低了对单一规划智能体的依赖,支持自适应的计划更新,并减少了冗余的上下文传递,从而实现更具可扩展性的执行过程。在 GAIA 基准测试上的评估结果表明,当使用小规模 LLM(GPT-4.1-mini)作为规划智能体时,Anemoi 取得了 52.73% 的准确率;在相同 LLM 设置下,该成绩相比最强的开源基线 OWL(43.63%)提升了 9.09 个百分点。我们的实现已在上述 https URL 上公开发布。原文链接:https://arxiv.org/abs/2508.17068

【第458期】OPENCUA:开放式计算机使用代理框架
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:OPENCUA: Open Foundations for Computer-Use AgentsSummary视觉—语言模型已展示出作为计算机使用代理(Computer-Use Agents,CUAs)的卓越能力,能够自动化完成多种计算机任务。随着其商业潜力不断提升,最先进的 CUA 系统的关键技术细节仍然处于封闭状态。鉴于这类代理将日益在数字交互中充当中介,并代表我们执行具有重要影响的决策,研究社区亟需开放的 CUA 框架,以系统性地研究其能力、局限性与潜在风险。为弥补这一缺口,我们提出了 OpenCUA,一个用于扩展 CUA 数据与基础模型的综合性开源框架。该框架包括以下三项核心组成部分:(1)一个标注基础设施,能够无缝捕获人类的计算机使用示范;(2)AgentNet,这是首个大规模计算机使用任务数据集,覆盖 3 种操作系统以及 200 余个应用程序和网站;(3)一个可扩展的数据处理流水线,将示范转化为状态—动作对,并引入具有反思性的长链式思维(Chain-of-Thought)推理,从而在数据规模扩大时持续带来稳健的性能提升。我们的端到端代理模型在多项 CUA 基准测试中表现出强劲性能。尤其是,OpenCUA-72B 在 OSWorld-Verified 上取得了 45.0% 的平均成功率,在开源模型中建立了新的最优性能(SOTA)。进一步分析表明,该方法在跨领域场景中具有良好的泛化能力,并且能够显著受益于测试阶段计算量的增加。我们已公开发布标注工具、数据集、代码及模型,以构建开放基础,推动后续 CUA 研究的发展。原文链接:https://arxiv.org/abs/2508.09123

【第457期】清华智谱破壁AI操作电脑三大难题
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use AgentsSummary我们提出了 ComputerRL——一个面向自主桌面智能的框架,使智能体能够熟练地操作复杂的数字化工作空间。ComputerRL 引入了 API-GUI 范式,将程序化的 API 调用与直接的 GUI 交互统一起来,从而解决机器智能体与以人为中心的桌面环境之间固有的不匹配问题。为了在多样化的桌面任务上实现能力提升与泛化,端到端强化学习(RL)的规模化训练至关重要;然而,由于环境效率低下以及长时间训练过程中的不稳定性,这一目标仍然面临诸多挑战。为支持可扩展且稳健的训练,我们构建了一套分布式强化学习基础设施,能够调度数千个并行的虚拟桌面环境,从而加速大规模在线强化学习。此外,我们提出了一种名为 Entropulse 的训练策略,通过在强化学习与监督微调之间交替训练,有效缓解了长时间训练过程中出现的熵坍塌问题。我们将 ComputerRL 应用于开源模型 GLM-4-9B-0414 和 GLM-4.1V-9B-Thinking,并在 OSWorld 基准上进行了评测。结果表明,AutoGLM-OS-9B 达到了 48.9% 的新 SOTA 准确率,显著提升了通用智能体在桌面自动化任务中的表现。我们的代码以及新的 OfficeWorld 基准测试已在所述 https 链接中公开。该算法与框架也已被用于构建 AutoGLM(Liu 等,2024b)。原文链接:https://arxiv.org/abs/2508.14040

【第456期】OPPO如何用“智能体链”打败GPT-4
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RLSummary近年来,大型语言模型(LLM)和多智能体系统的快速发展,已在深度研究、氛围式编程(vibe coding)以及数学推理等复杂问题求解任务中展现出卓越能力。然而,现有的大多数多智能体系统依赖人工设计的提示词与工作流工程,并构建在复杂的智能体框架之上,这使得它们在计算上效率低下、能力受限,且难以从以数据为中心的学习范式中获益。在本文中,我们提出了 Chain-of-Agents(CoA)——一种新的 LLM 推理范式,使单一模型即可原生地端到端完成复杂问题求解,其方式与多智能体系统等价(即通过多轮交互、使用多种工具并扮演多个智能体角色来解决问题)。在 Chain-of-Agents 的问题求解过程中,模型会动态激活不同的工具型智能体和角色扮演型智能体,以端到端的方式模拟多智能体协作。为在 LLM 中激发端到端的 Chain-of-Agents 求解能力,我们提出了一种多智能体蒸馏框架,将最先进的多智能体系统蒸馏为 Chain-of-Agents 轨迹,用于智能体化的监督微调(agentic supervised fine-tuning)。随后,我们在可验证的智能体任务上引入智能体强化学习(agentic reinforcement learning),进一步提升模型在 Chain-of-Agents 问题求解方面的能力。我们将最终得到的模型称为智能体基础模型(Agent Foundation Models,AFMs)。大量实验结果表明,AFM 在 Web 智能体和代码智能体等多种设置下的多项基准测试中均取得了新的最先进性能。我们将全部研究成果完全开源,包括模型权重、训练与评估代码以及训练数据,为未来关于智能体模型和智能体强化学习的研究提供了坚实的起点。原文链接:https://arxiv.org/abs/2508.13167

【第455期】A1:大语言模型驱动的智能合约漏洞利用系统
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:AI Agent Smart Contract Exploit GenerationSummary智能合约漏洞已造成数十亿美元的损失,但发现可实际利用的攻击仍然极具挑战性。传统模糊测试工具依赖僵化的启发式规则,难以应对复杂攻击;而人工审计虽然细致,却效率低下且难以规模化。大型语言模型(LLM)提供了一种颇具潜力的折中方案,将类人的推理能力与机器级的执行速度相结合。然而,早期研究表明,仅通过提示词驱动 LLM 往往会产生未经验证的漏洞猜测,且误报率较高。为解决这一问题,我们提出了 A1——一种智能体(agentic)系统,可将任意 LLM 转化为端到端的漏洞利用生成器。A1 为智能体提供了六种领域特定工具,用于自动化漏洞发现,覆盖从理解合约行为到在真实区块链状态上测试攻击策略的全过程。所有输出结果均通过实际执行进行严格验证,确保仅报告具备实际获利能力的概念验证(PoC)漏洞利用。我们在以太坊和币安智能链上的 36 个真实世界漏洞合约上对 A1 进行了评估。在 VERITE 基准测试中,A1 取得了 63% 的成功率。在所有成功案例中,A1 单个漏洞利用最高可提取 859 万美元,总计可达 933 万美元。通过在六种 LLM 上开展的 432 次实验,我们发现大多数漏洞利用在五次迭代内即可生成,单次尝试的成本介于 0.01 美元至 3.59 美元之间。此外,通过对历史攻击进行蒙特卡洛分析,我们表明:若能立即检测到漏洞,成功概率可达 86%–89%;若延迟一周再发现,成功概率则骤降至 6%–21%。经济性分析进一步揭示了一种令人担忧的不对称性:攻击者在仅 6000 美元的漏洞价值下即可实现盈利,而防御者则需要 60000 美元——这引发了一个根本性问题,即 AI 智能体是否不可避免地更倾向于促进攻击而非防御。原文链接:https://arxiv.org/abs/2507.05558

【第454期】面向盈利漏洞的智能合约模糊测试
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Smart Contract Fuzzing Towards Profitable VulnerabilitiesSummary数十亿美元通过智能合约进行交易,使得漏洞成为重大的金融风险。在安全攻防竞赛中,一个重要焦点是攻击者可以加以利用的高收益漏洞。模糊测试(Fuzzing)是识别此类漏洞的关键方法。然而,现有解决方案主要面临两方面的限制:其一,缺乏以收益为中心、能够加速漏洞发现的技术;其二,在最大化已发现漏洞的可获利性方面自动化程度不足,往往仍需依赖人工专家进行分析。为弥补这些不足,我们提出了 VERITE——一种以收益为中心的智能合约模糊测试框架,不仅能够有效检测高收益漏洞,还能够最大化漏洞利用所获得的收益。VERITE 具有三个关键特性:1)基于 DeFi 行为的变异器,用于增强对具有不同资金流向交易的探索能力;2)潜在高收益候选输入的识别准则,通过检测测试过程中输入是否引发异常的资金流动特征;3)针对已识别候选输入的、基于梯度下降的收益最大化策略。VERITE 从零开始完整实现,并在一个包含 61 个真实世界中已被利用的 DeFi 项目的数据集上进行了评估,这些项目的平均损失超过 110 万美元。实验结果表明,VERITE 能够自动提取总计超过 1800 万美元的收益,并且在漏洞检测能力(29/10)和漏洞利用效果(平均获利高出 134 倍)方面均显著优于当前最先进的模糊测试工具 ITYFUZZ。值得注意的是,在 12 个测试目标中,VERITE 所获得的收益甚至超过了真实攻击中使用的漏洞利用手段(高出 1.01 至 11.45 倍)。此外,VERITE 已被审计人员应用于合约审计实践中,成功发现了 6 个零日漏洞(其中 5 个为高危漏洞),并获得了超过 2500 美元的漏洞赏金奖励。原文链接:https://arxiv.org/abs/2501.08834

【第453期】虚拟智能体经济体的构建与治理
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Virtual Agent EconomiesSummary自主型 AI 智能体的快速采用正在催生一个新的经济层面,在这一层面中,智能体以超出人类直接监督能力的规模和速度进行交易与协作。我们提出“沙盒经济”(sandbox economy)这一框架,用以分析这一新兴系统,并从两个关键维度对其进行刻画:其起源(自发涌现型 vs. 有意设计型),以及其与既有人类经济之间的隔离程度(可渗透型 vs. 不可渗透型)。当前的发展轨迹表明,一个规模庞大且高度可渗透的 AI 智能体经济正在自发形成。这一趋势既为前所未有的大规模协调提供了机遇,也带来了显著挑战,包括系统性经济风险以及不平等的进一步加剧。本文讨论了若干可能的设计选择,这些选择有助于实现安全且可控的 AI 智能体市场。具体而言,我们考察了用于公平资源分配与偏好协调的拍卖机制、围绕实现集体目标而进行协调的 AI“使命经济”(mission economies)的设计,以及确保信任、安全与问责所需的社会—技术基础设施。通过上述分析,我们主张对可引导的智能体市场进行前瞻性设计,以确保即将到来的技术变革能够与人类长期的整体繁荣相一致。原文链接:https://arxiv.org/abs/2509.10147

【第452期】OpenAI:语言模型产生幻觉的统计根源
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Why Language Models HallucinateSummary就像学生在面对困难的考试题目时一样,大型语言模型在不确定时有时会进行猜测,生成看似合理但实际上错误的陈述,而不是承认自身的不确定性。即便在最先进的系统中,这类“幻觉”现象仍然存在,并削弱了人们对模型的信任。我们认为,语言模型之所以会产生幻觉,是因为训练和评估流程奖励猜测行为,而非承认不确定性;并且我们分析了现代训练流水线中导致幻觉的统计学成因。幻觉并不神秘——它们本质上只是二元分类中的错误。如果无法将错误陈述与事实区分开来,那么在自然的统计压力作用下,预训练语言模型中就会产生幻觉。接着,我们指出,幻觉之所以持续存在,是由于大多数评测的评分方式所致——语言模型被优化成“擅长应试”的系统,而在不确定时进行猜测能够提升测试成绩。这种对不确定回答进行惩罚的“流行病”,只能通过一种社会—技术层面的缓解手段来解决:与其引入新的幻觉评测,不如修改那些虽然存在错位但却主导排行榜的现有基准的评分方式。这一改变可能会引导该领域迈向更加值得信赖的人工智能系统。原文链接:https://arxiv.org/abs/2509.04664

【第451期】AI有了外置记忆体如何持续进化
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Memento: Fine-tuning LLM Agents without Fine-tuning LLMsSummary该文本介绍了一种名为 Memento 的新型学习范式,它旨在实现 自适应大型语言模型(LLM)代理的持续学习,而无需对底层 LLM 进行成本高昂的微调。 Memento 将代理形式化为 记忆增强型马尔可夫决策过程(M-MDP),利用情节记忆(episodic memory)存储过往经验,并采用神经案例选择策略(neural case-selection policy)来指导行动。这种方法利用 基于案例的推理(CBR),通过高效的内存读取和重写机制,在 Deep Research 等复杂任务中实现了 低成本的在线强化学习,并在 GAIA 等基准测试中取得了顶尖性能。总体而言,Memento 提供了一个无需梯度更新即可持续高效地获取新技能的 可扩展且高效的通用 LLM 代理开发途径。原文链接:https://arxiv.org/abs/2508.16153

【第450期】OPPO智能体链:用低成本造出超级AI
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RLSummary该文本摘录自一篇关于**“Chain-of-Agents” (CoA)** 的研究论文,这是一种新型的大型语言模型 (LLM) 推理范式,旨在将多智能体系统的复杂问题解决能力整合到一个模型中。作者提出了 Agent Foundation Models (AFMs),通过多智能体知识蒸馏和智能体强化学习 (RL) 进行训练,使其能够模拟多步骤、多工具的协作式问题解决过程。实验结果显示,AFM 在包括网页智能体、代码生成和数学推理在内的多个基准测试中达到了最先进的性能,同时与传统多智能体系统相比,显著提高了计算效率。研究者们承诺将模型权重、代码和数据完全开源,以推动未来的智能体研究。原文链接:https://arxiv.org/abs/2508.13167

【第449期】代理网络时代:从信息搜索到AI行动工厂
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Agentic Web: Weaving the Next Web with AI AgentsSummary该来源文件全面概述了**“Agentic Web”(智能体网络)的兴起,这是一个由基于大型语言模型(LLMs)的自主软件智能体驱动的新一代互联网生态系统。文章将互联网的历史划分为PC网络、移动网络和智能体网络三个时代,阐述了智能体如何从被动内容检索转向主动的、多步骤的任务执行和协作**。作者提出了一个由智能、交互和经济组成的概念框架,详细分析了智能体如何实现长期规划、语义交互以及向**“智能体注意力经济”商业模式的转变。此外,该文件还讨论了Agentic Web在应用场景**(如智能体作为接口或用户代理)以及在安全性、治理和评估方面(特别是通过红队测试)面临的基础挑战。原文链接:https://arxiv.org/abs/2507.21206

【第448期】智能体性能过剩是成本陷阱
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Efficient Agents: Building Effective Agents While Reducing CostSummary该研究系统地分析了 大型语言模型(LLM)驱动的智能体系统 中存在的 效率与性能的权衡 问题,指出尽管LLM智能体的能力显著增强,但其不断攀升的成本严重威胁了其可扩展性和可及性。通过在GAIA基准上进行实证分析,研究人员评估了 LLM骨干模型选择、规划、工具使用和内存机制 等核心组件对效率和性能的影响,并采用了 “通过成本”(cost-of-pass) 这一指标来量化经济效益。基于这些发现,作者提出了 “高效智能体”(Efficient Agents) 框架,该框架通过优化组件配置,在保持96.7%性能的同时,将运营成本降低了28.4%,为构建更具 成本效益 的高性能AI解决方案提供了实用见解。原文链接:https://arxiv.org/abs/2508.02694

【第447期】(Ledger)区块链供应链八成项目失败原因
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:A Framework for the Profitable Integration of Distributed Ledger Technologies in Enterprise NetworksSummary这份学术研究文章出自《LEDGER》期刊,聚焦于分布式账本技术 (DLT) 在企业网络,特别是供应链管理中的盈利能力集成框架。作者指出,尽管DLT项目展示了诸多潜力,但企业难以评估其对盈利的影响。文章采用扎根理论,结合系统文献回顾和对40位行业专家的访谈,构建了一个盈利能力评估模型,包括一个四维分类法和一个热图来刻画DLT解决方案的成熟度。研究最终提出了一系列定性和定量因素,并以收益和成本矩阵的形式呈现,旨在帮助从业者和研究人员系统地评估区块链解决方案的经济价值。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/395

【第446期】(Ledger)区块链如何解决跨境诉讼文书送达难题
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Blockchain for Democratic Justice: Innovating the Service of Judicial Documents to Uphold the Rule of LawSummary该来源是一篇题为“区块链促进民主司法:创新司法文件送达以维护法治”的邀请研究文章,探讨了在欧盟内部的跨境诉讼中,区块链技术如何能够改进司法文件的电子送达流程。文章首先指出了根据《欧盟基本权利宪章》第47条,司法文件送达对于保障司法公正的重要性,并概述了《文件送达条例》(修订版)在引入电子送达方面面临的挑战,例如欧盟成员国之间程序法和技术上的差异。文章随后深入探讨了如何设计一个基于区块链的解决方案,特别是针对最易获取但保障级别较低的电子邮件送达方式,通过利用区块链的防篡改和去中心化特性,来增强送达过程中的可靠性和证据力。最终,文章得出结论,区块链可以显著提高电子送达,尤其是电子邮件送达的法律确定性和效率,从而更好地维护欧盟司法领域中的程序保障。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/392

【第445期】(Ledger)机器学习揭示DeFi协议家族指纹比功能更重要
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Investigating Similarities Across Decentralized Finance (DeFi) ServicesSummary该来源是一篇题为“调查去中心化金融(DeFi)服务间的相似性”的邀稿研究文章,发表于《LEDGER》期刊。该研究的作者们探索了如何使用图表示学习(GRL)算法来分析去中心化金融协议提供的**“构建模块”(building blocks)之间的相似性。通过使用以太坊交易数据,研究人员将这些金融功能单元进行聚类**,旨在根据其智能合约属性和调用结构来自动识别相似的DeFi服务。研究结果表明,该方法在将功能单元按所属协议进行分组时,其性能(V-Measure为0.571)优于按金融功能类别进行分组,这表明协议特有的交易模式是导致相似性的重要因素。该论文详细介绍了数据集、嵌入方法以及聚类分析结果,并讨论了其在增强互操作性和比较不同DeFi实现方面的意义。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/402

【第444期】(Ledger)区块链知识评估困境与两把新尺子
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Development of the Blockchain Technology Literacy Test (BTLT): A Scoping Review of Current LiteratureSummary这份来源资料是一篇题为“区块链技术素养测试 (BTLT) 的开发:当前文献的范围界定回顾”的综述文章,该文章发表在《Ledger》期刊上。作者指出,学术界在区块链技术素养方面存在显著空白,研究往往侧重于加密货币素养。为了解决这个问题,研究人员提出了区块链技术素养测试 (BTLT),旨在评估对区块链核心技术和术语的理解。此外,他们还更新了加密货币素养测试 (CLT),以避免评估中的重复和冗余。文章基于对八个数据库的文献回顾,最终纳入了九篇相关出版物,并强调在新兴区块链应用领域进行更清晰的定义和更广泛的研究的必要性。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/401

【第443期】(Ledger)比特币十年网络结构演变与价格泡沫之谜
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Exploring the Mesoscopic Structure of Bitcoin During its First Decade of LifeSummary这份研究文章探讨了比特币用户网络(BUN)在2011年至2018年间,即其诞生后的第一个十年的中观结构特性。作者们通过分析整个比特币交易历史的公开数据,构建了用户网络,并检查了其核心—边缘结构和蝴蝶结结构(bow-tieness)等拓扑性质。研究发现,BUN的结构组织波动似乎与比特币历史上的价格泡沫期相关联,这表明结构特征与价格变动之间存在相互作用。此外,文章还分析了亲疏性(assortativity)、中心性和小世界特性等指标,并提出了通过降低网络中“枢纽”的重要性来减轻价格崩溃风险的政策建议。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/335

【第442期】(Ledger)稳定币四象限矩阵与风险生存图鉴
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:The Four Types of Stablecoins: A Comparative AnalysisSummary该研究论文对稳定币进行了比较分析,提出了一种基于抵押品来源(外部或内部)和抵押品管理(集中式或分散式)的四种类型分类。作者利用基于代理的模拟来测试每种稳定币类型在不同条件下的稳定性,特别是针对需求冲击的反应。研究结果强调,集中管理和内部抵押品的稳定币(如 TerraUSD)最容易崩盘,而分散管理的稳定币(如 Dai 和 sUSD)尽管波动性较大,但更具弹性。最终,该分析得出结论,在稳定性、独立性和成本之间存在一个三难困境,并为投资者和监管机构提供了政策建议。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/326

【第441期】(Ledger)DeFi是模仿还是创新_借贷超额抵押的真相
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:How Do Decentralized Finance Protocols Compare to Traditional Financial Products? A Taxonomic ApproachSummary这篇评论文章介绍了去中心化金融(DeFi)协议的分类方法,并利用这种方法比较DeFi产品与传统金融机制。作者首先根据信息系统的方法论构建了一个包含八个维度的DeFi协议分类法,旨在为DeFi协议的分类和追踪其未来发展提供一个结构化工具。文章随后详细描述了DeFi协议在DeFi堆栈层、目的、价格机制、流动性存储和抵押品等方面的特性。最后,文章对比了DeFi和传统金融在交易所、借贷、衍生品、资产管理和保险等领域的异同,并讨论了DeFi中产生的创新产品及其风险和机遇。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/360

【第440期】(Ledger)二十一万美金保护五万仓位的市场中性策略
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Market Neutral Liquidity ProvisionSummary这份研究文章探讨了去中心化金融中集中流动性池的对冲策略,尤其关注如何实现市场中性的流动性供给。作者们从现有的流动性提供者损失指标(如“无常损失”)研究中转移焦点,推导出了一个利用期权和期货构建的对冲投资组合,旨在维持流动性提供者资产的美元价值恒定,从而通过赚取交易费而非投机收益。文章详细介绍了在Uniswap v3等集中流动性自动做市商(AMM)模型中,如何使用一系列看涨和看跌期权来复制流动性头寸的价值,从而实现“无模型”的对冲。最后,作者通过一个实证案例分析了这种对冲策略的实际限制和资本效率,指出所需的初始保证金很高,但对冲投资组合本身(特别是通过期货溢价)也能带来额外收益。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/389

【第439期】(Ledger)区块链:从“智慧城市”到“生存基石”——揭秘难民营与贫困社区的信任重建与经济激活
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Decentralization, Blockchains, and the Development of Smart Communities in Economically Challenging EnvironmentsSummary该研究文章探讨了区块链技术如何应用于经济困难环境中的智能社区发展,这与传统上认为区块链仅适用于资源丰富的智慧城市形成了对比。作者分析了四个具体的案例,包括约旦难民营的食品分发、肯尼亚农村地区的金融系统、塞拉利昂的身份识别平台以及芬兰难民的身份管理,以展示区块链在这些缺乏基础设施的背景下的核心作用。通过这些案例研究,文章提出,在这些环境下,区块链能够作为建立和维护社区信任的关键要素,并为金融和身份管理等基本需求提供新的整合途径。最终,作者得出了**“智能社区”的定义**,并概述了其概念要素,强调了区块链在促进这些社区自下而上发展中的基础性作用。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/302

【第438期】(Ledger)加密交易所数据审计:价值568亿美金的“未平仓合约”谎言与市场操纵内幕
Seventy3:借助NotebookLM的能力进行论文解读,专注人工智能、大模型、机器人算法、crypto方向,让大家跟着AI一起进步。今天的主题是:Reconciling Open Interest with Traded Volume in Perpetual SwapsSummary该研究文章题为**《调和永续掉期合约中的未平仓量与交易量》,对多家主要加密货币衍生品交易所的比特币永续掉期数据进行了分析。作者检验了未平仓合约总数(open interest)与交易量(traded volume)之间的关系**,发现许多交易所存在系统性的报告差异,即观察到的未平仓量变化无法完全用报告的交易量来解释。通过检查 2023 年两个不同时期的分笔数据,作者确定了ByBit 和 OKX 存在最频繁且巨大的数据不一致问题,这意味着其未平仓合约要么被夸大,要么交易量被低报。研究得出结论,这种数据不准确性可能被交易所利用,通过制造错误的未平仓量信号来激励更多交易,从而增加收入。最后,文章呼吁交易所提高透明度,以保护市场诚信并促进健康发展。原文链接:https://ledgerjournal.org/ojs/ledger/article/view/325