跳到主要内容

GitHub Trending 周报:Skills 变成 Agent 的分发格式,记忆与凭据独立成层(2026-09-27)

Jacob
虚心学习

本周 GitHub Trending(weekly)有一个相当一致的方向:Agent 的能力正在被拆成一层层可安装、可审阅、可单独替换的部件。 工程方法被封装成 skills 和插件,长期状态被抽成独立的记忆系统,外部工具访问被收敛成统一凭据代理,而模型本身反而退到了这些层之后。

与此同时,多 Agent 的讨论重心继续从"怎样同时跑更多"转向"怎样管理、审计和限制它们"。这个变化比新增了多少个项目更值得注意。

说明:本文主要依据 GitHub Trending weekly 于 2026 年 9 月 27 日抓取的公开页面,以及对应仓库 README 与 GitHub 公开元数据整理。本次页面解析出 18 个热门仓库;"本周新增 stars"和"总 stars"取自抓取时页面可见数据。Trending 反映短期关注度,不等同于长期采用率;"为什么变热"是结合项目定位、周增量和近期活跃度所作的审慎判断。

本周总览​

先说结论:

  • Skills 已经成为 Agent 能力的事实分发格式。 从 Cloudflare 的安全审计 skill,到 Anthropic 的岗位插件和金融行业 agent,再到个人维护的 292 个 skill 集合,共同点都是 markdown 加 JSON、无构建步骤、可版本化、按需加载。
  • 记忆和凭据从 Agent 内部逻辑里被拆出来,成为独立系统。 一个提供带基准和论文的长期记忆,一个统一代理三千多个外部工具端点的认证——两者都强调"模型不持有状态和密钥"。
  • 多 Agent 的竞争点转向治理。 组织架构、预算上限、审批门、绩效评审这些原本属于人的管理概念,正在被写进编排产品。
  • 安全边界开始被硬性写进文档。 需要 OS 级沙箱才执行不可信代码,输出必须由专业人士签收,凭据只在服务端注入——不是建议,而是前置条件。
  • 评测从宣传变成可比较的问题。 200 个真实 PR 的标注数据集、第三方独立复现的记忆基准、两千多个通过的测试,说明"怎么证明做对了"正在成为发布内容的一部分。
  • 非 AI 项目依然稀疏。 严格意义上与 AI 无关的本周只有两个,配合一个长期基础层,数量不对称本身就是信号。

AI 热门项目​

1. anthropics/financial-services​

  • 它是做什么的:Anthropic 面向金融行业的开源参考实现,覆盖投资银行、股票研究、私募和财富管理等场景,内含 11 个命名 agent(Pitch Agent、Market Researcher、Earnings Reviewer、GL Reconciler、Month-End Closer、KYC Screener 等)、按业务线划分的 skill 与命令包,以及 12 个 MCP 数据连接器(S&P Global、FactSet、Moody's、Morningstar、PitchBook、LSEG、Box、Egnyte 等)。
  • 为什么这周会热:本周新增约 2,633 stars,总 stars 约 3.77 万。通用助手在企业里"不够用"已经形成共识,但把行业术语、建模流程、合规要求和数据源一次性整理成可运行模板的组织并不多;官方背书加上明确的责任边界声明,降低了试用门槛。
  • 有什么新意:它一份源码支持两种运行方式——既可以作为 Claude Cowork 插件安装,也可以通过 Claude Managed Agents API 部署到自己的编排层背后,系统提示词和 skills 完全一致。同时 README 直接把边界写在最前面:Agent 只起草模型、备忘和底稿,不做投资建议、不执行交易、不过账、不做开户审批,所有输出都停留在人工签收之前。这种"先划责任、再谈能力"的写法,比功能清单更能说明企业采用的真实约束。

2. cloudflare/security-audit-skill​

  • 它是做什么的:一个把编码 Agent 变成安全审计员的 skill,六阶段执行:侦察并建立覆盖账本、按账本分派隔离的猎取者、对候选逐一验证、输出结构化结论、独立复核记录、生成与目标无关的报告。产物包括 architecture.md、coverage-ledger.json、findings.json 和三份报告。
  • 为什么这周会热:本周新增约 6,474 stars,总 stars 约 2.21 万。它是 Cloudflare 漏洞发现 harness 的源点,而 harness 已经发展成跨集群的多阶段系统;能被公开的"最小可复现起点"对企业安全团队天然有吸引力。
  • 有什么新意:三个设计决定值得单独记下来。第一,发现者与验证者必须分离——每个候选都交给一个全新的、任务是"推翻它"的验证者。第二,只有建立了完整来源链条和可观测结果的才算 confirmed,有未解决事实的留在 needs_validation 且不带严重性评级,被推翻的记入 rejected。第三,它诚实承认覆盖率问题:测试中单次运行大约只能发现重复运行总量的一半,因此多次运行设计成增量叠加。另外,没有 OS 级沙箱(禁外网、限额、只允许写 scratch)时,流程宁愿把线索留在待验证状态,也不执行目标代码。

3. anthropics/claude-code​

  • 它是做什么的:Anthropic 的终端 Agentic 编码工具,理解代码库、执行例行任务、解释复杂代码并处理 Git 工作流。
  • 为什么这周会热:本周新增约 1,744 stars,总 stars 约 14.82 万,是榜单总量最高的编码工具类项目,抓取前一天仍在提交。
  • 有什么新意:作为一个 2025 年初就存在的项目,它持续滞留榜单的意义不在功能本身,而在于它仍然是大量 skills、插件和第三方工具默认的宿主环境。本周出现在榜单上的多个项目,第一安装路径都写着"在 Claude Code 里装一个插件"。这层位置比任何单项能力都更难被替代。

4. paperclipai/paperclip​

  • 它是做什么的:开源的多 Agent 编排应用,用一句话概括是"如果 OpenClaw 是员工,Paperclip 就是公司"。用户先定义目标、再"招聘"一支由不同 bot 组成的团队(CEO、CTO、工程师、设计、市场),审批策略和预算后交由心跳驱动持续运行,并在一个任务管理器式的界面里跟踪产出和成本。
  • 为什么这周会热:本周新增约 5,376 stars,总 stars 约 8.76 万,抓取当天仍在更新。项目列出的适用条件非常直白——"你开着 20 个 Claude Code 终端,已经不知道谁在做什么"。这种痛点在重度用户里已经普遍。
  • 有什么新意:它把四个原本不属于开发工具的概念做成一等公民:Agent 组织架构(人机混合、权限、可委派的职责)、Agent 培训(共享 skill 库、评测与测试运行、绩效评审)、预算治理(每个 Agent 月度上限,超限即停)、以及跨 provider 的运行时与沙箱。它管理的是业务目标而不是 pull request,协调与治理被放在了编排之前。

5. vectorize-io/hindsight​

  • 它是做什么的:Agent 长期记忆系统,围绕 retain(写入)、recall(检索)、reflect(生成带倾向性的回应)三个操作组织,引入 observations、mental models、knowledge pages 和 memory banks 等概念,可 Docker、pip、Helm 部署,也支持嵌入式数据库和托管云。
  • 为什么这周会热:本周新增约 7,282 stars,是全榜最高的周增量;总 stars 约 3.26 万。记忆是 Agent 从"一次性问答"走向"长期合作"绕不开的短板,而它把性能主张放到了可验证的位置。
  • 有什么新意:它明确把目标定在"学习"而不只是"记住",并公开声称在 LongMemEval 上取得最优表现,同时说明该结果已由弗吉尼亚理工 Sanghani 中心和《华盛顿邮报》的研究人员独立复现,逐模型的准确率、延迟和成本持续在线更新。它还支持 25 个以上模型厂商,其中包括直接用 ChatGPT Plus/Pro、Claude Pro/Max、Cursor、GitHub Copilot 等既有订阅而无需 API key 的路径——这让"先接上试试"的成本降到接近零。

6. Tencent/WeKnora​

  • 它是做什么的:腾讯开源的 LLM 知识平台(Go 实现),把团队文档聚合成可检索、可推理、可持续维护的知识库,同时提供 RAG 问答、多步任务的 Agent、以及自动维护的 Wiki 三种模式。
  • 为什么这周会热:本周新增约 3,015 stars,总 stars 约 3.04 万,抓取当天仍有提交。企业知识库从"能问答"进入"要治理"的阶段后,权限、审计和可回滚成为选型重点。
  • 有什么新意:三种模式共用同一套知识库,检索结果的分块可以编辑、对比和回滚,避免了 RAG 常见的"答案不可追溯"。Agent 侧则把 skills 从 ClawHub、SkillHub、Git 或 ZIP 装进会话持久的 Docker/E2B/Cube 沙箱,旁边配交互终端和图形桌面,还能通过扩展操作用户自己的 Chrome 或 Edge。数据源自动同步飞书、Confluence、GitLab、Notion、语雀、钉钉和 RSS,多工作区 RBAC 四角色加逐工作区审计日志,并用 Langfuse 记录 Agent 步骤与 token 消耗。

7. affaan-m/ECC​

  • 它是做什么的:一套"Agent harness 性能优化系统",把工程流程固化进编码 Agent:先计划、再测试、再实现、再审查、再验证、再记忆、再改进。仓库内含 68 个 agent、292 个 skill、94 个命令入口,以及 hooks、规则、记忆、持续学习和 AgentShield 安全扫描。
  • 为什么这周会热:本周新增约 5,522 stars,总 stars 约 26.80 万,是全榜总量最高的项目。它代表了一类强需求:团队不想把同一套工作方法在每个提示词里重写一遍。
  • 有什么新意:它的核心口号是"优化上下文窗口,其余一切都持久化",把上下文预算当成需要主动管理的稀缺资源,而不是把能塞的都塞进去。另一个被低估的部分是 AgentShield:扫描范围包括提示词、hooks、MCP 配置、权限、密钥和 Agent 配置文件——这等于承认 skill 与配置本身已经是一个需要做安全扫描的攻击面。README 还专门警告只从官方渠道安装,第三方镜像可能含恶意代码。

8. stablyai/orca​

  • 它是做什么的:面向并行 Agent 的桌面工作台,可让 Codex、Claude Code、OpenCode、Pi 等在自己的 git worktree 中并排运行,统一管理终端分屏、浏览器、任务、diff 和远程运行时,并提供手机端伴侣应用。
  • 为什么这周会热:本周新增约 6,503 stars,总 stars 约 7.90 万,抓取当天仍在更新。它上周就在榜单上,连续两周出现说明并行 Agent 工作台已经形成稳定需求,而不是一次性话题。
  • 有什么新意:这一轮把浏览器做成了真正的输入通道——在设计模式里点选真实 Chromium 窗口中的任意元素,就能把它的 HTML、CSS 和裁切截图直接送进 Agent 的提示词。加上原生 GitHub 与 Linear 视图,从任务到 worktree 到评审不需要切换上下文;把"点选界面 → 描述问题"这条路径缩短,比再调一次提示词更有效。

9. davila7/claude-code-templates​

  • 它是做什么的:Claude Code 的配置与监控 CLI,配套 aitmpl.com 上有 100 多个 agent、命令、设置、hooks、MCP 集成和项目模板,一条命令就能把整套配置装进项目。
  • 为什么这周会热:本周新增约 1,142 stars,总 stars 约 3.19 万,抓取当天仍在更新。当宿主工具本身稳定后,围绕它的配置生态会先热起来。
  • 有什么新意:它把"起步配置"当成产品:不用理解每个配置文件的位置和优先级,选一个模板装上即可。这类工具的价值随宿主工具的复杂度上升而上升,也说明 Agent 工具的竞争已经从功能层扩散到配置层。

10. alibaba/open-code-review​

  • 它是做什么的:阿里内部使用两年多的 AI 代码审查助手开源版本。它读取 Git diff,把变更文件交给带工具调用能力的 LLM Agent,产出精确到行的结构化审查意见;Agent 可以读完整文件、搜索代码库、参考其他变更文件,也可以对整个文件或目录执行 ocr scan。
  • 为什么这周会热:本周新增约 4,310 stars,总 stars 约 4.17 万。它上周是榜首,本周仍在前十,说明持续关注度而非一次性爆发。
  • 有什么新意:它把自己变成可比较的对象——公开了 AACR-Bench:50 个开源仓库、200 个真实 PR、10 种语言、80 多位资深工程师交叉验证出的 1,505 条标注缺陷,数据集在 Hugging Face 上开放。结论也很坦率:相同底层模型下,它的精度和 F1 显著高于通用 Agent,token 消耗约为对方的九分之一,但召回率更低——这是有意用漏报换误报的取舍。架构上同样明确分工:确定性流水线负责文件选择、规则匹配和行号定位,模型只处理需要语义判断的部分。

11. anthropics/knowledge-work-plugins​

  • 它是做什么的:面向知识工作者的 11 个岗位插件,覆盖效率工具、销售、客服、产品、市场、法务、财务、数据、企业搜索和生物研究,以及一个用来创建和定制插件本身的插件。
  • 为什么这周会热:本周新增约 664 stars,总 stars 约 2.57 万,抓取前一天仍在更新。数量不多但持续在榜,说明"岗位化"这条路在被反复验证。
  • 有什么新意:每个插件结构完全一致——清单文件、MCP 连接配置、显式命令目录、自动触发的 skill 目录,且全部由 markdown 和 JSON 构成,没有代码、没有构建步骤。真正有意思的是连接器清单:Slack、Notion、Jira、Snowflake、Databricks、Box、PubMed 等等。它其实在描述企业的真实工作面——岗位知识本身不难写,难的是把它接到公司实际使用的十几个系统上。

12. addyosmani/agent-skills​

  • 它是做什么的:一组生产级工程 skills,通过 9 个命令映射完整开发生命周期:/spec 定义、/plan 规划、/build 实现、/test 验证、/constraints 设定质量红线、/review 评审、/webperf 性能审计、/code-simplify 简化、/ship 发布。
  • 为什么这周会热:本周新增约 2,510 stars,总 stars 约 9.93 万,本周仍在更新。它的安装命令基于开放的 skills CLI,可一次装进 70 多个 Agent(Claude Code、Cursor、Codex、Copilot、Cline 等),覆盖面是它持续被关注的原因之一。
  • 有什么新意:/build auto 是这一版最值得看的细节——批准一次计划后,它会连续实现所有任务。但 README 说明得很清楚:被自动化的是任务之间的人工推动,不是验证;每个任务仍然测试驱动、单独提交,遇到失败或高风险步骤会暂停。把"完成定义"而不是提示词做成可分发对象,这个方向比让 Agent 跑得更久更重要。

13. HKUDS/CLI-Anything​

  • 它是做什么的:目标是"让所有软件都变成 Agent 原生"。通过为各类桌面软件生成 CLI harness,让 Agent 用命令行加预览、实时预览和轨迹循环产出真实产物——CAD 模型、3D 场景、图表、游戏内容、字幕等。CLI-Hub 注册表可以浏览和安装社区贡献的 CLI。
  • 为什么这周会热:本周新增约 1,055 stars,总 stars 约 5.07 万。当 MCP 数量膨胀到难以管理时,一个更古老、更可审计、更容易被 Agent 组合拼接的接口形态重新变得有吸引力。
  • 有什么新意:它给出的答案和主流"再加一个 MCP server"相反。CLI 的好处是输出可管道化、可 diff、可记录、可重放,权限边界也更清楚。项目公开了 2,461 个通过的测试和一份 arXiv 技术报告,近期更新里还有针对凭据文件和不可信输入的加固——把软件包成 CLI 这条路要成立,安全和可验证性是前提。

14. TencentCloud/Octop​

  • 它是做什么的:腾讯云开源自托管的 AI 助手,定位是个人、家庭和小团队,多用户多 Agent。单个 octop run 进程同时提供 Web 控制台、CLI、IM 渠道(飞书、钉钉、QQ、微信、Telegram、Discord、企业微信)和定时任务,全部状态放在本机 ~/.octop/ 下。
  • 为什么这周会热:本周新增约 951 stars,总 stars 约 5,149,抓取当天仍在更新。项目 7 月才创建,增长曲线陡峭;"数据不出本机"在个人和小团队场景里是硬约束。
  • 有什么新意:它把通常需要用户自己拼装的东西合并成一个进程:Agent 运行时、IM 网关、可移植记忆、浏览器自动化和调度都由内部处理器路由,重启后全部状态从控制面数据库重建,不依赖外部消息队列。工作区后端可插拔(本地磁盘、Docker 沙箱、PostgreSQL、COS/S3),记忆随工作区迁移;通过 ACP 还能把编码任务委派给 OpenCode 或 Claude Code 并保留权限门。JWT 多用户隔离、工具审批、shell 命令护栏和 PII 脱敏都是默认项,而不是可选项。

15. superdesigndev/treg​

  • 它是做什么的:面向 Agent 的工具注册表与代理,自称"OpenRouter,只不过对象是工具而不是模型"。指向一个 base URL、用一个 token,就能调用 3,000 多个端点、60 多个 provider(SEO 与反向链接、社交与趋势、人物与公司数据、广告、抓取、图像视频生成),按次计费,最低以分为单位。
  • 为什么这周会热:本周新增约 1,773 stars,总 stars 约 3,512——总量是全榜最小,但周增量超过总量的一半,是本周增速最陡的项目。它解决的痛点非常具体:真实业务需要的工具往往躺在 Semrush、Crunchbase、Apollo 这类按月订阅的服务后面,而一次任务并不值得为此买一个月。
  • 有什么新意:它的核心规则只有一条——代理只转发,不建模,认证在服务端注入,调用方永远不持有密钥。团队自己的付费账号、OAuth 连接、厂商 CLI 乃至 SKILL.md 都能注册进去,自有密钥优先且不计费。这实际上把"Agent 能用哪些外部能力"从散落各处的 MCP 配置,收敛成一个可以按任务搜索的目录加统一的凭据边界。

非 AI / 泛基础设施热门项目​

本周 18 个项目里,直接围绕 Agent、skill、记忆或模型工具链的项目占 15 个。这里只保留三个脱离 Agent 叙事仍有独立价值的项目,不追求数量对称。

1. pytorch/pytorch​

  • 它是做什么的:主流的张量与动态神经网络框架,提供 Python 下的 GPU 加速计算。
  • 为什么这周会热:本周新增约 295 stars,总 stars 约 10.34 万,抓取当天仍在提交。对一个 2016 年创建的项目来说,这个周增量并不代表热度,而是它作为长期基础层被持续引用的结果。
  • 有什么新意:它出现在 Agent 主导的榜单里,说明本届热点之上仍然压着一层不怎么变化的计算底座。所有关于记忆、检索和推理的讨论,最终都要跑在这类框架上。

2. cloudflare/quiche​

  • 它是做什么的:QUIC 传输协议与 HTTP/3 的 Rust 实现,提供处理 QUIC 报文的底层 API,由应用负责 I/O 和事件循环。
  • 为什么这周会热:本周新增约 736 stars,总 stars 约 1.26 万。Cloudflare 边缘网络的 HTTP/3 支持、Android 的 DNS 解析器,以及 curl 的 HTTP/3 能力都在使用它。
  • 有什么新意:协议栈这类上游项目的价值不随叙事波动。当上层工具每周换代时,它只需要保证正确性和互操作性,而这两件事恰恰是 Agent 时代最容易被忽略、又最难补救的部分。

3. dream-num/univer​

  • 它是做什么的:开源的 Office SDK,用插件架构、Canvas 渲染、公式引擎和一套在浏览器与 Node.js 通用的 Facade API,让产品内嵌表格、文档、演示、多维表格、看板和 PDF 能力。
  • 为什么这周会热:本周新增约 4,660 stars,总 stars 约 1.95 万。它最近把定位改成了"面向 AI Agent 的 Office harness",并围绕这一方向放出了一批配套项目——Univer Workspace、Univer CLI,以及面向 DeepSeek Harness、OpenClaw、WorkBuddy 的 Office 插件。
  • 有什么新意:在此之前,Office 文件在 Agent 工作流里的角色基本是"待解析的输入",最多被转换成文本或 Markdown。Univer 想做的是反过来:让人和 Agent 在同一个文件里工作,Agent 直接生成基于表格的小型应用,页面上的指标、图表和控件与单元格双向绑定并协同更新。文档从输入变成了共同工作介质。

补充观察:为什么非 AI 名单更短​

  • 严格与 AI 无关的项目本周只有 quiche 和 univer 两个,连"凑三个"都做不到;pytorch 属于机器学习基础层而非 Agent 工具链,之所以放在本节,是因为它代表的是不随热点变动的计算底座。
  • 上周能靠实时空间数据和文档转换撑起非 AI 分类,本周这两类都没有出现新的强项目,说明 Trending 的 AI 集中度比上周更高,而不是本文的挑选标准变严了。
  • 值得留意的是,univer 之所以变热,理由本身也是"为 Agent 服务"。也就是说,本周几乎每一个上榜项目,无论底层是什么技术,都在调整定位去适配 Agent——这本身是比任何单项热度都更明确的信号。

技术趋势分析​

1. Skills 正在取代提示词,成为能力的分发格式​

Cloudflare 的安全审计 skill、Anthropic 的岗位插件与金融行业 agent、addyosmani 的 25 个工程 skill、ECC 的 292 个 skill——它们的技术形态高度一致:markdown 与 JSON 文件、无构建步骤、按需加载、可版本化、可审阅。这种一致性说明社区已经找到了一个足够好的封装方式。随之而来的问题也很清楚:当 skill 能触发工具、注入 hooks、携带凭据时,它就是一个软件供应链组件。ECC 内置的 AgentShield 扫描和 README 里对第三方镜像的警告,正是这个阶段该出现的反应。

2. 记忆和凭据被拆成独立层​

hindsight 把长期记忆做成有基准、有论文、可独立部署的服务,并区分"检索历史"和"生成带倾向的回应"两种操作;treg 把外部工具的认证收敛到一个只转发不建模的代理;Octop 让记忆随工作区迁移。三者共用同一个判断:Agent 的主体逻辑不应该持有状态和密钥。把这两样东西从上下文中拿出来,既降低了泄露面,也让 Agent 可以被替换而不用重建积累。

3. 治理成为多 Agent 的一等需求​

Paperclip 把组织架构、预算上限、审批门和绩效评审搬进编排产品,Orca 用工作台统一隔离与审阅,Cloudflare 则要求 OS 级沙箱才执行不可信代码。它们的出现顺序值得注意:先有多 Agent 并行的能力,再有把"谁负责、花多少钱、何时需要人介入"制度化的需求。这和团队扩张时发生的事几乎一样。

4. 垂直化参考实现开始代替通用助手​

金融行业的 11 个命名 agent、知识工作者的 11 个岗位插件、WeKnora 的企业知识库治理、Octop 的家庭与小团队场景——这些项目的共同点是把行业流程、术语、数据源和权限模型一次性打包。值得注意的是它们都不主张"更聪明",而是主张"更贴合现有流程",并且普遍把人工签收点写进默认设计。

5. 评测和基准成为发布内容的一部分​

open-code-review 公开了 1,505 条标注缺陷的数据集和精度优于通用 Agent、召回更低的取舍;hindsight 引用了第三方研究中心和媒体的独立复现;CLI-Anything 列出 2,461 个通过的测试和一份技术报告。讨论的焦点从"能做什么"转向"如何证明做对了",而且越来越多的项目愿意公开自己做得不好的那一面。

6. 开源核心加托管增值已成标准结构​

hindsight 是 MIT 加托管云和 Kubernetes 部署,ECC 是 MIT 加面向私有仓库的 GitHub App,Orca 允许使用自带订阅并同时提供手机端与远程运行时,treg 官方托管但明确说明任何人都可自托管。这些项目的商业化路径高度相似:核心能力开源以换取采用和信任,把运维、协作、合规和私有部署能力留给付费层。

本周最值得关注的新鲜点​

  • 安全审计 skill 公开承认单次运行的覆盖不足。 单次大约只能发现重复运行总量的一半,因此把多次运行设计成账本叠加的增量过程,而不是一次跑完。
  • 对抗式验证成为约定。 发现问题的 Agent 永远不负责验证自己的结论,每个候选都交给一个独立的、以推翻为目标的验证者。
  • 同一份 Agent 定义同时面向插件和无头 API。 金融行业 agent 的提示词与 skills 在 Cowork 插件和 Managed Agents 之间完全共享,能力一次编写、两处运行。
  • Agent 记忆开始有论文和第三方复现。 性能主张不再只是厂商自报,逐模型的准确率、延迟和成本在线持续更新。
  • 工具的凭据边界被单独建模。 只转发不建模的代理、密钥留在本地的自托管助手、主动扫描配置文件的 AgentShield——三件事指向同一个方向。
  • Office 套件被重新定义为 Agent 的工作面。 文档不再只是被解析的输入,而是人和 Agent 共用的、带双向绑定的工作介质。

结语​

用一句话概括本周 GitHub Trending:Agent 的能力正在被拆开、封装、并在明确的边界内交付——方法进 skill,状态进独立记忆,权限进凭据代理,风险进沙箱和审批门。

这个方向对模型的依赖反而降低了。越来越多项目在证明:让 Agent 真正可用的,不是更长的上下文或更强的推理,而是它周围那些不起眼但必须存在的层——可安装的流程、可回滚的记忆、不暴露的密钥、能证明覆盖率的账本,以及一个知道何时停下来的预算上限。