Paperclip 深度评测:9.7 万 Star 的 AI 员工管理系统,4775 个提交里 2127 个署名 AI 员工,6 道自检闸门我跑出一道漏报

Paperclip 深度评测:9.7 万 Star 的 AI 员工管理系统,4775 个提交里 2127 个署名 AI 员工,6 道自检闸门我跑出一道漏报

同时开着五个 AI 编程终端的人,最后都会变成同一个角色:接线员。谁的活干完了、谁的活卡住了、这个月又烧了多少钱,全靠你在窗口之间来回切。Paperclip 想做的不是再给你一个终端,而是把「指挥一群 AI 干活」变成一件有组织、有预算、有审批的事。它已经有 9.7 万 Star。

比星数更让我想认真写它的,是另一件事:这个项目规定,AI 员工提交代码时必须在提交信息里署上自己的名字。我把仓库拉下来数了一遍——4775 个提交里,2127 个署着这个名字,占 44.5%。

先说它到底是什么

一句话:Paperclip 不是又一个新的 AI 助手,而是一套用来管理一批 AI 助手的软件。它自己的说法更直白——「如果 OpenClaw 是一个员工,Paperclip 就是公司」。OpenClaw(一个能在你电脑上常驻、随时接消息干活的 AI 助手程序)负责干活,Paperclip 负责给这些干活的 AI 排职位、划预算、定汇报关系。

它解决的问题很具体。你手上可能同时开着二十个 AI 窗口,各有各的活,但它们之间没有组织关系:不知道公司今年要做什么,不知道自己这一步卡在谁那里,也不知道这个月一共花了多少钱。Paperclip 给每个 AI 配上职位、上级、预算和审批线,让你从一块看板上统管。

它自己把这套东西拆成四块:

支柱 给谁用 管什么
AI 任务管理 所有人,每天 任务、审批闸门、可审阅的执行记录,从改动、截图、测试里验收成果
AI 组织架构 带团队的人 人和 AI 混编的组织图、权限、职责边界、密钥范围
AI 员工培训 想提升产能的人 技能工作室、共享技能、评测与保存的测试运行、技能版本回滚
AI 操作系统 IT 与平台 跨供应商运行、沙箱隔离、外部接口接入、单点登录、成本管控

技术形态上,它是一个 Node.js 服务端加一个 React 网页控制台,代码按功能拆成多个包。规模是这样的:

部分 作用 实测规模
服务端与各功能包 接口、调度与业务逻辑 6,037 个 TypeScript 文件,约 228 万行(含测试)
数据库层 表结构与历史迁移 293 个 SQL 迁移脚本
适配器 把不同品牌的 AI 接进来 12 个适配器目录,覆盖 10 个品牌
自带技能 发给 AI 员工读的工作说明 7 个技能,其中主技能单个文件 64,910 字节
测试 保住上面这些不出错 2,191 个测试文件,两万两千多个测试用例

它是怎么把一群 AI 编成一家公司的

三个机制值得单独说,因为它们是这套东西和「一堆散装脚本」的分界线。

心跳:AI 员工平时是睡着的

AI 员工不是一个一直开着的进程。平时它是睡着的,Paperclip 有事才把它唤醒,给它一小段执行时间,干完就让它退出。这个设计对使用者意味着两件事:一是不会有一堆进程常驻在后台空烧钱;二是每次醒来的背景信息由服务端提供,不依赖它自己记不记得上次干了什么。

原子认领:一个任务只能被一个执行者拿走

同一个任务,同一时刻只能被一个执行者领走,靠一把执行锁保证。这条看着不起眼,但它是「二十个 AI 同时开工」不出乱子的前提——没有它,两个 AI 会同时认领同一个任务,干完互相覆盖。

预算硬停:超了是真的会停

花销按公司、按 AI、按项目分别记账,超过预警线就告警,到了硬上限就把活停掉。它自己的说明也如实写了边界:停的依据是已经记录下来的花销,正在进行中的活可能让停晚一步生效。

实测一:它到底有多少代码是 AI 写的

回到开头那个数字。我把仓库拉进隔离沙箱(一个只有只读系统目录、用完即删的评测环境,本机是生产机,不敢把陌生代码直接跑在主机上),数了全部历史:

口径 数字
提交总数 4,775 个
其中署 Co-Authored-By: Paperclip 的 2,127 个,占 44.5%
另有带 Claude 署名的提交 829 个
合并提交(带合并记录的那种) 376 个

这个署名不是社区自发的,是写在它自己技能说明里的硬规矩,用的是全大写的要求句式:只要提交代码,就必须原样附上这一行,而且特意补了一句——不要署你自己那个 AI 的名字,署「Paperclip」。

趋势更清楚。把这份署名按月份拆开,占当月提交的比例是:3 月 32%、4 月 43%、5 月 60%、6 月 46%、7 月 66%、8 月 42%、9 月 72%、10 月(到 4 日)68%。整体在往上走,中间有起伏,最近两个月稳定在七成上下。也就是说,这个仓库越来越像是它自己造出来的。

这里必须把话说完整,免得记错功劳:带这个署名的提交,作者那一栏仍然是人类账号。合理且唯一说得通的解释是——AI 在人的监督下干活,最后由人按下提交那一下。所以「44.5% 的代码是 AI 自己提交的」这句里的「自己」,指的是这段工作由 AI 完成,不是无人值守。

顺带一个细节:这个仓库自带一套统计脚本,专门去查全世界的代码仓库里有多少提交带这个署名,默认查询语句就是上面那个邮箱。它把自己的存在当成一个可以统计的现象。

实测二:6 道自检闸门,我跑出一道漏报

一个天天讲治理、审批、权限的项目,自己的仓库管得怎么样?它的包里定义了 5 道自检命令,我全部在沙箱里跑了一遍:

自检 它想拦什么 我跑的结果
禁止 AI 自行推送代码 适配器和运行时代码里不许出现 git push 通过
模块边界 功能模块之间不许越界互相引用 通过
Node 版本策略 锁定运行环境的版本下限 通过
设计令牌闸门 界面代码里不许写死颜色和字号 通过
Docker 依赖阶段 构建分层的依赖顺序 通过
泄露关键词扫描 发布前扫描不许出现在代码里的内部词 在干净仓库上通过,但我复现出一个漏报

最后一道最值得说。它的做法是:从一个本地清单里读出一串「不许出现的关键词」,然后用 git 的全文搜索功能在整棵代码树上找一遍,找到就阻断发布。我在沙箱里把最脏的情况构造出来,让它去找这个仓库里最高频的那几个词:

我让它找的词 实际命中量 它的结论
Dotta(一位贡献者名) 10.9 万字节 正确拦下
skill 343 万字节 报告「干净,没找到」
Paperclip 847 万字节 报告「干净,没找到」

原因我复现出来了,是个很典型的坑:它用 Node 的进程调用去跑 git,而这类调用的返回缓冲区默认只有 1 MB,命中量一超过 1 MB 就会抛错;它的代码把「抛错」和「没找到」当成同一件事吞掉了。结果就是——越是高频的敏感词,这道闸门越抓不到。

这不是致命故障:正常流程里关键词清单是短而具体的,不容易撑爆 1 MB。但它暴露了一类问题——衡量一个项目的治理能力,不能只看它有没有闸门,得看闸门在最坏输入下的行为。我上一轮评测里也撞见过同类的落差,可见这是这个品类的通病,不是这一家的孤例。

放在坐标系里看

先说清它不是谁。它和主流的编码助手(Claude Code、Codex 这类)不是同一种东西,也不是替代关系——那些相当于干活的员工,Paperclip 相当于管员工的办公室。它自己列了十二个适配器目录、覆盖十个品牌的 AI,从官方那几家到开源的都有,路线说白了就是「谁的员工都能招」。

热度得看两个口径,差别很大:

口径 数字 参照
GitHub 收藏 97,161 排得进第一梯队
每周 npm 安装量 59,341 同一周,OpenCode 是 321 万,Codex 是 2,552 万

这组反差说明:收藏它的人很多,真正装到自己机器上跑的人还很少。这跟它的形态一致——你得先有一台能常驻的服务、一堆要管的 AI,它才有意义。围观成本低,上手成本高。

还有两个要提前知道的坑:一是它的待处理清单堆得很长,2,733 个未关闭的问题,加上 3,639 个没合并的改动请求,其中 1,228 个是六月以前就开着的;二是它的路线图里还剩 6 项标注为「计划中」的能力,包括桌面应用和把外部工单系统(Asana、Linear、Jira 那一类)接进来当入口。

适合谁:手上真的同时在跑多个 AI 任务、并且已经开始为「谁在做什么、花了多少」头疼的人或小团队。它自带团队模板和技能商店,第一家公司能比较快搭起来。

不适合谁:只用一个 AI 助手写代码的人——你不需要开一家公司来管一个员工;以及想开箱即用的人——它要求 Node 24.11 以上,需要自己部署并长期维护一套服务。

我的判断

这是我这轮见过最有意思的一个项目,但有意思的地方不在功能表上。

它最大的价值是示范:一个 9.7 万 Star 的项目,把自己的开发流程也变成了产品的试验场——AI 员工按心跳干活、提交要署名、自检闸门管住模块边界和运行环境策略。前面那道漏报反而让这个示范更可信:它是真实的工程,不是营销话术。

具体怎么用:先把它当成一份「AI 员工怎么管」的活体参考——组织图、预算、审批、任务认领锁这几件事,就算你不上这套系统,把思路抄回自己团队也值。真要用,建议先用单机模式完整跑通一条任务,从派活到验收走一遍,别一上来就把二十个 AI 接进去。

这篇评测的全部数字都来自今天(2026 年 10 月 5 日)的沙箱实测和公开接口查询,仓库变化很快,尤其是待处理清单那一侧。

相关阅读:ayghri/i-have-adhd 深度评测(同样自带发布闸门却对自己判 FAIL 的那次),以及 taste-skill 复测(同样是逐条数提交,那次数出 63% 的提交只改了 README)。

关注 AI商业快讯,每天一篇 AI 热点深度解读。