【摘要】
第一,human-review是petergyang开源的可视化人工审查工具,9月10日部分GitHub AI热点速览将其列入人工审查类前列;它不重跑模型推理,而是把Agent产出的HTML、Markdown、localhost页面在浏览器里打开,人直接改文字、拖图片、锚定评论,再整包发回Agent。
第二,信任问题不在“模型会不会写”,而在“改完之后人能不能低成本知道它动了哪里、为什么动、要不要回滚”;human-review用所见即所得编辑加位置锚定评论,替代纯对话框描述修改,降低多轮口头校对成本。
第三,它本地起服务、无账号、无云、无API Key,适合落地页、PRD、文档、轻量前端的人工终检;纯代码多文件diff、强制审批流、团队级审计要另接Plannotator、LaReview或CI代码评审,不能把它当完整治理平台。
一、Agent跑完不知道改了什么,痛点在反馈带宽
用Claude Code、Codex、Cursor做生成时,最累的不是让模型出第一版,而是改第二版。想在落地页删废话、把主图缩到60%、第三段改短、CTA重写,若在对话框描述,要写四五行还不一定对应页面位置;模型改完再逐条比对,既烧上下文又容易漏。终端git diff能看代码增删,但HTML视觉块、Markdown排版、图片位置、文案语气不是纯行号问题。
human-review的思路是把“用语言描述修改”换成“在结果上直接操作”。对HTML/Markdown启动本地审查会话,浏览器渲染文件,人选中句子改字、加粗、列表、插链接,对图片拖角缩放、对区块拖拽重排,对任意段落或图表锚定评论;点Send后所有编辑和评论打包回传Agent,Agent改源文件并刷新视图。它解决的是人工审查最后一公里:人不重新解释需求,只指着页面说这里、这里、还是这里。
人工审查反馈带宽对照(定性)纯对话框改需求 ━━━━━━━━━ 描述长、位置歧义、需多轮确认git/终端diff ━━━━━━━━━━━ 代码行清楚、HTML/图文/排版不直观human-review ━━━━━━━━━━━━━━━━ 页面直改+锚定评论+整包回传说明:带宽越高不代表模型更聪明,只代表“人表达修改意图”更省、返工更少。
二、本地服务、SDK、Agent技能三段协同
仓库结构按职责拆:cli.js负责setup、启动、状态轮询;server.js起本地审查服务;sdk.js处理编辑、高亮、评论、反馈打包;chrome-client.js是浏览器可视化界面;markdown.js渲染MD;SKILL.md教Claude Code、Codex等接入。整体跑本机,不强制账号、不接外部数据库、不要求API Key。
工作流很短。安装用npx -y human-review setup —global,会话里对目标文件执行/human-review路径,浏览器打开后直接编。HTML改动能自动保存,图片缩放位置可拖;Markdown和localhost页面编辑后点Send,反馈进Agent。若Agent本轮已结束,再发消息可让它将反馈接上;关标签页或点End review都会释放审查会话,未发送批注可恢复或丢弃。这对“模型先跑、人后审”的混合模式很关键:人不必全程盯着,审完再回传即可。
| 模块 | 职责 | 对人工审查的价值 |
|---|---|---|
| cli.js | 安装、启动、状态 | 一条命令接进现有Agent工作流 |
| server.js | 本地会话 | 文件不强制上云,审查过程本机闭环 |
| sdk.js | 编辑/评论/反馈 | 把鼠标操作转成结构化回传载荷 |
| chrome-client | 可视化界面 | 非技术人员也能看页面批注 |
| SKILL.md | Agent接入说明 | Claude Code/Codex等可按技能调用 |
表:human-review本机审查组件分工
三、它审“决策点”审到什么程度
用户简讯说“关键决策点可视化交人工审查”,要实事求是界定。human-review更偏交付物级审查:文案结论、页面结构、图文位置、Markdown章节、localhost UI表现。它让人看到Agent最终改了什么并批注打回,但不是自动抽取“Agent为何选择A函数不选B函数”的决策树。若要把代码决策点可视化,需要补一层diff/计划/规则。
同类对照有助于选型。Plannotator走“AI先出计划→人浏览器批注→改计划再执行→diff确认”,更适合多文件代码任务的计划审批;LaReview把PR/diff转结构化审查计划、系统影响和图表,偏高级工程师深度CR;阿里OpenCodeReview用确定性工程加Agent做行级CR、接CI,适合团队代码库但非纯人工可视化批注。human-review的位置在前面这一段:人审页面和文档、把主观意见转成可执行反馈,不替代代码库级强制审批。
不同审查对象的工具适配(定性)HTML落地页/营销文案/MD方案 ━━━ human-review直改批注最省事多文件代码计划与执行diff ━━━ Plannotator计划审+diff确认PR行级缺陷/架构影响 ━━━ LaReview/OCR/CI规则评审强制人工门禁+审计留痕 ━━━ 工作流系统+上述工具组合,不单靠一项
四、信任、隐私与边界
本地优先是它主要卖点。无账号、无云服务、无API Key,HTML直改存源文件,Markdown/localhost批注经本机服务回传;不涉及外部模型网关时,文档内容可不离开本机。但边界要说清:它只支持HTML和Markdown,复杂富媒体、电子表格、设计源文件不在主范围;批注最终由Agent执行,若Agent系统未接权限控制,Send后仍可能改到无关文件;多人在同页实时协作不是其强项,团队级评审要接仓库PR或托管工作区。
适合谁用很明确。独立开发者用Claude Code/Codex出落地页,自己审版式文案;产品运营用Agent写PRD、方案、活动页,非技术同事直接浏览器改而不是学prompt;前端原型跑localhost,先人工看交互文案和布局再提交代码。不适合谁也同样明确:大型代码库要求每次变更强制双人审批,需用PR平台加CI;超长文档要求版本对比、建议合并、自动一致性检查,需接专业文档评审;涉及机密合同、密钥、个人隐私材料,即便本机也应在发送前剥离敏感字段,避免批注载荷带出。
部署与信任建议(定性)单人或小团队本机审页面/文档 ████████████████ 最匹配human-reviewAgent出代码+人要审计划diff ██████████ 补Plannotator/IDE diff团队PR强制门禁+行级CR ██████ 补LaReview/OCR/CI规则强合规留痕、跨组织审计 ████ 需工作流系统+访问日志+审批记录说明:human-review降低“表达修改”的成本,不自动承担“合规批准”的责任。
五、为什么它值得进Agent工作流
很多Agent治理方案一上来做权限、沙箱、决策日志,工程重、上手慢。human-review反着来:先让人看得懂、改得动、回传得准。模型能力越强,人在交付前做低带宽校对越值钱——不是代替模型决策,而是把“最终是否采用”的控制权留在人手里。9月10日热点将其归入“AI产出人审把关”这一类,方向和agent-memory、reef形成记忆、人审、学习三件配套:记忆解决跨会话不忘,人审解决关键产出可控,学习解决长期迭代;缺人审那一层,记忆和学习越多反而越容易把错误自动放大。