human-review把AI改动变可审:浏览器改HTML/Markdown,批注一键回传Agent

2026-09-11 10:04 👁️ 3 阅读

【摘要】
第一,human-review是petergyang开源的可视化人工审查工具,9月10日部分GitHub AI热点速览将其列入人工审查类前列;它不重跑模型推理,而是把Agent产出的HTML、Markdown、localhost页面在浏览器里打开,人直接改文字、拖图片、锚定评论,再整包发回Agent。
第二,信任问题不在“模型会不会写”,而在“改完之后人能不能低成本知道它动了哪里、为什么动、要不要回滚”;human-review用所见即所得编辑加位置锚定评论,替代纯对话框描述修改,降低多轮口头校对成本。
第三,它本地起服务、无账号、无云、无API Key,适合落地页、PRD、文档、轻量前端的人工终检;纯代码多文件diff、强制审批流、团队级审计要另接Plannotator、LaReview或CI代码评审,不能把它当完整治理平台。

一、Agent跑完不知道改了什么,痛点在反馈带宽

用Claude Code、Codex、Cursor做生成时,最累的不是让模型出第一版,而是改第二版。想在落地页删废话、把主图缩到60%、第三段改短、CTA重写,若在对话框描述,要写四五行还不一定对应页面位置;模型改完再逐条比对,既烧上下文又容易漏。终端git diff能看代码增删,但HTML视觉块、Markdown排版、图片位置、文案语气不是纯行号问题。

human-review的思路是把“用语言描述修改”换成“在结果上直接操作”。对HTML/Markdown启动本地审查会话,浏览器渲染文件,人选中句子改字、加粗、列表、插链接,对图片拖角缩放、对区块拖拽重排,对任意段落或图表锚定评论;点Send后所有编辑和评论打包回传Agent,Agent改源文件并刷新视图。它解决的是人工审查最后一公里:人不重新解释需求,只指着页面说这里、这里、还是这里。

  1. 人工审查反馈带宽对照(定性)
  2. 纯对话框改需求 ━━━━━━━━━ 描述长、位置歧义、需多轮确认
  3. git/终端diff ━━━━━━━━━━━ 代码行清楚、HTML/图文/排版不直观
  4. human-review ━━━━━━━━━━━━━━━━ 页面直改+锚定评论+整包回传
  5. 说明:带宽越高不代表模型更聪明,只代表“人表达修改意图”更省、返工更少。

二、本地服务、SDK、Agent技能三段协同

仓库结构按职责拆:cli.js负责setup、启动、状态轮询;server.js起本地审查服务;sdk.js处理编辑、高亮、评论、反馈打包;chrome-client.js是浏览器可视化界面;markdown.js渲染MD;SKILL.md教Claude Code、Codex等接入。整体跑本机,不强制账号、不接外部数据库、不要求API Key。

工作流很短。安装用npx -y human-review setup —global,会话里对目标文件执行/human-review路径,浏览器打开后直接编。HTML改动能自动保存,图片缩放位置可拖;Markdown和localhost页面编辑后点Send,反馈进Agent。若Agent本轮已结束,再发消息可让它将反馈接上;关标签页或点End review都会释放审查会话,未发送批注可恢复或丢弃。这对“模型先跑、人后审”的混合模式很关键:人不必全程盯着,审完再回传即可。

模块 职责 对人工审查的价值
cli.js 安装、启动、状态 一条命令接进现有Agent工作流
server.js 本地会话 文件不强制上云,审查过程本机闭环
sdk.js 编辑/评论/反馈 把鼠标操作转成结构化回传载荷
chrome-client 可视化界面 非技术人员也能看页面批注
SKILL.md Agent接入说明 Claude Code/Codex等可按技能调用

表:human-review本机审查组件分工

三、它审“决策点”审到什么程度

用户简讯说“关键决策点可视化交人工审查”,要实事求是界定。human-review更偏交付物级审查:文案结论、页面结构、图文位置、Markdown章节、localhost UI表现。它让人看到Agent最终改了什么并批注打回,但不是自动抽取“Agent为何选择A函数不选B函数”的决策树。若要把代码决策点可视化,需要补一层diff/计划/规则。

同类对照有助于选型。Plannotator走“AI先出计划→人浏览器批注→改计划再执行→diff确认”,更适合多文件代码任务的计划审批;LaReview把PR/diff转结构化审查计划、系统影响和图表,偏高级工程师深度CR;阿里OpenCodeReview用确定性工程加Agent做行级CR、接CI,适合团队代码库但非纯人工可视化批注。human-review的位置在前面这一段:人审页面和文档、把主观意见转成可执行反馈,不替代代码库级强制审批。

  1. 不同审查对象的工具适配(定性)
  2. HTML落地页/营销文案/MD方案 ━━━ human-review直改批注最省事
  3. 多文件代码计划与执行diff ━━━ Plannotator计划审+diff确认
  4. PR行级缺陷/架构影响 ━━━ LaReview/OCR/CI规则评审
  5. 强制人工门禁+审计留痕 ━━━ 工作流系统+上述工具组合,不单靠一项

四、信任、隐私与边界

本地优先是它主要卖点。无账号、无云服务、无API Key,HTML直改存源文件,Markdown/localhost批注经本机服务回传;不涉及外部模型网关时,文档内容可不离开本机。但边界要说清:它只支持HTML和Markdown,复杂富媒体、电子表格、设计源文件不在主范围;批注最终由Agent执行,若Agent系统未接权限控制,Send后仍可能改到无关文件;多人在同页实时协作不是其强项,团队级评审要接仓库PR或托管工作区。

适合谁用很明确。独立开发者用Claude Code/Codex出落地页,自己审版式文案;产品运营用Agent写PRD、方案、活动页,非技术同事直接浏览器改而不是学prompt;前端原型跑localhost,先人工看交互文案和布局再提交代码。不适合谁也同样明确:大型代码库要求每次变更强制双人审批,需用PR平台加CI;超长文档要求版本对比、建议合并、自动一致性检查,需接专业文档评审;涉及机密合同、密钥、个人隐私材料,即便本机也应在发送前剥离敏感字段,避免批注载荷带出。

  1. 部署与信任建议(定性)
  2. 单人或小团队本机审页面/文档 ████████████████ 最匹配human-review
  3. Agent出代码+人要审计划diff ██████████ Plannotator/IDE diff
  4. 团队PR强制门禁+行级CR ██████ LaReview/OCR/CI规则
  5. 强合规留痕、跨组织审计 ████ 需工作流系统+访问日志+审批记录
  6. 说明:human-review降低“表达修改”的成本,不自动承担“合规批准”的责任。

五、为什么它值得进Agent工作流

很多Agent治理方案一上来做权限、沙箱、决策日志,工程重、上手慢。human-review反着来:先让人看得懂、改得动、回传得准。模型能力越强,人在交付前做低带宽校对越值钱——不是代替模型决策,而是把“最终是否采用”的控制权留在人手里。9月10日热点将其归入“AI产出人审把关”这一类,方向和agent-memory、reef形成记忆、人审、学习三件配套:记忆解决跨会话不忘,人审解决关键产出可控,学习解决长期迭代;缺人审那一层,记忆和学习越多反而越容易把错误自动放大。