——论衡 v2.5.13 实战复盘 + 人在环四节点边际收益分布
定稿 v4|T5 写手 v4 产出|论衡 lunheng-article-pipeline v2.5.13头部声明(M-Form-6 / M-Exist-3):小节 6(引子 + 5 节)|CJK 字数 约 5765(T5 估算 ±1%,权威核验由主控执行)|文献引用 5(T1)+ 数据 7(T2)+ 案例 3(T3)+ 配图 4(本地 SVG,零外发)|sha256 待主控核验v3 → v4 修订(C1-2 + C1-3 + C2-1):净 +37 字
引子:61% 用,7% 发
在 AI 写作这件事上,我们正处在一个奇特的错位里:工具用得越多,人越不敢放手。
2025 年,Gotham Ghostwriters 与 Publishers Weekly 联合发布了一份覆盖 1,481 名职业写作者的调查:61% 的人已经在用 AI 工具写作,平均自报生产力提升 31%;但只有 7% 的人敢直接发布 AI 生成的文本;91% 的人担心 AI 会引入事实性错误(Gotham Ghostwriters, 2025)。61% 与 7% 之间那道巨大的鸿沟,就是这篇文章要谈的东西:信任落差。
这种落差不是职业写作者的专属焦虑。长文写作——深度报道、行业分析、学术综述——恰恰是 AI 最容易翻车、又最需要质量保证的领域。一篇 5000 字的行业分析,如果中间埋着三个编造的数据点,读者很难发现,损失却很大。论衡这个项目想做的,就是用工程手段把幻觉挡在发表之前。它的样本很小,只有 5 个实战项目;但正因为小,每个环节的成败都看得清清楚楚。
过去两周,我用论衡跑完了 5 个实战项目,交付 4 个,成功率 80%。其中最有意思的,恰恰是最”不自动”的那个项目:一篇关于”崩老头”现象的公众号深度文。它花了 6.5 小时,经历了至少 4 次执行层故障、2 轮审计打回、主人 5 次以上的人工介入,最后反而成为三个案例里质量最高、过程最有价值的一个。
这篇文章想回答一个反直觉的问题:为什么”最不自动”的项目,反而是质量天花板?我的结论是:全自动无人值守必然失败——80% 的成功率不是自动化程度的结果,而是”人在环 + 结构化防御”的结果。下面我会用论衡的三层防御、人在环四节点的边际收益分布、多 Agent 流水线的真实成本,以及行业层面的信任落差与评审盲区,逐层把这个结论拆开。
一、论衡的三层防御:80% 不是碰运气
论衡是一套把长文写作拆成流水线的多 Agent 系统,从 v2.0.5 迭代到 v2.5.13,可核验版本号 62 个以上。它凭什么做到 80% 的实战成功率,而不是”碰运气”?拆开看,是三层防御结构在起作用。
第一层:三角验证。每一篇文章的证据,都由三路并行检索独立产出——文献、数据、案例——三方互不喂稿,最后交叉核验。崩老头项目一期就沉淀了 15 篇文献主卡、48 张数据卡、5 张案例卡,构成证据底座。任何单一来源”看起来合理”的内容,都会被另外两路戳穿;一个数据点如果只有孤证,就不许进正文。
这套机制的可靠性,从数据冲突的处理方式上最能看出来。全屋定制的发布口径,任务书与文件核验不一致,论衡的处理不是选一个顺眼的,而是把两层事实拆开标记:项目已交付、发布动作未确认;版本总数无法精确复原,就老老实实标”≥62 为可核验下限”。三角验证不消灭冲突,它让冲突可见。
第二层:M 门(机械合规门)。DOI 能不能解析、数据点有没有出处、案例时间线能不能核验——这些是机械化检查,不靠模型自觉。论衡还有一个外部审计环:ClawHub scanner。它的反馈闭环已经跑满 4 轮以上——v2.1.1 回应 7 项 findings、v2.2.3 沉淀 9 条教训、v2.2.12 强化数据铁律、v2.5.13 回应安全审计的 SDI-1/SDI-4——每一轮 findings 都被消化成版本变更。这就是”审计—修复闭环”:错误不是靠自觉避免的,是靠机制消灭的。
M 门检查的具体形态很朴素:每条引用必须能解析、每个数字必须能溯源、每个案例必须能对上时间线。崩老头两轮审计打回里的硬伤——”上海”实为”广州”、女主播”小鹿”姓名查无出处、淄博案数据超源——本质上都是这类机械检查能拦下的问题;它们被拦下,靠的不是模型自觉,而是检查清单。
第三层:F 失败模式。NeurIPS 2025 上,Cemri 等人基于 1600 多条多 Agent 系统标注轨迹,识别出 14 种失败模式,归为三大类:系统设计问题、agent 间错位、任务验证(Cemri 等, 2025)。这份分类学的标注一致性 kappa 高达 0.88——失败模式不是印象式的,是可复现的。注意,”任务验证”是三大失败类之一——而验证恰恰是论衡流水线里的一等公民。这与 WriteHERE 的思路同构:EMNLP 2025 的这篇 Oral 论文主张,长文写作 agent 应当让检索、推理、写作三类任务动态交织,把”验证”作为一等任务随时插入,而不是事后补救(Xiong 等, 2025)。换句话说,论衡的 F 防御不是发明了新的失败清单,而是把学术界已经分类好的失败模式,变成流水线里的检查点。
三层防御还有一层隐含含义:流水线自己的失败,会成为下一版本的改进来源。v2.5.5 起所有 P0 级改进——写盘双重校验、8 分钟硬卡、M-Form-6/M-Exist-3 自检——源头都是实战失败复盘。这些 P0 落地后,口腔 AI 式的”假完成”写盘失败再没让主控误判过——这是机制生效的证明。这个机制,后文还会展开。
二、人在环四节点:边际收益分布不均

如果说三层防御是骨架,那么”人在环”就是灵魂。把崩老头项目从头到尾看一遍,主人的介入可以拆成四个节点,每个节点的边际收益完全不同。这不是流程冗余,而是质量结构。
2.1 Phase 0 定题:边际收益最高(⭐⭐⭐⭐⭐)
崩老头项目 09:30 完成 Phase 0 定题,整个流程到 16:16 才终检,前后 6.5 小时。Phase 0 的产出物是任务简报与证据目录——09:30 定题,09:32 三路检索就绪,整个项目的骨架在开工两分钟内就已定型。定题这个动作本身只用了几分钟,却决定了下游所有检索方向与证据包形状。主题最终定为”一场静默的代际资源再分配”——退休金经情感消费场景,从父代单向流向年轻从业者、平台与 MCN——这个框架一旦定下,证据底座往哪个方向生长就基本锁死。定题即定证据底座,这是四节点里杠杆最大的一个。杠杆最大的节点,未必是耗时最长的节点——下一个节点就轻得多,但同样关键。
2.2 Phase 2.5 大纲确认:轻量但关键(⭐⭐⭐⭐)
09:40 分析员交出大纲,09:43 主人批复,只有四个字:”紧扣主题,继续”。这看起来是最轻的一次介入,效果却极重:随后主人投喂了 5 篇新料 URL——搜狐记者卧底、腾讯扬子晚报、知乎施伟杰田野调查等——直接触发 v3 定向重写。开场锚点从陈伯换成施伟杰,新增康奈尔与斯金纳两个理论锚点,核心证据包整体重排;重写后的主文 7359 字,新增案例卡与补充数据、文献,证据底座从一期基础继续加厚。一次轻量确认加一次定向投喂,改变的是全文的证据结构。这种”轻介入、重效果”的节点,恰恰是大多数自动化方案里不存在的一环——没有主人,就没有这次重写。
2.3 Phase 3.5 主人洞察:灵魂级纠偏(⭐⭐⭐⭐)
崩老头项目最值钱的部分,是 4 处”灵魂级”纠偏,全部来自主人的直觉,没有一处是技能自动生成的。
第一处,”崩阿姨”降权。主人指出,中老年女性侧的”崩阿姨”现象存在但不普遍,不能与”崩老头”等量齐观。这一处本文只作旁注,不展开,后续可作独立延伸案例。第二处,男性从业者主导的证据强度。现有证据几乎全部集中在男性从业者一侧,文章不能把供给侧性别结构的复杂性抹平。第三处,康奈尔理论的适用性——它只适用于男性侧,不能外推到女性侧,理论边界被主人一句话钉死。第四处,情感代偿与代际资源再分配的概念辨析:两个框架看似相近,实则指向不同的解释路径。
这四处在审计清单里一条都找不到。它们不是”验证”出来的,是主人读稿时”觉得不对”出来的。到了终检,杠杆骤降——但它的存在,恰恰兜住前三个节点都看不见的盲区。
2.4 Phase 5 终检:盲区兜底(⭐⭐)
Phase 5 终检的边际收益相对最低,更多是交付物完整性:配图、PDF、去标注版。但恰恰是这个环节暴露了系统最深的盲区:T5-final 独立审计跑了 G0-G8 八个维度,给了总评 A-,却漏掉了”成品度”——”v2 稿””新增段”这类编辑残留混在终稿里,是主人在深度审计时逐个抓出来的。审计查不到审计自己的盲区,这个任务只能交给审计之外的人。人在环在这里不是冗余确认,而是流水线盲区的兜底层:机器检查不到的地方,人兜住。这也是为什么论衡把终检交给人:终检的意义不在打分,而在兜住打不到的分。
2.5 横向对照:人在环强度 × 流水线成功

把三个案例摆在一起,双轴关系很清楚:人在环强度为横轴,流水线成功为纵轴。
崩老头(深度在环,🟡 一手):主人介入 5 个以上节点、投喂 5 篇新料、4 处纠偏,代价是 6.5 小时和至少 4 次执行层故障,换来 7359 字、8 节正文、6 项审稿意见全关闭、总评 A-。
全屋定制(轻量在环,🔴 二手转引,数字据论衡项目记录):主人只做了 3 个节点的最小确认,Phase 3.5 洞察直接跳过,流水线 0 失败、96 分钟跑完 5390 字、T9 评审 26/30 accept——三个案例里的最高分——但文章最终没有发布。没有投喂公众号,也没有投稿期刊,发布动作停在主人侧。流水线把文章写到可发布,价值兑现却在流水线之外——这是人在环的第四个隐藏节点:发布与采纳。
口腔 AI(轻量在环,🔴 二手转引):70 分钟跑完 5469 字,2 次子代理失败重试,T9 评审 23/30 minor revision。
对照的结论有两层。第一层:人在环强度与执行层故障数量正相关——介入越深,暴露的故障越多,但这恰恰是因为深度介入让故障变得可见;轻量在环的项目”看起来”更顺,代价是洞察零投喂——全屋定制后半部分数据厚度不足,只能以机制框架加头部经验外推来退化标注。第二层:全屋定制未发布,说明流水线交付不等于价值兑现。发布与采纳作为第四个隐藏节点,当前只能由主人完成:流水线交付的是文件,不是发布动作——崩老头与全屋定制都卡在最后一公里(崩老头有论衡内部交付 + 主人复盘记录,但同样未见外部平台发布;全屋定制则连内部复盘记录都未沉淀)。
理论锚:单节点效应拆到多节点
这组边际收益分布有理论锚点。Noy & Zhang 在 Science 上的随机对照实验证明:人在环写作平均耗时降低 40%、盲评质量提升 18%(Noy & Zhang, 2023)——那是单节点基线。论衡的四节点,本质上是把单节点效应拆到多节点流水线上,而且分布极不均匀。
反面证据同样重要。Doshi & Hauser 发现,生成式 AI 提升个体创造力、却收窄集体多样性——人若顺着 AI 的思路点头,反锚定就会发生(Doshi & Hauser, 2024)。Maier 等人的随机对照实验显示,模型主导模式显著提升想法质量、却降低多样性与所有权感知(N=486,另一情境验证 N=640)(Maier 等, 2026)。Schroeder 的预注册实验里,410 名标注者、7000 多条标注,人强烈采信 LLM 建议,导致标签分布漂移、模型成绩虚高(Schroeder 等, 2025)。人在环若没有批判性,会退化成同质化确认——这正好解释了为什么论衡把人放在”判断与纠偏”的位置,而不是”顺着点头”的位置。
三、行业图景:信任落差与评审盲区
论衡的实战不是孤例。把镜头拉远,整个行业都处在同样的结构里:一边是高采用率,一边是低直发率;一边是 AI 文本在评审层畅通无阻,一边是引用层危机四伏。
3.1 信任落差:61% 用,7% 发

回到开头的调查。61% 使用、7% 直发、91% 担心幻觉(Gotham Ghostwriters, 2025)。这个落差还可以再拆一层——质量感知分布:43% 的写作者认为 AI 提升了质量,49% 认为没什么变化,9% 认为变差了。超过一半的人不认为 AI 让写作变好,但六成的人还在用——因为”用”的成本低,”发”的代价高。
分群体看更明显。思想领导力写作者的采用率高达 84%,文字编辑只有 33%;小说作者里 42% 使用 AI,但只有 11% 用它创作可发布的文本。越靠内容吃饭的人,越不敢放手。
这组数字说明两件事。第一,AI 写作的行业主流形态本来就是”人在环”:63% 的写作者用 AI 生成文本后再自行编辑(Gotham Ghostwriters, 2025)——AI 文本几乎都经过人工编辑才落地,只是没人把它工程化命名。第二,质量提升不是必然,43/49/9 的分布就是证据;那些声称”AI 让写作质量起飞”的叙事,在真实职业写作者的感知里只占四成。六成人在用、四成人觉得没变化——这个组合本身就说明:AI 写作的价值不是白来的,是要靠人在环去兑现的。
3.2 长文是 LLM 的能力塌陷区
为什么长文写作尤其需要人在环?因为长文恰好是 LLM 能力塌陷最严重的区域。
HelloBench 2024 年实测了约 30 个主流模型:无论是否显式限长,多数 LLM 都无法生成超过 4000 字的文本;能生成的也普遍存在严重重复与质量下降。ConStory-Bench(ACL 2026)在 8000 到 10000 词的长故事里发现系统性一致性错误,尤其集中在事实追踪与时间推理——而且错误不是随机的,是聚集在可预测的叙事区域。LongHalluQA 为中文长文幻觉建立了 2,746 个高质量样本、覆盖 7 大主题;它的作者还测试了多 Agent 辩论框架,效果优于单模型验证——多个 agent 互相质询,比一个 agent 自问自答更能暴露幻觉,这与论衡的批判伙伴设计同构。
更关键的是自评不可信。LitBench 2025 显示,最强的零样本裁判 Claude-3.7-Sonnet,与人类判断的一致率也只有 73%——AI 自己评自己的长文,接近三成是错的。长文需要外部闸门,这就是论衡把审计做成独立环节、把终检交给主控亲自做的原因。这些基准指向同一个结论:长文不是 LLM 的舒适区,而是它的压力测试区。
3.3 评审盲区:审稿人看不出来

最令人不安的证据在学术评审层。European Heart Journal 2025 年做了一次盲审实验:在 1,348 篇真实投稿中混入 136 篇由 ChatGPT-4o 生成的摘要,人类与 AI 摘要的评分 3.3 对 3.3,p=0.85,无显著差异;19 个类别里有 6 类 AI 摘要拿到最高分;没有一篇被审稿人识别出来(Kresoja 等, 2025)。唯一被怀疑的两篇,理由是”疑似已发表”,而不是”疑似 AI 生成”——审稿人怀疑的是来源,不是作者。
骨科领域一项对照研究更精确地定位了幻觉所在:AI 论文的事实准确率高达 94.98% 到 100%,但引用准确率最低只有 35.14%(Woodrow 等, 2025)。
把两项研究合起来,结论很明确:幻觉不在”文字层”,在”证据链层”。AI 写的句子读起来天衣无缝,出问题的是它引用的来源、数字、人名。所以”人在环”的边际收益集中在哪里?不是润色文字,而是核验证据链。全自动的幻觉在评审层无人识别,人在环是最后一道真实防线——这是整个行业图景里最冷的一段。如果连受过训练的审稿人都无法识别 AI 文本,那么”发布前人工核验”就不是可选步骤,而是唯一可靠的闸门。
四、结语:人在环不是冗余确认,是质量下限
全自动无人值守必然失败——这是一句工程判断,不是修辞。回到开头的问题:为什么”最不自动”的崩老头,反而是质量天花板?
这个判断成立,有三个根源。执行层脆弱——配额耗尽、零产出、假完成,任何一环都能让流水线碎掉;审计盲区——八个维度也漏掉”成品度”;产出环节零验证——PDF 三个 bug(图片不渲染、标签不渲染、表格不渲染)全是主人逐个点出来的。三段各自成立,叠加起来,无人值守就是必然失败。
而人在环的不可替代性,集中体现在崩老头那 4 处灵魂级纠偏上:全部来自主人直觉,没有一处是自动生成的。这就是 Noy & Zhang 那 18% 质量增益在真实长文流水线上的复现,而且它集中发生在 Phase 3.5 这一个节点上(Noy & Zhang, 2023)。
未来会怎样?WriteHERE 在把”验证—修改”制度化(Xiong 等, 2025);SuperWriter 把”规划—写作—修改”三阶段显式注入生成流水线(SuperWriter, 2026)——AI 侧的趋势,是让验证成为一等公民。但论衡给出的答案是另一件事:把人的节点放在边际收益最高的位置——Phase 0 定题、Phase 2.5 大纲确认、Phase 3.5 洞察纠偏——而不是让人在每一个环节都签字。人在环不是流程仪式,是资源分配:把人的注意力花在杠杆最大的地方。这个答案与 Noy & Zhang 的发现一致:人的价值不在速度,而在判断。
这套打法的成本不低:四个节点里至少三个要占用主人的真实时间。但它买回来的东西——证据链的可靠性、发布时的底气——是自动化给不了的。工程上这叫把不可自动化的事,留给最贵的资源。
80% 的成功率不是自动化程度的结果,是人在环加结构化防御的结果。人在环不是冗余确认,是 AI 长文写作的质量下限。
附录 A:参考文献与数据来源
A.1 文献引用清单((按内联引用顺序)
[T1-1] Xiong, R., Chen, Y., Khizbullin, D., Zhuge, M., & Schmidhuber, J. (2025). Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Suzhou, China, pp. 24678–24714. Oral, Outstanding Paper Nomination. DOI: 10.18653/v1/2025.emnlp-main.1254(arXiv: 2503.08275)
[T1-2] Cemri, S., Pan, M. Z., Yang, S., Agrawal, L. A., Chopra, B., Tiwari, R., Keutzer, K., Parameswaran, A., Klein, D., Ramchandran, K., Zaharia, M., Gonzalez, J. E., & Stoica, I. (2025). Why Do Multi-Agent LLM Systems Fail? Advances in Neural Information Processing Systems 38 (NeurIPS 2025), San Diego, CA, USA, pp. 135676–135729. DOI: 10.52202/085713-4082(arXiv: 2503.13657)
[T1-3] Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science, 381(6654): 187–192. DOI: 10.1126/science.adh2586
[T1-4] Doshi, A. R., & Hauser, O. P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. Science Advances, 10(7): eadn5290. DOI: 10.1126/sciadv.adn5290
[T1-5] SuperWriter. (2026). ACL Findings 2026. DOI: 10.18653/v1/2026.findings-acl.428
A.2 数据来源汇总(按文中出现顺序)
[T2-1] 论衡版本历史(v2.0.5 → v2.5.13):论衡 lunheng-article-pipeline 项目内部 CHANGELOG 与 workspace MEMORY.md 实测。可信度 🟢 已发布(workspace 原始文件直接命中)
[T2-2] ClawHub scanner 反馈闭环 ≥4 轮:v2.1.1(7 项 findings)→ v2.2.3(教训 #43~#51 共 9 条)→ v2.2.12(finding #3)→ v2.5.13(安全审计 SDI-1/SDI-4)。可信度 🟢 已发布(workspace memory/2026-08-16-1532.md + 教训索引)
[T2-3] 实战成功率 4/5 = 80%:论衡 run/ 目录 5 个项目(崩老头 ✅ / 全屋定制 ✅ / 口腔 AI 综述 ✅ / 牛来出圈 ✅ / 灵活就业辩论 ⚠️)。可信度 🟢 已发布(workspace 一手文件核验)
[T2-4] Gotham Ghostwriters × Publishers Weekly 2025 调查:n=1,481 职业写作者;采用率 61% / 直发率 7% / 担心幻觉 91% / 质量感知 43%-49%-9%;63% 的写作者用 AI 生成文本后再自行编辑。可信度 🟢 已发布(Publishers Weekly 原文 web_fetch 命中,n=1,481)
[T2-5] 长文基准 4 项:
- HelloBench(2024):约 30 个主流模型实测,多数 LLM 无法生成超过 4000 字
- ConStory-Bench(ACL 2026):8000-10000 词长故事系统性一致性错误
- LongHalluQA:2,746 个中文长文幻觉高质量样本,覆盖 7 大主题
- LitBench(2025):Claude-3.7-Sonnet 与人类判断一致率仅 73%
可信度 🟢 已发布(论文原文核验)
[T2-6] 人在环实证 2 项:
- Maier 等(CHI’26):N=486 + 640,模型主导模式提升质量但降低多样性与所有权感知
- Schroeder 等(2025):410 标注者 / 7000+ 标注预注册实验,人强烈采信 LLM 建议导致标签分布漂移
可信度 🟢 已发布(论文原文核验)
[T2-7] 评审盲区 2 项:
- Kresoja 等(Eur Heart J 2025):136 篇 AI 摘要混入 1,348 篇投稿,评分 3.3 vs 3.3(p=0.85)无差异,0 篇被审稿人识别
- Woodrow 等(Arch Bone Jt Surg 2025):AI 论文事实准确率 94.98%-100%,但引用准确率最低仅 35.14%
可信度 🟢 已发布(论文原文核验)
A.3 案例来源汇总(按文中出现顺序)
[T3-1] 崩老头项目(论衡 v2.3,2026-08-14):🟡 一手(主人亲自参与 + 完整 run/ 目录 + 多段会话记录)。总耗时 2.5 小时 / 主文 7359 CJK 字 / 8 节 / PDF 18 页(3 + 1 封面)/ 子代理失败 ≥4 次 / 主人在环 ≥5 节点 / T5-final 独立审计 A-
[T3-2] 全屋定制品牌项目(论衡 v2.4.5,2026-08-24):🔴 二手转引(workspace 论衡教训记录转引)。总耗时 96 分钟 / 5390 纯汉字 / 子代理 0 失败 / T9 26/30 accept / 未发布
[T3-3] 口腔 AI 综述项目(论衡 v2.5.4,2026-08-25):🔴 二手转引(workspace 论衡教训记录转引)。总耗时约 70 分钟 / 5469 纯汉字 / 子代理 2 次失败重试 / T9 23/30 minor revision / 写盘延迟 8m26s vs 完成事件 9m8s(教训 #158 实战案例)
喜欢这篇文章?打赏作者
您的支持是我创作的动力
长按识别二维码打赏

Pingback:如何用论衡(lunheng-article-pipelin)技能写深度长文 – 老左博客