本章目录 · 12
  1. 一、90 天到底完成什么
  2. 二、先选范围,再开始计时
  3. 三、D1—D14:清晰术审计
  4. 四、D8—D45:标准与上下文进入工作
  5. 五、D15 起:让真实试点提前发生
  6. 六、两类试点,一个容量闸门
  7. 七、领先指标与经营结果分开结账
  8. 八、四家公司说明了什么,没说明什么
  9. 九、bioby.ai:把未验证的部分也写出来
  10. 十、八问逐项验收
  11. 周一早上怎么做
  12. 收尾:第一轮之后

第 14 章90 天:完成第一轮基因进化

AI 原生转型不是部署更多工具,而是让组织从依赖少数人的经验、惯例和信息私有,转向依赖共同标准与决策相关上下文。90 个自然日能承诺的,是在一个受控范围内跑完第一轮可观察、可复盘、能继续迭代的循环;它不承诺完成全部转型,也不证明长期 ROI。

约 26 分钟内容日期 2026-09-21

一、90 天到底完成什么 #

上一章讨论关系时,留下了一条边界:不要把改变另一个人写成自己的长期项目。进入组织这个战场,同一条边界仍然成立。一号位如果一开始就要求所有部门、所有员工同时改变,很快会把转型变成一场大规模劝说。会议变多了,口号统一了,真正的决定和工作方式却没有变化。

所以,第一轮不从“改变全公司”开始。它从一个真实业务单元、一类反复发生的决定或一段可以观察结果的工作流开始。组织先把自己正在使用的判断和事实说清,让它们进入一项真实工作,再看现实怎样推翻、保留或修订它们。

这就是“完成第一轮”。到第 90 天,组织至少要留下六样东西:

  1. 一次清晰术审计,说明当前问题、基线、标准缺口、上下文缺口和主要不确定性;
  2. 一套八层标准 v1,其中与试点直接相关的标准已经能够执行、检查和修订;
  3. 一份有来源、版本、权限、未知项和更新责任的决策相关上下文;
  4. 至少一个进入真实业务流的试点,而不只是演示、培训或沙盘;
  5. 一份结果与失败记录,分清标准错误、上下文不足、执行偏离、试验设计和外部变化;
  6. 标准修订与下一轮计划,包括负责人、资源、停止条件,以及后续复核日期。

“完成”指这六项形成了闭环,不指试点必须成功。一个试点按事先写好的停止线结束,团队找到失败发生在哪里,修订标准并决定下一步,仍然完成了第一轮。相反,项目短期指标很好看,却没有基线、失败记录和下一版标准,循环并没有发生。

为什么用 90 天?现有证据不能证明它是所有组织的最佳周期。90 天只承担一项管理功能:给高频数字化工作留下多次反馈的机会,同时限制无期限的准备。从 D1 到 D90,共十二周运行加六天验收。业务本身需要更长时间时,第 90 天只验循环与领先证据,最终结果继续留到真实周期里结账。

90 个自然日第一轮:审计、标准与上下文、真实试点、结账与下一轮;三条工作线全程并行

图:D15 左右开始接触真实业务,不等标准全部写完;标准、上下文和证据在运行中一起修订。

二、先选范围,再开始计时 #

动态生命周期管理要求先定位对象,再定位自己,最后匹配行动。放到 90 天手册里,对象是准备改变的决定或工作流,自己是当前组织的阶段、资源、能力与风险。没有这一步,路线图会变成同一张表强加给所有公司。

小组织由一号位直接负责,第一轮只选一个主试点。大组织不要一开始覆盖集团,而应选一个事业部或业务单元,把它当作本轮的完整范围,由该单元一号位承担结果。范围缩小不等于目标变轻。正因为只选一个范围,标准、上下文、真实结果和责任才可能互相对上。

现金危机、强监管和重大事故期不能照抄普通路线。现金链正在恶化时,先守住回款、关键交付和生存,把试点缩到最短周期、可逆且直接影响现金的工作;危险仍在扩大,就暂不启动 90 天时钟。医疗、金融、安全、用工和其他强监管场景,应让专业责任人拥有硬停止权,先做历史回放、受控环境和双人复核,再进入有限真实流量。重大事故发生时,先保护人、数据和客户,不能为了完成手册而延误止损。

责任也要在 D1 写清。至少需要五种角色:

  • 一号位或业务单元负责人承担最终判断责任。他决定为谁创造什么价值、冲突时什么优先、哪些边界不能交换,也签发关键标准的生效、修订和废止。
  • 标准域负责人维护自己负责的标准。维护不等于独自发明,他要吸收一线事实、客户反馈、失败记录和反例。
  • 一线成员提供实际工作里的例外、补丁、坏消息和不可执行之处。他们最接近现实,不能只在标准发布后被要求服从。
  • 证据与风险负责人分别维护基线、指标和原始记录,以及数据、合规、安全和隐私边界。高风险场景可以由同一组织里的不同专业角色承担。
  • 顾问可以研究、质询、主持讨论和起草草案,却不能替组织作最终取舍、隐去现场分歧或签发标准。判断责任不能通过采购合同转走。

这套分工不是民主表决。使命、价值排序和重大风险最终要有人签字;但最终签字也不是闭门写作。一号位若只写下自己的判断,再用反复宣讲代替一线反馈,组织仍然依赖他本人。统一的验收是:相关成员能在一号位不在场时,依据共同标准和必要事实作出可解释的决定,并在新证据出现后推动修订。

D1—D3 的阶段卡

  • 动作: 选择一个业务单元和一个真实问题;写明非目标;指定最终负责人、试点负责人、标准域负责人、证据负责人和风险负责人。
  • 负责人: 一号位或业务单元负责人最终签字,转型协调人组织执行。
  • 交付物: 写明 D1、D90、范围、角色、风险、权限与非目标的 90 天章程。
  • 领先证据: 负责人接受停止责任;必要数据可以取得;团队预留了执行和复盘容量,而不只是会议时间。
  • 停止条件: 没有最终负责人;无法取得必要事实;错误不可恢复又没有安全环境;危机仍在扩大。
  • 下一阶段入口: 一个可观察的真实问题、一位试点负责人和一条事先写下的风险边界。

三、D1—D14:清晰术审计 #

审计不是问大家“AI 用得怎么样”,也不是统计买了多少账号。它要找的是,组织在哪些地方仍靠人猜:什么算好没有共同标准,必要事实散落在不同版本里,责任人没有取得决定所需的信息,还是结果回来以后没有改变下一次做法。

先选正常、失败和例外三类真实记录。它们可以是最近完成的客户交付、产品决定、招聘、退款、研发发布或资源申请。只看正常样本,组织会把偶然顺利误认成稳定能力;只看失败,又容易把每个问题都解释成执行不够努力。三类记录放在一起,才能看见哪些关系反复出现。

每一项记录至少检查六件事:

  1. 当时要为谁创造什么价值,谁拥有最终决定权;
  2. 使用了什么判断标准,哪些只是某个人的经验;
  3. 参与者实际看见了哪些事实,来源、时间和版本是否一致;
  4. 哪些信息未知、受限或彼此冲突,权限是否与责任匹配;
  5. 结果用什么口径验收,有没有留下正常、失败、例外和人工补丁;
  6. 结果回来以后,哪条标准、上下文或权限发生过改变。

访谈只能提供线索。预算实际流向哪里、一号位的日历花在哪里、决策记录引用了哪版材料、客户怎样选择、同类错误是否重复出现,才是用来校正线索的事实。钱、时间与判断仍然分属三个分析层次:公司先看钱,个人先看时间,AI 原生组织最终会被可靠判断的生产能力限制。共识不是与它们并列的新资源;所谓“缺共识”,要继续拆成标准不一致、上下文不同、分歧没记录、权限不匹配或反馈回不来。

试点不按“最高频前三项”机械决定,也不规定一律使用中位数。选择时要同时看价值、复用频率、错误代价、可观察性、可逆性、自然周期、数据可得性和团队容量。统计方法同样服从问题:看典型情况、总成本、波动、极端风险或实验差异,可能需要不同口径。重要的是在结果出现以前冻结口径,不是固定使用一种统计量。

审计最后只选一个当前最影响下一步的主要不确定性。它可以是“这类支持请求能否在不降低质量的情况下交给 AI”,也可以是“目标客户是否愿意为一个最小但完整的结果持续付费”。组织同时面对许多未知,并不意味着第一轮要一次消灭所有未知。

D1—D14 的阶段卡

  • 动作: 复查三类真实记录;画出标准、上下文、流程、权限和反馈的现状;选择主试点。
  • 负责人: 审计负责人和证据负责人组织,一线与客户接口提供反例,一号位确认限制性资源和试点。
  • 交付物: 一页纸现状图、基线、指标字典、试点假设、护栏、停止线、回滚方案,以及 3、6、9—12 个月复核日。
  • 领先证据: 关键事实有来源、时间、版本和负责人;未知项仍以未知出现;不利事实没有从记录中消失。
  • 停止条件: 拿不到同口径基线;自然周期长于 90 天且找不到可信领先指标;范围大到无法指定负责人。
  • 下一阶段入口: 冻结的基线、一个主要不确定性、可检查指标和事先写好的停止条件。

审计不必全部结束才开始下一步。从 D8 起,已经确认的高价值缺口可以进入标准 v0 和上下文包;不确定部分继续标记为假设。这样做不是抢跑,而是让审计尽早接受换人和真实工作检验。

四、D8—D45:标准与上下文进入工作 #

一条准备交给人或 AI 的试点标准,不能只写“条件、动作、验收”三句话。最低要求仍然是五项:适用条件、动作、验收证据、停止条件和修订触发器。除此以外,还要写负责人、版本和生效时间。否则,团队知道该向前做什么,却不知道何时必须停,也不知道新事实出现后谁来改。

上下文包处理另一类问题。它至少要列出当前事实、来源、版本、未知项、受限信息、访问权限、更新频率和负责人。统一上下文不要求全公司看见全部信息,更不要求人和 AI 获得完全相同的材料。验收口径是:对这项决定负有责任的人,在合法权限内取得同一版本的必要事实,并知道什么仍不可见;AI 只取得完成任务所需的最小权限。

D8 到 D21,团队先写与试点直接相关的标准 v0,再用历史案例、影子运行或低风险样本做换人测试。找一个没有参加起草、但有相应职责的人,请他依据标准和上下文独立处理代表性场景;也可以让 AI 在受限环境中做同样的事。测试不要求答案一模一样,而要记录他们在哪里需要猜、何时知道应当停止、用什么证据证明完成。猜测点就是下一版要补的缺口。

与此同时,八层标准开始形成 v1:

  1. 使命写清最终为谁创造什么价值,也写明本轮不追求什么;
  2. 信念写清组织准备长期押注的因果假设,以及什么反证会迫使它重看;
  3. 行为标准写明诚信、安全、合法与客户知情选择等不能交换的边界;
  4. 思维标准规定怎样区分事实、假设与偏好,怎样寻找反例和检查证据;
  5. 判断标准规定多个可行选项之间怎样排序,什么条件下放弃;
  6. 人员投入标准为人力投入写价值假设、合理验收单元和复核窗口,不把共同结果硬拆成每个人的精确 ROI;
  7. 管理标准按具体任务分配决定权、信息权限、风险上限和升级路径,不给人贴永久层级;
  8. 学习标准规定哪些结果必须复盘,反馈存在哪里,谁发布修订,旧版本怎样退出。

v1 不表示八层已经成熟,也不要求使命和一线检查表写成相同粒度。最低要求是八层都不空缺,彼此关系说得通;与本轮试点直接相关的标准达到五项可用口径;未验证部分明确标成假设。写不出来时,正确动作是缩小范围或补证据,不是用抽象口号填满表格。

让标准进入共识循环,不能靠重复宣讲。重复可以帮助记忆,却不能证明理解;沉默也不能记录为认同。组织要把有利事实、不利事实、适用限制和已知分歧放进同一份共识记录,让相关成员在真实决定中使用。提出异议的人不必改口赞成,但要知道当前由谁决定、自己承担什么行动、什么新证据可以重新打开问题。

D8—D21 的阶段卡

  • 动作: 写试点标准 v0 和上下文包 v0;建立权限矩阵;做历史、影子或低风险换人测试。
  • 负责人: 标准域负责人和上下文负责人起草,一线提供例外,一号位决定价值冲突和风险边界。
  • 交付物: 五项标准卡、上下文包、八层骨架、决策记录和版本变更模板。
  • 领先证据: 没有参与起草的人能找到材料、识别未知并说出停止条件;AI 没有获得多余权限。
  • 停止条件: 标准仍是口号;关键冲突无人签字;敏感信息过度共享;旧版本仍在工作入口。
  • 下一阶段入口: v0 在换人测试中没有未受控的关键猜测,真实试点的责任和权限已经批准。

D22—D45 的阶段卡

  • 动作: 用第一波真实结果完成八层 v1;记录异议、未知和版本差异;关闭旧入口。
  • 负责人: 一号位签发,各标准域负责人维护,一线、财务、数据和风险角色共同提供事实。
  • 交付物: 八层标准 v1、上下文包 v1、任务级决策权与升级路径、修订记录。
  • 领先证据: 关键成员能在一号位不在时作出可解释判断,也能指出标准不适用和上下文不足。
  • 停止条件: 标准由一号位闭门写成;反复宣讲替代真实使用;异议与坏消息没有安全入口。
  • 下一阶段入口: v1 已在真实试点中被调用,并因现实证据至少接受过一次保留、修订或废止判断。

五、D15 起:让真实试点提前发生 #

旧路线最大的问题,不是少了一项动作,而是把真实验证排在最后。前十周只写标准、建共识,最后三周才接触业务,组织最多能得到一次上线结果,很难经历失败、修订和第二次运行。这样的三周可以证明团队做过一个项目,不能证明循环已经建立。

默认路线在 D15 左右把有限范围的真实业务送入主试点。强监管场景可以先从受控真实材料、双人复核和不直接执行的辅助任务开始,但不能把所有现实验证推迟到 D75。若一项工作完全无法在 90 天内产生任何可观察反馈,它就不适合承担第一轮主试点。

第一波只改变足以回答主要不确定性的部分。团队要保留原基线或其他可比较口径,同时记录质量、周期、错误、升级、人工补丁、客户或员工影响,以及没有预料到的副作用。工具登录数、生成字数和功能数量可以帮助排查使用问题,却不能替代业务证据。

停止线必须在启动以前写好。它可能是客户伤害、安全事件、合规越界、质量跌破不可接受范围、稳定核心受损、结果无法追溯,或继续运行已经不能回答原问题。具体阈值由任务风险和基线事前确定,不使用全书统一数字。停止以后也不能只写“试点失败”,还要判断问题来自哪里:

  • 标准错了: 原来的价值排序、适用条件或验收口径不成立;
  • 上下文不足: 事实缺失、版本过期、权限不够或未知没有暴露;
  • 执行偏离: 标准与上下文可用,实际动作却没有按约定发生;
  • 试验设计混杂: 同时改变太多条件,结果无法回答原问题;
  • 外部条件变化: 市场、法规、客户结构或基础能力已经不同。

这五类直接决定下一次该改什么。若失败无法回到标准、上下文或试验设计,第一轮就没有增加组织判断力。

D15—D35 的阶段卡

  • 动作: 把有限真实业务流放入主试点;按冻结口径记录结果、例外、补丁和意外后果。
  • 负责人: 试点负责人运行,一号位承担继续、暂停或回滚决定,证据负责人保留原始记录。
  • 交付物: 真实运行日志、事件记录、中期结果,以及标准和上下文 v0.1。
  • 领先证据: 已有真实案例和真实例外;停止线确实能够触发;至少一项结果改变了标准或上下文。
  • 停止条件: 越过安全、诚信、监管、隐私或稳定核心护栏;质量恶化且无法追溯;试验已经不能回答原问题。
  • 下一阶段入口: 至少完成一个真实业务周期,并明确下一波维持、调整、回退或停止。

六、两类试点,一个容量闸门 #

组织这一战场会同时调用人才结构和产品路径,但每家组织不必在第一轮同时发动两场改造。最低交付物是至少完成一个真实主试点。另一类试点只有在负责人、关键人员、数据和证据链能够分开时,才可以错峰启动;否则就进入下一轮计划。

执行层坍缩试点从一个岗位或工作流拆任务,不从裁员目标开始。团队逐项判断哪些任务属于按明确指令执行,哪些按成熟标准处理,哪些要面对例外、权衡价值和修订标准。AI 或外包能否接走一项任务,要同时检查载体、标准、上下文、验收、风险和最终责任。迁移以后,留下的人按具体任务获得指示、指导、协商、授权或放权,不把某个人永久标成 S1、S2 或 S3。

产品路径试点先定位需求,再定位组织自己的资金、渠道、技术和交付能力。团队冻结当前最影响下一项决定的主要不确定性,保护已经创造价值的稳定核心,并写清预算、期限、护栏、回滚和停止。一次优先回答一个主要不确定性,不等于复杂产品永远只能改变一个变量;因素存在交互时,逐个改变反而可能得出误导结论。此时可以采用分阶段发布、对照或多变量设计,但必须承认混杂,不能编造确定归因(NIST/SEMATECH,2012)。

小组织若由同一批核心成员同时承担两条试点,就会把判断、开发、客户和复盘容量一起透支。大组织即使有两位负责人,只要两条试点争抢同一数据、同一技术底座或同一客户结果,也不具备独立归因条件。容量闸门只问四件事:是否有不同的负责人,是否有足够关键人员,是否有各自的基线与证据链,是否会改变对方正在验证的主要条件。任何一项答不上来,第二条就不启动。

D36—D60 的阶段卡

  • 动作: 稳定主试点;选择执行层或产品路径作为当前主线;评估是否开启第二类试点。
  • 负责人: 业务单元一号位作容量决定,每条已启动试点各有独立负责人。
  • 交付物: 主试点中期评审、任务迁移卡或产品试验卡,以及第二试点“开或不开”的书面理由。
  • 领先证据: 错误能被发现、停止和恢复;稳定核心未被拿去承担未经同意的试验;第二试点不争抢同一瓶颈。
  • 停止条件: 没有独立负责人;关键人员超载;两条试点共同改变同一结果而无法区分。
  • 下一阶段入口: 继续一条主线,或在容量闸门通过后错峰运行第二条;未开启的路径进入下一轮。

D46—D75 的阶段卡

  • 动作: 用修订后的标准和上下文跑第二波;检查结果能否离开标准起草人、一号位救火和特殊客户后重复。
  • 负责人: 试点负责人运行,证据负责人分开维护每条试点的观察、估计与推断。
  • 交付物: 标准与上下文 v1.1、第二波记录、维持/升级/回退/停止决定。
  • 领先证据: 换人后仍能完成判断;返工、例外和人工补丁开始可解释;短周期结果能与基线同口径比较。
  • 停止条件: 收益只在一号位亲自救火时出现;失败样本从记录中消失;指标口径被事后修改。
  • 下一阶段入口: D75 后不再扩大范围,转入证据结账与下一轮设计。

七、领先指标与经营结果分开结账 #

90 天验收最容易犯的错误,是把能及时看见的东西写成最终价值。标准调用次数、知识库访问、AI 使用量、培训完成和成员复述,都只说明某个动作发生过。它们距离收入、利润、客户结果和组织判断力还有不同长度的因果链。

第一轮应当优先观察四类领先证据:

  • 判断是否可追溯: 最近的重要决定能否找到所用标准、事实版本、未知、权限和复核日;
  • 共同材料是否可用: 换人以后是否仍能作出可解释判断,哪里还需要猜,旧版本是否退出;
  • 真实工作是否改善: 在同口径下,质量、周期、错误、升级、返工、客户反馈和实际成本怎样变化;
  • 循环是否真的修订: 停止线是否被执行,失败是否改变了标准、上下文、权限或下一轮试验。

这些证据可以支持继续、调整、回退或停止,不能自动支持“长期 ROI 大于 1”。3、6、9—12 个月是分阶段复核的默认管理窗口,不是统计研究得出的行业均值。

| 观察时间 | 可以复核什么 | 不能据此宣称什么 | | --- | --- | --- | | D1—D90 | 标准与上下文是否进入工作;短周期质量、时长、错误、例外、停止、修订和部分客户行为 | 全部转型完成;长期收入、利润、留存、文化或 ROI 已被证明 | | 约 3 个月 | 对早期组织或短周期工作做第一次正式投入复核,核对已经发生的价值、全成本和关键假设 | 所有项目都应在三个月兑现最终价值;把短期数据机械年化 | | 约 6 个月 | 多轮业务周期中的复用、留存、质量、单位经济性、人员与权限调整是否稳定 | 一个试点已经证明方法普遍有效 | | 9—12 个月 | 跨季节、预算周期和复杂协作的经营结果,长期客户结果、风险与组织韧性 | 把同期变化全部归因于这一轮行动 |

D61 到 D84,团队停止扩大范围,把基线和结果并排。能直接观察的事实单列,模型估计和人工推断另列,仍未知的内容继续空着。无法可靠归因的结果保留为未知,不为了结项分配比例。

D85 到 D90,才进入正式验收。小组织应核查所有直接参与角色;大单元按角色、风险、地点和任务类型分层检查。重大风险、客户伤害、隐私、合规和停止事件必须全量检查,不能因为抽样而跳过。

D61—D84 的阶段卡

  • 动作: 冻结扩张;比较基线与结果;分类失败与替代解释;发布标准差异和后续复核日。
  • 负责人: 证据负责人和标准域负责人整理,一线、财务、数据和风险角色核对,一号位确认结论边界。
  • 交付物: 结果与失败账、标准修订、未解决假设、下一轮草案。
  • 领先证据: 失败指向具体修订;观察、估计、推断和未知已经分开;长期价值没有被提前记账。
  • 停止条件: 结果出来后改验收口径;共同结果被硬拆成个人精确 ROI;只报成功、不报停止。
  • 下一阶段入口: 八问所需材料齐备,下一轮问题来自本轮暴露的最高价值缺口。

D85—D90 的阶段卡

  • 动作: 逐项完成八问证据核查;一号位决定继续、缩小、回退或停止;冻结下一轮资源。
  • 负责人: 一号位作最终判断,证据负责人组织核查;独立质询者可以挑战,不能代签。
  • 交付物: 八问证据包、第一轮完成或未完成决定、下一轮章程和长期复核日。
  • 领先证据: 每一问都能指向实际材料;失败试点同样留下了下一版判断。
  • 停止条件: 任一最低交付物没有证据,就不能按总分宣布第一轮完成。
  • 下一阶段入口: 第一轮结束,第二轮从尚未解决的关键标准或上下文缺口开始。

八、四家公司说明了什么,没说明什么 #

90 天是否足够,不能靠四个公司故事证明。与爱为舞、传神、Klarna 和加拿大航空处在不同行业、阶段和证据口径,也没有按同一手册接受对照。可核材料呈现了四种不同情况:原生设计、旧组织改造、把价值压成成本,以及工具与正式政策各用一套事实。

与爱为舞:从成立时开始设计人机协同。 2025 年 7 月,创始人张怀亭在公开演讲中把公司的路径概括为:先建立业务闭环、验证场景,再让模型逐步辅助或替换闭环中的环节。这条路径没有把模型能力当作业务已经成立,而是让业务结果持续提供数据和约束(启明创投,2025)。

公开材料还描述了公司把产品、研发、运营、设计和销售放进人机协同工作方式,并让不同环节的数据相互回流。这些材料主要来自公司高管讲话和媒体报道。2025 年 11 月,创始人兼 COO 刘威披露,公司成立约两年半完成四轮融资,合计约 1.5 亿美元,估值接近 10 亿美元;技术负责人此前披露月收入上千万元(36氪,2025)。融资、估值与收入均为公司或创始人口径,未经独立审计,也不能证明这些结果由组织设计单独造成。与爱为舞说明原生公司可以从成立时同时设计业务、数据和 AI;它不能证明原生公司不需要标准,更不能证明其他组织可以在 90 天内复制这条路径。

传神:既有组织开始改变责任与反馈入口。 传神成立于 2005 年(上海证券交易所,2021)。2026 年 3 月,公司在公开活动中设立 CAIO,并披露二十多支跨部门团队围绕招聘、编程、文档、客服等场景运行 AI 应用(湖北日报,2026)。随后公开材料还描述了 AI Native 决策委员会、项目必须提供可运行 DEMO 并说明业务问题,以及按内部使用和满意反馈积累“能量金”的机制(品玩,2026)。

这些动作分别处理负责人、业务证据和反馈激励,比只买一套工具更接近组织改造。但 DEMO 能运行,不等于解决了正确问题;使用次数和满意也不能单独代表客户价值。现有材料主要来自公司活动和推广型报道,缺少改造前后的决策质量、客户结果、收入、成本与失败项目记录。因此,传神只承担改造机制样本,不承担效果证明。

Klarna:成本指标把判断带偏以后,管理层公开纠偏。 第 2 章已经写过:公司先用处理量和成本描述成功,后来公开承认成本成了过于主导的评估因素,服务质量下降,于是在保留 AI 的同时重新增加高质量人工支持。这里只取它对第一轮改造的含义——评估权重写错,标准就要被结果修订。2025 年 9 月,CEO 对 Reuters 补充说,公司此前可能过度偏向降本,正在把重点转向产品和增长(Reuters,2025)。纠偏是否成功,仍要看后续客户与经营数据。

加拿大航空:同一家公司给客户两套冲突答案。 第 2 章写过 Jake Moffatt 的丧亲票案件:聊天机器人与所链接政策页给出相反规则,公司主张不应为机器人负责,法庭认定网站全部信息仍由公司承担(Moffatt v. Air Canada,2024 BCCRT 149)。这里只取它对 90 天的检查:自动化入口与正式政策没有使用同一版决策相关上下文。“上下文冲突”是对裁决事实的机制分析,不是裁决原词。

四个案例共同支持一条有限判断:工具进入业务以后,负责人、价值标准、相关事实和反馈入口仍然必须由组织治理。它们不能估计 90 天路线的平均效果。这条路线仍缺一类关键样本:一家中型传统企业事前冻结口径,完整走完 90 天,并公开 D90、6 个月和 9—12 个月的过程与经营结果。

九、bioby.ai:把未验证的部分也写出来 #

bioby.ai 是这套方法的内部实验场。可供核对的内容是一段尚未完成外部验证的过程:起点、动作、失败、修订、当前结果和未验证部分。

起点。 按公司内部记录,2026 年初,许多关键判断仍散落在创始人和少数成员的经验里。招聘、融资、品牌设计、研发和办公投入都出现过返工。早期商务岗位前后招聘接近二十人,没有留下合适人选。这个结果首先说明招聘标准和岗位设计失败,不能推出“人才只能筛选”。

动作。 bioby.ai 内部记录显示,2 月形成清晰术,4 月形成干扰术和四条招人标准,随后先用新标准回看存量岗位;3 月到 7 月,研发单元重画任务、标准与审核责任;6 月,人员投入的 ROI 纪律和部分停止规则逐步明确。公开材料没有逐月原始过程账,这些日期属于未经独立核验的公司自述。

失败与修订。 研发单元在扩大 AI 与初级成员参与的第一个月出现质量下降,随后补建质量标准、任务拆解和审核责任。招聘标准形成后,现有岗位先接受检查,而不只是后来者。办公室会议室的完整施工也曾因缺少取舍与验收口径而暂停。这些记录说明新规则同时作用于存量安排和一号位决定,不能从单个内部事件推导普遍 ROI。

现有结果。 公司内部口径显示,2026 年 3 月研发单元有两名熟练工程师;四个月后,一人主要负责标准、拆解和审核,九名实习生在 AI 辅助下参与,另一名工程师离开。月度人力与工具成本约从 3.5 万元增至 8 万元,迭代与功能产出约为原来的五倍,响应速度约三倍,生产环境 BUG 率约下降 80%。这些数字未经独立审计,“产出”“响应”“BUG 率”的完整定义与原始日志也未公开。它们不能证明因果,也不能估计其他组织会得到什么结果。

仍未验证。 八层标准在关键决定中的稳定使用、时间配比、扩大组织后的适用性,以及长期客户与经营结果,均缺少完整数据。核心团队时间记录尚未完成。公司从第一项方法形成到部分标准开始配合,大约用了五个月;这段经历没有对照组,不能证明其他组织可以在 90 天内完成同样变化。

该案例只呈现内部过程、公司自报结果和未验证部分,不承担 90 天方法有效性的证明。

十、八问逐项验收 #

D90 不统计部署了多少工具,也不把八问加成一个分数。每一问都必须能指向文档、版本、日志、真实决定或运行结果。任何最低交付物没有证据,第一轮就是未完成;不存在“过六问即完成”。

第一问:清晰术审计是否完成?

证据包括范围、限制性资源判断、正常/失败/例外样本、基线、指标字典、风险与权限清单,以及一个主要不确定性。动员会、工具盘点和口头共识不能替代。

第二问:八层标准 v1 是否可用?

八层都有范围、负责人、版本和待验证假设;与试点直接相关的标准补齐适用条件、动作、验收证据、停止条件和修订触发器,并写明生效时间。八句口号或未进入工作入口的文档不算。

第三问:相关决定者是否取得同一版必要上下文?

证据包括事实来源、版本、未知、受限项、权限、更新责任,以及代表性场景的独立使用记录。全员看见全部信息、发过邮件或建过知识库都不能单独通过。

第四问:是否运行过至少一个真实试点?

试点有真实客户、员工、业务流或决定,事前写过假设、基线、主要不确定性、护栏、停止线和回滚。DEMO、培训或只在汇报里演示不能单独满足。

第五问:最终责任与一线事实是否同时进入?

一号位或单元负责人签过关键取舍,一线反例、异议、坏消息及处理结果也留在记录里;顾问做了什么同样可见。一号位闭门写完、全员投票卸责或顾问代签,都不能通过。

第六问:结果与失败是否如实记录?

同口径领先指标、护栏结果、人工补丁、意外后果、停止和回滚都在;观察、估计、推断和未知已经分开。把 90 天信号写成长远收入、利润或 ROI,不能通过验收。

第七问:结果是否改变了标准、上下文或下一次行动?

证据是失败分类、替代解释、版本差异、修订理由、生效时间和旧入口关闭。也允许有证据地决定不改。只写“加强沟通”“继续重视”而没有改变任何字段,不算循环闭合。

第八问:下一轮是否已经可以执行?

未验证假设、下一限制性资源、负责人、资源、范围、停止线,以及 3、6、9—12 个月复核日都已经写明。没有资源承诺的愿望清单,不是下一轮计划。

核心角色不多时,对直接参与决定、维护标准、提供上下文和承担试点责任的人做全量核查。业务单元较大时,按角色、风险、地点和任务类型分层取样,同时检查真实日志和决定。验收不是由一号位问别人、自己免试;一号位的判断、日历、签字和纠偏记录同样在证据范围里。

周一早上怎么做 #

周一不要先召开全员转型会。只做五件事:

  1. 选一个每周反复发生、结果可观察、失败可承受的真实决定或工作流;
  2. 指定一位最终负责人和一位试点负责人,写明本轮不做什么;
  3. 调出最近一轮正常、失败和例外记录,分开标准、上下文、流程、权限与反馈;
  4. 冻结 D1 基线、第一项主要不确定性、领先指标和第一条停止线;
  5. 在日历上写下 D15 左右的第一次真实试点、D45 的 v1 复核和 D90 的八问验收。

如果第一步就找不到一个可以负责、可以观察、可以停止的真实问题,先不要买更多工具。组织此刻缺的不是执行能力,而是一个可以接受现实检验的判断。

收尾:第一轮之后 #

全书从执行和知识获取正在变便宜开始。它最终要回答的,不是人还能守住哪一项永远不变的工作,而是个人身上稀缺的能力怎样离开个人,成为组织可以继续使用和修订的资产。

最后的稀缺,是这个问题的名字。它落在个人身上,叫悟性:发现标准缺口,借来经过验证的标准,判断能否迁移,再用结果修正。个人把判断写下来,说明适用条件、证据、边界和修订信号,它开始成为标准。标准与决策相关上下文被组织共同使用、质疑和更新,个人的悟性才开始变成组织判断力。

90 天结束时,不该出现一张“转型完成”的证书。桌上应该有第一轮留下的标准、上下文、结果、失败、修订和下一轮计划。它们不保证下一次一定正确,却让组织不必再次只靠经验、资历和惯性开始。

第一个循环到这里结束。下一轮,从你周一要处理的那个真实判断开始。