跳到正文
AI×职业

AI理论上能做94%的工作,为什么实际只接管了33%?

Anthropic用Claude真实使用数据给出两个数字,理论覆盖率94%,实际只有33%。中间60个百分点的落差,不是技术卡点,是企业的数据、系统、权限这些组织改造没跟上,这正是留给所有人的缓冲窗口,但窗口不会均匀关闭。

作者 clark.xie 2026 年 7 月 8 日 11分钟阅读 最近修订 2026 年 7 月 23 日

两个数字,来自同一家公司的同一个研究系列。理论上,大模型能显著提速计算机和数学类职业约94%的任务;而真实使用数据显示,这类职业的实际覆盖率只有33%。中间差了大约60个百分点。[1][2]

数字出自Anthropic的”经济指数”(Economic Index)系列报告[3]。这个系列的特殊之处在于研究材料:它不做问卷,不做专家预测,只分析Claude的真实使用记录,是市面上少见的行为观察式AI劳动力研究。换句话说,这是AI公司拿自己产品的数据,回答“AI到底有没有在大规模替代工作”。

直接给结论:替代风险真实存在,但“大规模的即时替代”没有发生,也不会以焦虑叙事描绘的速度发生。 因为AI的就业替代是慢性重构,从“理论上能做”到“实际在做”之间,隔着一整套非技术的现实约束。这套约束的消化速度,就是留给所有人的缓冲窗口。

核心判断

  1. 替代风险真实存在,但“大规模的即时替代”没有发生,也不会以焦虑叙事描绘的速度发生。
  2. 连最熟练的用户都在放弃全自动,说明自动化改造在大多数场景推不动;推不动的地方,人的岗位价值就依然存在。
  3. 做好准备,比多装几个软件重要得多。

理论和现实之间,差了多少?

先看上限有多高。[4]

2026年1月的报告用O*NET任务数据库给每个任务估算”大概需要多少年教育才能完成”:整个经济所有任务的平均值约13.2年,而Claude实际覆盖任务的平均值是14.4年[5],相当于读到大二下学期。也就是说,AI能做的任务,普遍偏向受过高等教育的人做的事,上限不仅高,而且高在白领区间。

{
  "id": "theory-reality-gap",
  "type": "dataset",
  "title": "AI理论任务覆盖率与真实使用覆盖率",
  "deck": "94%的理论能力只转化为33%的真实使用,组织改造是主要缺口。",
  "badge": "数据图表",
  "source": "数据与来源见本文参考文献。",
  "sets": [
    {
      "label": "计算机与数学类任务",
      "max": 100,
      "rows": [
        {
          "label": "理论可显著提速",
          "value": 94,
          "display": "94%",
          "detail": "β指标估算的技术可行上限。"
        },
        {
          "label": "真实使用覆盖",
          "value": 33,
          "display": "33%",
          "detail": "Claude真实使用记录显示的实际覆盖。"
        },
        {
          "label": "尚未兑现的落差",
          "value": 61,
          "display": "61pct",
          "detail": "94−33得到约61个百分点,文章概括约60个百分点。"
        },
        {
          "label": "窗口关闭警戒线",
          "value": 50,
          "display": "50%",
          "detail": "文章提出:真实覆盖显著逼近50%时,应重新判断缓冲窗口。"
        }
      ]
    }
  ]
}

再看现实有多低。2026年3月的报告用β指标(Eloundou等人在2023年提出[6],衡量某任务能否被大模型显著提速)测算[7]:计算机和数学类职业的理论覆盖率约94%,办公和行政支持类高达90%。而真实使用数据里,计算机和数学类的实际覆盖率只有33%。报告自己的措辞是:实际覆盖程度,仍然只是理论可实现水平的一小部分

一边是94%的理论天花板,一边是33%的现实地板。焦虑叙事只报天花板,这60个百分点的落差才是真问题:理论中可行,现实中磨难重重,卡点在哪?

卡住替代的为什么不是技术?

第一个怀疑对象是价格:是不是AI太贵?数据说不是。2025年9月的报告给出的价格弹性只有-0.3[8]:成本下降10%,使用量大概只增加3%。如果价格是卡点,降价应该带来放量,实际没有。Anthropic自己的结论是,模型能力比成本重要得多,因为使用最多的任务往往比使用少的任务更贵。

第二个怀疑对象是性能:是不是模型还不够强?也不是,性能的提升一直在抬高理论上限,却几乎没有扩大真实覆盖。真正卡住的是一串听起来毫不性感的问题:企业内部数据有没有整理好,系统有没有打通,权限能不能安全开放,AI的输出谁来校验,出了错谁来负责。复杂任务高度依赖信息权限,而信息权限是组织问题,不是模型问题。

这个落差在宏观估算上同样清晰。2025年11月的报告估算,AI可以为美国劳动生产率年增速贡献约1.8个百分点;到2026年1月,一旦把成功率和任务互补性加进模型,这个数字就掉到0.6至0.8个百分点[9]。理想值和现实值之间,差的还是同一样东西。

打个比方:企业买了一辆保时捷911,但村里还是那条土路,车跑不快。而修路比换发动机难得多,不仅要花钱花时间,还得挨家挨户问路边人家愿不愿意。技术突破和真正市场化之间,隔着的不是模型迭代,是组织改造。缓冲窗口就是从这里来的:路修好之前,车再快也快不过路。

技术突破和真正市场化之间,隔着的不是模型迭代,是组织改造。缓冲窗口就是从这里来的:路修好之前,车再快也快不过路。MAVERICK 判断

中国企业的“土路”可能比美国更长。Anthropic的数据基于美国O*NET职业体系,而中国企业的数字化基础设施参差更大:头部互联网大厂的数据中台和系统打通程度接近硅谷水平,但大量中小企业、传统制造业、体制内机构的内部系统仍然碎片化,数据还锁在Excel和微信群里。智联招聘数据显示,80%以上的AI岗位招聘来自300人以下企业[10],说明AI部署能力高度集中在少数组织。这意味着中国的94%→33%落差可能更大,缓冲窗口也因此更宽,但不是均匀分布的,大厂员工的窗口可能已经在关闭,而中小企业员工的窗口还远没到。

用AI最熟练的人,正在怎么用它?

如果替代真的即将全面发生,最先能观察到的人群应该是重度用户:他们最早把任务整个交给AI。使用行为数据恰恰显示了相反的走向。

{
  "id": "usage-turn",
  "type": "stage",
  "title": "Claude用户自动化与协作式使用的变化",
  "deck": "越熟练的用户越从全自动退回协作,现实工作仍需人机配合。",
  "badge": "数据图表",
  "source": "数据与来源见本文参考文献。",
  "nodes": [
    {
      "n": "早期",
      "label": "自动化27%",
      "sub": "随后升至39%",
      "title": "2025年:用户先尝试把任务整个交出去",
      "copy": "指令委派式使用从27%升到39%,一度看起来在向全自动演进。",
      "data": "Claude.ai聊天侧行为。"
    },
    {
      "n": "2026.1",
      "label": "协作52% > 自动化45%",
      "sub": "风向掉头",
      "title": "2026年1月:协作重新超过自动化",
      "copy": "用户发现复杂任务需要定义、拆解、补充上下文与分阶段校验。",
      "data": "协作52%,自动化45%。"
    },
    {
      "n": "2026.3",
      "label": "越熟练越协作",
      "sub": "复杂任务成功率更高",
      "title": "2026年3月:经验越多,纯委派越少",
      "copy": "重度用户更多采用迭代与拆分,而不是一次性把任务交给模型。",
      "data": "报告给出方向性分层结论,未披露统一百分比。"
    }
  ],
  "variant": "timeline",
  "center": "AI",
  "centerSub": "cycle"
}

以Claude.ai聊天侧为例,2025年9月的报告显示[8:1],偏自动化的指令委派式使用从27%上升到39%,看起来正在朝“全自动”演进。但到2026年1月,风向掉头:协作式使用(52%)重新高于自动化使用(45%)。2026年3月的报告进一步给出用户分层:用得越久的用户,反而越少采用纯指令式委派,越多采用迭代和拆分,报告的原话翻译过来是:越有经验的用户,越倾向于协作式使用,用在更复杂的任务上,且成功率更高。

这个起伏是全篇最真实的信号。它说明重度用户集体试过“把任务整个交出去”,然后集体退了回来:真正的效能提升,需要人来定义任务、拆小问题、给足上下文、分阶段校验。连最熟练的用户都在放弃全自动,说明自动化改造在大多数场景推不动;推不动的地方,人的岗位价值就依然存在。

这个判断什么时候作废?

“不必焦虑”这类话,市面上要么是安慰,要么是口号。要让它成为一个判断,必须写明它错的时候长什么样。

两个翻转信号。第一,真实覆盖率显著逼近50%:意味着组织改造的消化速度大幅加快,缓冲窗口在关闭。第二,美国软件行业出现岗位持续净下降:软件业是AI渗透最深的行业,它的岗位总量是替代是否进入实质阶段的最直接指标。对中国读者更直接的翻转信号是:智联/脉脉上AI岗位供需比从目前的高需求开始逆转(供大于求),以及互联网大厂非AI技术岗(后端、前端、测试)出现连续两个季度的净招聘下降。前者说明AI人才从稀缺变拥挤,后者说明AI正在实质性地吃掉传统技术岗。两个信号出现任何一个,本文判断作废,届时的正确动作不是继续淡定,是加速转型。2026年AI agent正在爆发,替代曲线完全可能被快速改写,这两个指标值得每季度看一眼。

在那之前,给企业和个人的建议是同一条:不要焦虑,也不要跟风囤工具。把你的工作流、业务流,以及背后的数据流、信息流重新梳理一遍,让“路”先于“车”准备好。窗口期的正确用法不是观望,是修路。做好准备,比多装几个软件重要得多。


  1. 页边注|经济指数|Anthropic拿自家Claude真实使用记录做的劳动力研究,不做问卷、不请专家预测,只看用户到底怎么点,是市面上少见的行为观察式AI就业研究。 ↩︎

  2. 页边注|缓冲窗口|理论上能做和实际在做之间的落差,企业把数据、系统、权限这些“土路”修好多久,窗口就留多久,修路比换发动机难得多。 ↩︎

  3. 参考文献|Anthropic. The Anthropic Economic Index[EB/OL]. ↩︎

  4. 页边注|β指标|衡量某个任务能不能被大模型大幅提速的打分,分高意味着理论可替代性强;但理论分高不等于现实里真在替代,中间还隔着组织改造。 ↩︎

  5. 参考文献|Anthropic Economic Index. Economic Primitives.[EB/OL]. 2026. ↩︎

  6. 参考文献|Tyna Eloundou. GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models[EB/OL]. 2023. ↩︎

  7. 参考文献|Anthropic Economic Index. Learning Curves.[EB/OL]. 2026. ↩︎

  8. 参考文献|Anthropic Economic Index. September 2025 report[EB/OL]. 2025. ↩︎ ↩︎

  9. 参考文献|Anthropic Economic Index. January 2026 report[EB/OL]. 2026. ↩︎

  10. 参考文献|智联招聘. 2025年人工智能产业人才发展报告[EB/OL]. 2025年10月. ↩︎