两个数字,来自同一家公司的同一个研究系列。理论上,大模型能显著提速计算机和数学类职业约94%的任务;而真实使用数据显示,这类职业的实际覆盖率只有33%。中间差了大约60个百分点。[1][2]
数字出自Anthropic的”经济指数”(Economic Index)系列报告[3]。这个系列的特殊之处在于研究材料:它不做问卷,不做专家预测,只分析Claude的真实使用记录,是市面上少见的行为观察式AI劳动力研究。换句话说,这是AI公司拿自己产品的数据,回答“AI到底有没有在大规模替代工作”。
直接给结论:替代风险真实存在,但“大规模的即时替代”没有发生,也不会以焦虑叙事描绘的速度发生。 因为AI的就业替代是慢性重构,从“理论上能做”到“实际在做”之间,隔着一整套非技术的现实约束。这套约束的消化速度,就是留给所有人的缓冲窗口。
核心判断
- 替代风险真实存在,但“大规模的即时替代”没有发生,也不会以焦虑叙事描绘的速度发生。
- 连最熟练的用户都在放弃全自动,说明自动化改造在大多数场景推不动;推不动的地方,人的岗位价值就依然存在。
- 做好准备,比多装几个软件重要得多。
理论和现实之间,差了多少?
先看上限有多高。[4]
2026年1月的报告用O*NET任务数据库给每个任务估算”大概需要多少年教育才能完成”:整个经济所有任务的平均值约13.2年,而Claude实际覆盖任务的平均值是14.4年[5],相当于读到大二下学期。也就是说,AI能做的任务,普遍偏向受过高等教育的人做的事,上限不仅高,而且高在白领区间。
{
"id": "theory-reality-gap",
"type": "dataset",
"title": "AI理论任务覆盖率与真实使用覆盖率",
"deck": "94%的理论能力只转化为33%的真实使用,组织改造是主要缺口。",
"badge": "数据图表",
"source": "数据与来源见本文参考文献。",
"sets": [
{
"label": "计算机与数学类任务",
"max": 100,
"rows": [
{
"label": "理论可显著提速",
"value": 94,
"display": "94%",
"detail": "β指标估算的技术可行上限。"
},
{
"label": "真实使用覆盖",
"value": 33,
"display": "33%",
"detail": "Claude真实使用记录显示的实际覆盖。"
},
{
"label": "尚未兑现的落差",
"value": 61,
"display": "61pct",
"detail": "94−33得到约61个百分点,文章概括约60个百分点。"
},
{
"label": "窗口关闭警戒线",
"value": 50,
"display": "50%",
"detail": "文章提出:真实覆盖显著逼近50%时,应重新判断缓冲窗口。"
}
]
}
]
}
再看现实有多低。2026年3月的报告用β指标(Eloundou等人在2023年提出[6],衡量某任务能否被大模型显著提速)测算[7]:计算机和数学类职业的理论覆盖率约94%,办公和行政支持类高达90%。而真实使用数据里,计算机和数学类的实际覆盖率只有33%。报告自己的措辞是:实际覆盖程度,仍然只是理论可实现水平的一小部分。
一边是94%的理论天花板,一边是33%的现实地板。焦虑叙事只报天花板,这60个百分点的落差才是真问题:理论中可行,现实中磨难重重,卡点在哪?
卡住替代的为什么不是技术?
第一个怀疑对象是价格:是不是AI太贵?数据说不是。2025年9月的报告给出的价格弹性只有-0.3[8]:成本下降10%,使用量大概只增加3%。如果价格是卡点,降价应该带来放量,实际没有。Anthropic自己的结论是,模型能力比成本重要得多,因为使用最多的任务往往比使用少的任务更贵。
第二个怀疑对象是性能:是不是模型还不够强?也不是,性能的提升一直在抬高理论上限,却几乎没有扩大真实覆盖。真正卡住的是一串听起来毫不性感的问题:企业内部数据有没有整理好,系统有没有打通,权限能不能安全开放,AI的输出谁来校验,出了错谁来负责。复杂任务高度依赖信息权限,而信息权限是组织问题,不是模型问题。
这个落差在宏观估算上同样清晰。2025年11月的报告估算,AI可以为美国劳动生产率年增速贡献约1.8个百分点;到2026年1月,一旦把成功率和任务互补性加进模型,这个数字就掉到0.6至0.8个百分点[9]。理想值和现实值之间,差的还是同一样东西。
打个比方:企业买了一辆保时捷911,但村里还是那条土路,车跑不快。而修路比换发动机难得多,不仅要花钱花时间,还得挨家挨户问路边人家愿不愿意。技术突破和真正市场化之间,隔着的不是模型迭代,是组织改造。缓冲窗口就是从这里来的:路修好之前,车再快也快不过路。
技术突破和真正市场化之间,隔着的不是模型迭代,是组织改造。缓冲窗口就是从这里来的:路修好之前,车再快也快不过路。MAVERICK 判断
中国企业的“土路”可能比美国更长。Anthropic的数据基于美国O*NET职业体系,而中国企业的数字化基础设施参差更大:头部互联网大厂的数据中台和系统打通程度接近硅谷水平,但大量中小企业、传统制造业、体制内机构的内部系统仍然碎片化,数据还锁在Excel和微信群里。智联招聘数据显示,80%以上的AI岗位招聘来自300人以下企业[10],说明AI部署能力高度集中在少数组织。这意味着中国的94%→33%落差可能更大,缓冲窗口也因此更宽,但不是均匀分布的,大厂员工的窗口可能已经在关闭,而中小企业员工的窗口还远没到。
用AI最熟练的人,正在怎么用它?
如果替代真的即将全面发生,最先能观察到的人群应该是重度用户:他们最早把任务整个交给AI。使用行为数据恰恰显示了相反的走向。
{
"id": "usage-turn",
"type": "stage",
"title": "Claude用户自动化与协作式使用的变化",
"deck": "越熟练的用户越从全自动退回协作,现实工作仍需人机配合。",
"badge": "数据图表",
"source": "数据与来源见本文参考文献。",
"nodes": [
{
"n": "早期",
"label": "自动化27%",
"sub": "随后升至39%",
"title": "2025年:用户先尝试把任务整个交出去",
"copy": "指令委派式使用从27%升到39%,一度看起来在向全自动演进。",
"data": "Claude.ai聊天侧行为。"
},
{
"n": "2026.1",
"label": "协作52% > 自动化45%",
"sub": "风向掉头",
"title": "2026年1月:协作重新超过自动化",
"copy": "用户发现复杂任务需要定义、拆解、补充上下文与分阶段校验。",
"data": "协作52%,自动化45%。"
},
{
"n": "2026.3",
"label": "越熟练越协作",
"sub": "复杂任务成功率更高",
"title": "2026年3月:经验越多,纯委派越少",
"copy": "重度用户更多采用迭代与拆分,而不是一次性把任务交给模型。",
"data": "报告给出方向性分层结论,未披露统一百分比。"
}
],
"variant": "timeline",
"center": "AI",
"centerSub": "cycle"
}
以Claude.ai聊天侧为例,2025年9月的报告显示[8:1],偏自动化的指令委派式使用从27%上升到39%,看起来正在朝“全自动”演进。但到2026年1月,风向掉头:协作式使用(52%)重新高于自动化使用(45%)。2026年3月的报告进一步给出用户分层:用得越久的用户,反而越少采用纯指令式委派,越多采用迭代和拆分,报告的原话翻译过来是:越有经验的用户,越倾向于协作式使用,用在更复杂的任务上,且成功率更高。
这个起伏是全篇最真实的信号。它说明重度用户集体试过“把任务整个交出去”,然后集体退了回来:真正的效能提升,需要人来定义任务、拆小问题、给足上下文、分阶段校验。连最熟练的用户都在放弃全自动,说明自动化改造在大多数场景推不动;推不动的地方,人的岗位价值就依然存在。
这个判断什么时候作废?
“不必焦虑”这类话,市面上要么是安慰,要么是口号。要让它成为一个判断,必须写明它错的时候长什么样。
两个翻转信号。第一,真实覆盖率显著逼近50%:意味着组织改造的消化速度大幅加快,缓冲窗口在关闭。第二,美国软件行业出现岗位持续净下降:软件业是AI渗透最深的行业,它的岗位总量是替代是否进入实质阶段的最直接指标。对中国读者更直接的翻转信号是:智联/脉脉上AI岗位供需比从目前的高需求开始逆转(供大于求),以及互联网大厂非AI技术岗(后端、前端、测试)出现连续两个季度的净招聘下降。前者说明AI人才从稀缺变拥挤,后者说明AI正在实质性地吃掉传统技术岗。两个信号出现任何一个,本文判断作废,届时的正确动作不是继续淡定,是加速转型。2026年AI agent正在爆发,替代曲线完全可能被快速改写,这两个指标值得每季度看一眼。
在那之前,给企业和个人的建议是同一条:不要焦虑,也不要跟风囤工具。把你的工作流、业务流,以及背后的数据流、信息流重新梳理一遍,让“路”先于“车”准备好。窗口期的正确用法不是观望,是修路。做好准备,比多装几个软件重要得多。
页边注|经济指数|Anthropic拿自家Claude真实使用记录做的劳动力研究,不做问卷、不请专家预测,只看用户到底怎么点,是市面上少见的行为观察式AI就业研究。 ↩︎
页边注|缓冲窗口|理论上能做和实际在做之间的落差,企业把数据、系统、权限这些“土路”修好多久,窗口就留多久,修路比换发动机难得多。 ↩︎
页边注|β指标|衡量某个任务能不能被大模型大幅提速的打分,分高意味着理论可替代性强;但理论分高不等于现实里真在替代,中间还隔着组织改造。 ↩︎
参考文献|Anthropic Economic Index. Economic Primitives.[EB/OL]. 2026. ↩︎
参考文献|Tyna Eloundou. GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models[EB/OL]. 2023. ↩︎
参考文献|Anthropic Economic Index. Learning Curves.[EB/OL]. 2026. ↩︎
参考文献|Anthropic Economic Index. September 2025 report[EB/OL]. 2025. ↩︎ ↩︎
参考文献|Anthropic Economic Index. January 2026 report[EB/OL]. 2026. ↩︎