AIと働く仕事は9割、任せきれた仕事は26% — Anthropicが自社の「自動化率」を数えて公開した
【国際・海外企業】連載・AI・イノベ米国【科学・AI】【経済・生成AI】
#Anthropic#自動化レベル#AI活用率#KPI設計#エージェント#業務測定
AIと働く仕事は9割、任せきれた仕事は26% — Anthropicが自社の「自動化率」を数えて公開した

「AIで仕事がどれだけ楽になったか」を社内で説明しようとすると、たいていは利用者数か利用回数の話になります。
Anthropicは2026年9月17日、自社のAI研究開発の仕事を6段階に分け、どの段階に何割いるかを数えて公開しました。
出てきたのは、AIが関わる仕事は9割を超えるのに、任せきれている仕事は4分の1という数字です。
6段階に分けて数えたら、上が詰まっていた
Anthropicが使った物差しは、AL0からAL5までの6段階です。
AL0はAIがまったく関わらない仕事、AL1はごく一部だけ、AL2は「AIが補助する(AI assists)」。
AL3は「協働する(collaborates)」で、人が細かく方向づけたうえで大きな塊をAIが片づける段階。
AL4は「主導する(leads)」で、ざっくりした指示から最後まで自分で仕上げる段階。
AL5が完全自律です。
2026年8月時点の結果は、AL3の「協働」以上が90%超、AL4の「主導」が26%、そしてAL5の完全自律は、測定したどの部分でも見られませんでした。
社内で最大の基盤の上では、研究と開発の仕事をするエージェントが同時に約30,000体動いています。
数え方も公開されています。
2026年7月のSlackと社内文書から細かい業務タスクを約15,000件抜き出し、542個のノードを持つ階層に整理したうえで、各分類に「その仕事に費やされた人の時間」で重みをつけました。
利用回数ではなく人時間で重みづけしているので、「よく使われる軽い作業」で数字が膨らみにくい設計です。
上に行けないのは、賢さではなく確かめる手間
では、なぜ協働から主導への段差が大きいのか。同じ発表に含まれる計算資源の内訳が、その手がかりになります。
2026年7月13日から20日の1週間を切り取ると、AI研究開発に投じた計算資源のうち安全性の研究へ回ったのは全体で約6%。
ところが、AIが主導する研究開発の部分だけを取り出すと約12%と、およそ2倍になります。
AIに任せる度合いが上がった領域ほど、その出力を確かめるために計算資源を割いている、という関係です。
監視の実務も数字で出ています。
2026年8月のあいだに、研究開発エージェントの判断を10億件超まとめて調べた結果、実際に止められたのは0.002%、約47,000件に1件でした。
事後に記録を読み返す監視では、1,000件のやり取りにつき1〜2件が要確認として拾われています。

止まった割合が極端に小さいことは、二通りに読めます。
任せられる範囲をあらかじめ絞っているから危ない判断が出ていない、とも読めますし、網の目が粗くて拾えていない、とも読めます。
どちらであっても、確認の仕組みを回し続けるコストは減りません。
そしてこのコストは、AIが仕事をこなすほど比例して増えます。
完全自律が0%で止まっているのは、能力の限界というより、確かめる側の設計がまだ追いついていないからだと読めます。
自社で同じ数字を出すなら、どこを決めるか
この測り方は、AIを使う側の会社にもそのまま移せます。移すときに決めることは3つです。
1つ目は、何を1件と数えるかです。
Anthropicは業務記録から約15,000件のタスクを抜き出して階層に整理しました。
経理や営業に置き換えれば、「請求書の処理」ではなく「支払通知の照合」「差異の原因特定」「起票」のように、人が実際に手を動かす単位まで割る作業にあたります。
ここを粗く切ると、どの段階にいるかを判定できません。
2つ目は、重みです。件数で平均すると、月に何千件もある軽い作業が数字を押し上げます。人時間で重みをつければ、「重くて時間を食う仕事がどこまで任せられたか」が見えます。予算の話に直結するのは後者です。
3つ目は、確かめる費用を別費目で持つことです。
この発表が示しているのは、任せる比率と検証の負担が同時に増えるという関係でした。
AIの利用料だけを予算に置くと、レビュー、ログの読み返し、判定の仕組みの維持にかかる工数が、どこにも計上されないまま現場に積み上がります。
そして、この数字を人事評価に直結させないほうがよい理由も、発表自体が書いています。
段階の判定はAIの判定モデルに依存しており、人間の評価との一致率は59%。
境界にある仕事では判断が割れると明記されています。
測り方に4割の揺れがある指標を目標値にすると、動くのは実態ではなく判定のほうです。
見立てと監視ポイント
自社のAI活用度を外に出した企業は、まだほとんどありません。
この発表の価値は26%という水準そのものより、「段階で測り、人時間で重みをつけ、測定の誤差まで書く」という型を先に置いた点にあります。
ただし数値は自社定義・自社計測で、他社と横に並べることはできません。
- 次の更新での動き — タスク一覧はいったん凍結されており、定期的に作り直して数字を版ごとに出し直す方針です。26%が上がったのか、一覧の作り直しで上がったのかを、版の違いを見て切り分けられるか。
- 判定の精度 — 人間との一致率59%が改善するか。ここが上がらないうちは、社内KPIへの転用は参考値どまりです。
- 検証コストの比率 — AI主導部分の安全配分12%が、任せる範囲の拡大とともにどう動くか。比率が下がれば効率化、上がり続けるなら自動化の頭打ちを示す信号になります。
腹落ち確認の問い
「AIが関わる仕事は9割超」と「AIに任せきれた仕事は26%」は、同じ職場の同じ期間を測った数字です。この2つが大きく離れていること自体は、AI活用が進んでいない証拠でしょうか。
考え方
離れていること自体は遅れの証拠にはなりません。
2つの数字は別のものを測っています。
9割は「AIが仕事に入り込んだ範囲の広さ」、26%は「人が最後まで見届けなくてよくなった範囲の深さ」です。
広さは道具を配れば伸びますが、深さは確認をやめられて初めて伸びます。
実際、AIが主導する領域では検証に回す計算資源が倍になっていました。
手放すには、間違いを見つける仕組みと、間違ったときに誰が責任を持つかの決めごとが要ります。
差が縮まらないときに疑うべきは、AIの性能より、確認を減らせる設計があるかどうかです。
出典(一次/二次の切り分け)
- 一次・Anthropic — 自動化レベルAL0〜AL5の定義、2026年8月時点で主導26%・協働以上90%超・完全自律は測定対象のいずれの部分でも見られないこと、同時稼働エージェント約30,000体を照合。
- 一次・Anthropic(測定手法) — 2026年7月のSlackと社内文書から約15,000タスクを抽出、542ノードの階層に整理、person-timeで加重、判定モデルと人間の一致率59%、タスク一覧の凍結と定期的な作り直し方針を照合。
- 一次・Anthropic(監視と計算資源) — 2026年8月の10億超の判断のうちブロック0.002%(約47,000件に1件)、オフライン監視で1,000件あたり1〜2件、7月13〜20日のスナップショットで安全への配分がAI R&D全体の約6%・AI主導部分では約12%を照合。
- 二次・SiliconANGLE(2026年9月17日) — 公開日と主要数値を独立に確認。ページ本体には公開日の明記がありません。
- 反証1パス — すべて自社定義・自社計測であり、他社と同じ物差しでは比較できません。26%はタスク数の割合であって、工数の削減率でも成果物の品質でもありません。判定の人間一致率が59%である以上、水準そのものには幅があります。
もっと詳しく知りたい人へ
- Anthropic: Measurements for understanding the pace of AI development — AL0〜AL5の定義、測定手法、限界の記述が原文で読めます
- SiliconANGLE の報道(2026年9月17日) — 公開日と、外部から見た位置づけが分かります
- Anthropic Economic Index — 同社が社外の利用データから職種別の使われ方を測った別系統の指標です
- 情報・通信業業界基礎ガイド — AI基盤を含む情報通信業の事業構造と収益の出方が分かります
- FP&Aの勘所 — 情報通信業で費用をどの費目に置くかの考え方を確認できます