Harveyの粗利率が半年で50%から▲50%へ──エージェント化がSaaSの原価構造を壊した事例を読む

法務AIのHarveyの粗利率が、2026年初の約50%から6月には約▲50%まで落ち込んだとBloombergが9月21日に報じました。原因は売上の失速ではありません。3月のエージェント機能アップデートで利用が急増し、モデル推論コストが売上を上回ったためです。定額のシート課金で売り、従量のトークン課金で仕入れる——この組み合わせが、エージェントの登場で成立しなくなったという構造的な話です。同社は8月に自社モデル「Harvey Tenet」を投入し、粗利率はプラスに戻ったと報じられています。AI機能を売る側にも、AIツールを買う側にも、この半年は再現しうる出来事です。
何が起きたのか
報道と一次情報を時系列で並べると、次のようになります。
- 2026年初:粗利率は約50%。SaaSとしては低めですが、AIアプリケーション企業としては健全な水準です。
- 3月:AIエージェントのアップデートを実施。顧客の利用が急増します。同社によれば、トークン消費は年内で20倍に増えました。
- 6月:粗利率は約▲50%。売上1に対して提供原価が1.5かかる状態です。
- 8月20日:自社初のポストトレーニング済みオープンウェイトモデル「Harvey Tenet」をリサーチプレビューとして公開。
- 9月9日:5億5,000万ドルを調達し、評価額155億ドル(Bloombergは156億ドルと報道)。ARRは4億ドル超とされます。
粗利率がマイナスということは、売れば売るほど赤字が増えるということです。それでも同時期に評価額は上がっています。投資家は「原価は下げられる」と見ている、という読み方が自然です。
なぜ反転したのか:定額で売り、従量で仕入れる構造
Harveyは年間のシート単位ライセンスで販売する一方、モデル提供元にはトークン単位で支払います。週に数回しか使わない弁護士も、データルームを一晩エージェントに探索させる弁護士も、支払額は同じです。
問題は、エージェントが「1回の指示あたりの消費量」を桁で変えたことです。Harveyが公開している評価基盤の説明によれば、1つのタスクで1,000ターンを超え、数十万トークンを使うことがあります。M&Aデューデリジェンスの評価タスクでは、1件で最大8,000万トークンの文書を横断します。単発の質問応答を前提に設計された定額価格が、この消費量に耐えられるはずがありません。
算数にすると分かりやすくなります。粗利率50%なら売上1ドルあたりの提供原価は50セント、▲50%なら1.5ドル。提供原価が約半年で3倍になった計算です。売上も伸びてはいましたが、トークン消費の伸びがそれをはるかに上回りました。
打ち手は「値上げ」ではなく「モデルの差し替え」だった
▲50%の粗利率を放置できる企業はありません。取りうる選択肢は、従量課金への移行、利用量の上限設定、より安いモデルへの切り替えの3つです。報道ベースでは、Harveyは3つ目を選びました。価格改定の発表はありません。
Harvey Tenetは、中国Moonshot AIのオープンウェイトモデル「Kimi K3」をベースに、Fireworks AIと共同で長時間タスク向けにポストトレーニングしたモデルです。Fireworksの公開データでは、TenetのLAB1タスクあたりコストは5.92ドルで、ベースのKimi K3の5.62ドルとほぼ同水準。コストを据え置いたまま、完了タスク数を約2倍にしています。
注目すべきは、コスト削減が「安いモデルに替えた」だけではない点です。Harveyは学習時の報酬設計で、同じ品質なら推論トークンを少なく使う挙動を優遇しました。トークン単価と消費トークン数の両方に手を入れています。法律事務所ナレッジ検索向けの実験では、完了時の総トークンを58%削減し、クエリあたりコストを90%下げたと報告しています。
ただし、回復を額面どおり受け取る前に
Tenetは同社自身が「リサーチプレビュー」と位置づけており、本番投入はこれからと明記されています。品質指標もHarvey自身のベンチマーク上のもので、絶対値は高くありません。LABのall-pass率(全評価基準を満たしたタスクの割合)はTenetで19.7%、ベースのKimi K3で10.8%です。5タスクに1つしか完全通過しない水準であることは、導入側が押さえておくべき前提です。また、特権的な法務情報を扱う製品が中国発のオープンウェイトモデルを基盤に採用した点は、South China Morning Postをはじめ複数のメディアが論点として取り上げています。
AI機能を「売る側」が見直すべき3点
この事例が示すのは、特定企業の失策ではなく、エージェント型機能を定額で売るすべてのプロダクトに共通する算数です。実務的には次の順で手を打つのが現実的です。
- 原価ドライバーと課金単位を揃える。シート数ではなく、実行回数・処理文書量・タスク完了数など、コストが増える軸で課金する。既存顧客の契約上すぐ変えられないなら、フェアユース上限とスパイク時のスロットリングを先に入れる。
- 顧客別・機能別の推論コストを計測できるようにする。粗利率がマイナスに転じてから気づくのは、コストを全体の一括計上でしか見ていないからです。案件単位・ユーザー単位の原価按分は、機能追加より先に着手する価値があります。
- モデルを差し替え可能な構造にしておく。Harveyがモデルを入れ替えられたのは、LABという1,200以上のタスクからなる自社評価基盤を先に持っていたからです。評価セットがなければ「安いモデルに替えて品質が落ちていないか」を判断できず、差し替えは怖くて実行できません。モデル抽象化層とルーティング、そして自社タスクでの回帰テストは、コスト最適化の前提条件です。
Harveyの公開情報を見ると、同社はタスクごとに異なるベースモデルを使い分けています。汎用エージェントはKimi K3系、文書レビューやディリジェンスの一部はGLM-5.2系、ナレッジ検索はより小さいモデルというように、用途ごとに最適解を選ぶ構成です。単一モデルへの全面依存は、品質面だけでなく原価面のリスクでもあります。
AIツールを「買う側」のチェックポイント
ベンダー側が原価圧力にさらされているということは、契約更新時に何かが変わる可能性が高いということです。更新交渉では次を書面で確認してください。
- 提供に使われるモデルが変更された場合の事前通知と、変更後に品質を再検証する期間が設けられているか
- 「無制限利用」の実態。上限、スロットリング、超過時の課金がどう定義されているか
- 自組織の利用量とコストを可視化するダッシュボードが提供されるか
- ベンダー公表のベンチマークではなく、自社の代表的なタスクで比較評価できるか
Harveyのケースでは、顧客は値上げも利用制限も受けずに済んだように見えます。ただしそれは、ベンダーが自前でモデルを訓練できる資本と人材を持っていたからです。同じ条件を持たないベンダーは、従量課金化か利用上限のどちらかを選ばざるをえません。
まず何から手をつけるか
売る側なら、自社プロダクトの推論コストを顧客単位で分解し、上位10%のヘビーユーザーの粗利率を出すところから始めてください。買う側なら、次の更新までにモデル変更条項と利用量の可視化を要求リストに加えることです。どちらも、価格表を作り直すより先にできます。
chot Inc.では、AIアプリケーションの開発において、モデルの抽象化・ルーティング設計、評価セットの構築、利用量とコストの計測基盤づくりを含めた実装を行っています。定額課金の機能にエージェントを載せたあとの原価が読めない、モデルを差し替えたいが品質を担保する仕組みがない、といった課題があればお問い合わせください。
出典
- Bloomberg: Harveyなどのスタートアップ、AnthropicやOpenAIへの依存を減らすためオープンモデルを採用(2026年9月21日)
- Harvey: Harvey Tenet リサーチプレビュー(2026年8月20日)
- Fireworks AI: Harveyとの長時間法務タスク向けKimi K3ポストトレーニング
- Harvey: 評価額155億ドルで5億5,000万ドルを調達(2026年9月9日)
- TechCrunch: Harveyが評価額155億ドルに到達
- South China Morning Post: OpenAI出資のリーガルテック企業が中国製オープンウェイトモデルKimi K3へ移行


