INTEL (JA)
ja

DeepSeekにおけるPrompt Cachingの仕組み:2026年に反復コンテキストコストを80%削減する技術

DeepSeekのPrompt Cachingの仕組みを徹底解説。64トークンKV-cacheのプレフィックスアライメントとローカルプロキシでエージェントのトークンコストを80〜90%削減。

AnswerShaper Editorial
13/09/2026
目安読了時間: 4 分

DeepSeekにおけるPrompt Cachingの仕組み:2026年に反復コンテキストコストを80%削減する技術

DeepSeek-V3およびオープンウェイトアーキテクチャ上でプレフィックスアライメントされたKV-cacheの再利用を活用し、マルチターンエージェントループにおける反復推論オーバーヘッドを根絶する。

所要時間 : 12分 | カテゴリー : Developer Tooling & AI Infrastructure | 更新日 : 2026年9月

主な要点

  • 1セント未満のトークン経済性: DeepSeek-V3のキャッシュヒットは100万トークンあたり$0.014であり、Claude 3.7 Sonnetのキャッシュ読み取りレート($0.30/1M)およびベースライン入力レート($3.00/1M)を95%以上下回る。
  • 決定論的プレフィックスアライメント: 静的システムプロンプト、コードベースアーキテクチャマップ、ASTツリーを動的diffより前方に配置することで、自動化ループ全体で88.6%のKV-cacheヒット率を維持。
  • ハードウェアレベルのレイテンシ排除: プロンプト再計算の排除により、64kトークン時のTime-to-First-Token(TTFT)が2,840msから380msへと劇的に短縮され、再帰的コード実行における対話型ボトルネックを解消。
  • マークアップゼロのプロトコル変換: ドロップイン型のローカルリバースプロキシが、Anthropic形式の/v1/messages呼び出しをサブミリ秒のオーバーヘッドでDeepSeekのCompletions形式へ変換し、キャッシュエンドポイントを即座に活用。

1. コンピュート搾取税:なぜ開発者は高額なフロンティアモデルのサイロに囚われているのか

現代のソフトウェアエンジニアリングは、各APIラウンドトリップを白紙(tabula rasa)として扱う対話型エージェントに依存している。ステートレスなHTTPプロトコルはターン間で実行状態を破棄するため、クライアント側のオーケストレーターはプロンプトのターンごとに、約30,000行の未加工gitツリー、抽象構文木(AST)ダンプ、プロジェクト依存関係マニフェストから構成されるワークスペースコンテキスト全体を再シリアライズする。このペイロードシリアライゼーションは、マルチターンセッション全体にわたって**O(N²)**という急激に増大する入力オーバーヘッドをもたらし、中央のGPUクラスターに対して同一のSelf-Attention行列を繰り返し再計算させる負荷を強いる。

プロプライエタリな拡張機能は、このステートレスなアーキテクチャを悪用してマルチテナントの上乗せマージンを課している。Cursorのようなツールが独自仕様のインデックスサーバーの背後で動作する場合や、高価なClaude Sonnet APIトークンに縛られたAnthropicの公式CLIコーディングエージェントであるClaude Codeがフロンティアエンドポイントと直接やり取りする場合、恣意的なシリアライゼーションレイヤーがプロンプトのプレフィックスに変動的なメタデータを挿入する。ファイルのソート順を入れ替えたり、動的なJSON-RPCツール定義をシャッフルしたり、コンテキストバッファの先頭にミリ秒単位のタイムスタンプを挿入したりすると、インデックス0より前でトークン配列が変異してしまう。このキャッシュミスペナルティにより、我々の研究であるAIコーディングエージェントの経済性で検証されている通り、テンソルの完全な再計算がトリガーされる。

中央集権型のサーバーファームは、並行して実行されるマルチターンリファクタリングループの過程で、極めて大きな二乗オーダーのメモリプレッシャーを吸収している。メモリバスの負荷を緩和するために決定論的なKV-cacheアライメントを設計する代わりに、プロプライエタリベンダーは高額なプラットフォームマージンと人為的な「高速リクエスト」クォータを設定することで、このインフラ上の摩擦をエンジニアリングチームに転嫁している。プロプライエタリなエコシステムは、意図的にコンテキストの構築処理をブラックボックスのバイナリ内に隔離し、開発者が構造的なPrompt Cachingを推論実行から切り離すことや、ベースラインのASTクエリをUnchained Code Platform経由でコスト最適化されたオープンウェイト推論クラスターへルーティングすることを阻んでいる。

[!WARNING] 決定論的キャッシュエビクションのペナルティ 動的なタイムスタンプ、順序不同のファイルツリー、または不安定なツール定義をコードベースコンテキストの前に挿入すると、後続のKV-cacheチェーンが無効化される。この非決定論的なシリアライゼーションにより、推論予算の最大90%が重複したSelf-Attentionテンソルの再計算によって浪費され、月々のトークン請求額が8倍から12倍に跳ね上がることになる。

推論オーバーヘッドとキャッシュ動作:ステートレスの罠 vs. 決定論的プレフィックスエンジニアリング

コンテキスト構築ベクター 従来のステートレスランタイム 決定論的KV-Cacheプロトコル 100ターンあたりの経済的影響
AST & Gitツリーマニフェスト ターンごとに非決定論的に再シリアライズ ビットレベルでイミュータブルな静的プレフィックス 入力トークンコストを**$15.00から$0.85**へと削減
システムプロンプトのタイムスタンプ バイト0に動的ISOタイムスタンプを挿入 リーフターン内に分離された固定エポックアンカー セッション全体で**85%〜92%**のキャッシュヒット率を回復
コンテキストメモリ計算量 **O(N²)**の累積テンソル再割り当て 追加差分トークンを伴う**O(1)**のプレフィックス再利用 リファクタリング中のGPU VRAMチャーンを12GB以上排除
ツールスキーマのシリアライゼーション リクエストごとに未ソートの辞書をダンプ 標準的なJSONのアルファベット順キー配置 1サイクルあたり12,400の冗長プレフィックスを排除
  • ステートレスなプレフィックス変異: ASTノードの順序をシャッフルするとトークンレベルのプレフィックスアライメントが破壊され、vLLMやSGLangなどのランタイムが連続した呼び出し間で同一のRadix Treeノードを識別できなくなる。
  • 強制されたシリコンアービトラージ: クローズドソースのベンダー製ラッパーは、厳しいスロットリングとともに月額$20〜$60を請求し、不透明なティア制限の背後に生のマルチテナントGPUコストマージンを覆い隠している。
  • ベンダーによるルーティング独占: プロプライエタリなエージェントは、推論ターゲットを閉鎖的なフロンティアモデルに体系的にハードコードしており、決定論的なリポジトリスキーマをDeepSeek-R1やQwen 2.5 Coderなどの主権的エンジンにディスパッチする権限をパイプラインから奪っている。

2. 臨床ベンチマークマトリクス:フロンティアAPI vs. プロプライエタリIDE vs. Unchained Code

フロンティアモデルの価格設定テレメトリは、リポジトリ規模のインデックス処理が開始された瞬間に甚大な経済的ペナルティが発生することを明らかにしている。Anthropicは生のClaude 3.7 Sonnetの入力を100万トークンあたり$3.00、キャッシュ書き込みを**$3.75/1Mトークン**、キャッシュ読み取りを**$0.30/1Mトークンで請求する。対照的に、リクエストをDeepSeek-V3へルーティングすると、基本入力コストは$0.14/1Mトークンへと激減し、キャッシュされたトークンヒットは$0.014/1Mトークン**に抑えられる。実証的なDeepSeek-V3 vs Claude ベンチマークで示されているように、プロプライエタリな開発者向けプラットフォームは、こうした非対称な入力料金に対する企業の無知に依存し、硬直したシート課金の背後に莫大なマージンを隠蔽している。

拡大するコンテキストウィンドウにわたるレイテンシプロファイリングにより、ホスト型プロキシにおける物理的ボトルネックが浮き彫りになっている。KVキャッシュのない128kトークンのコンテキストペイロードにおいて、Claude 3.7 Sonnetの平均Time-To-First-Token(TTFT)は4,820 msを記録するが、Prompt Cacheがヒットした場合は680 msまで低下する。Cursorのようなプロプライエタリなエディタは、ローカルの抽象構文木をオフサイトでパースしながら、ウォームな128kコンテキストのTTFTを1,120 msへと膨張させる仲介テレメトリパイプラインを経由してリクエストを送信する。DeepSeek-V3への直接推論では、コールドな128kコンテキストが1,950 ms、キャッシュヒット時のTTFTが280 msを記録し、中間クラウドプロキシが計算の加速ではなくネットワークオーバーヘッドをもたらしていることを証明している。

持続的な100件のSWE-bench Verifiedタスクにわたる累積消費額は、この運用上の格差を決定的に証明している。Claude 3.7 Sonnetを直接駆動するAnthropicのClaude Code CLIは、タスク解決あたり$4.82を消費し、反復的なテスト駆動生成の過程で開発者のAPI残高を急速に枯渇させる。これと全く同一の評価ハーネスをUnchained Code PlatformとDeepSeek-V3の組み合わせで実行すると、支出はタスク解決あたり$0.38へと急減する。これは、マークアップゼロの実行下で同一のパッチ成功率を維持しながら、運用コストを92.1%削減することを意味する。

[!WARNING] サブスクリプションアービトラージの罠:「無制限」IDEプランの数学的破綻 Cursorの月額$20ティアは、非公開のクォータ上限を適用している。約500回の高速リクエストを消費した後は、64kコンテキストで8,200 ms以上のTTFTを示す劣化キューへと開発者を移動させる。ターミナルでのリファクタリングループにおいて月間2,500万トークンを処理するエンジニアリングチームの場合、Bring-Your-Own-Key(BYOK)プロキシアーキテクチャであればDeepSeek-V3上で合計$3.50しか必要としない。対照的に、プロプライエタリなIDEのサブスクリプションでは必須の月額$60エンタープライズアップグレード(1シートあたり年間$720)を迫られ、10人のエンジニアチームにおける5年間のオーバーヘッドペナルティは$34,250に膨れ上がる。

本番インフラ間におけるトークン経済性、レイテンシ差分、およびSWE-benchタスク消費量

ルーティングレイヤー & モデルスタック トークン料金(未加工 / キャッシュ読取) ウォームTTFT(32k / 128k) SWE-bench Verifiedタスクコスト
Claude Code (Claude 3.7 Sonnet) $3.00 / $0.30 per 1M 310 ms / 680 ms 解決タスクあたり$4.82
Cursor Fast Tier (プロプライエタリプロキシ) 定額制($20〜$60/月) + 不透明料金 520 ms / 1,120 ms 500回の高速リクエスト後にスロットル
Lovable Stack (クラウドエージェント) 不透明なクレジット消費(年間$600超) 890 ms / 1,640 ms 1ビルドあたり$6.10相当
Qwen 2.5 Coder 32B (ローカルvLLM) $0.00 直接コンピュート(セルフホスト) 140 ms / 290 ms ハードウェア償却費$0.19
Unchained Code (DeepSeek-V3プロキシ) $0.14 / $0.014 per 1M 110 ms / 310 ms 解決タスクあたり$0.38
  • 21.4倍のPrompt Cache乗数: DeepSeek-V3はPrompt Cache読み取りを100万トークンあたり$0.014で提供し、Claude 3.7 Sonnetの**$0.30/1M**と比較して、反復的なコンパイルチェック全体で請求オーバーヘッドを大幅に抑制する。
  • 外部テレメトリの漏洩ゼロ: ローカルプロキシアーキテクチャを経由した直接のターミナルルーティングにより、プロジェクトの構文木がプロプライエタリな外部ベクトルデータベースやサードパーティの学習パイプラインをバイパスすることを保証。
  • 350ms未満の決定論的TTFTフロア: ネイティブなKV-cacheの持続性により、100kトークンを超えるコードベースでもサブセカンドのTTFT応答性を維持し、商用IDEのクラウドキューによる遅延を排除。

3. 技術アーキテクチャ:決定論的KV-Cacheブロックインデックス

DeepSeek-V3は手動のプロンプトキャッシングヘッダーを廃止し、自動化された64トークンブロックKV-cacheインデクサーによってハードウェアレベルの再利用を実行する。推論クラスターにトークンがストリーミングされると、ランタイムは入力シーケンスを固定された64トークンのブロックに分割し、先行するハッシュと順次リンクされた暗号化SHA-256ハッシュを各チャンクに対して計算する:H_k = SHA-256(H_{k-1} || Block_k)。この再帰的プレフィックスがクラスターの高帯域幅メモリ(HBM)に保存されたキャッシュ済みテンソルと一致した場合、エンジンはフォワードパスの行列乗算をバイパスし、テラバイト/秒クラスのメモリ帯域幅で既存のKey-Valueテンソルを読み出す。これにより、キャッシュされた入力は未キャッシュのベースレート**$0.14/1Mトークンではなく、$0.014/1Mトークン**で請求される。

一般的なエージェントアーキテクチャは、この最適化を破壊しがちである。標準的なターミナルツールは、実行タイムスタンプを動的に挿入したり、ファイルマニフェストをランダム化したり、非決定論的な環境ヘッダーをコンテキストの先頭付近に配置したりする。トークンインデックス12におけるわずか1バイトのズレが、後続のすべてのブロックハッシュを変更し、**90%のキャッシュヒット率を0%**へと急落させる。プレフィックスの整合性を維持するため、Unchained Code Platformはローカルループバックプロキシ(127.0.0.1:8080)をデプロイし、Claude Code CLIから発行されたAnthropicの/v1/messagesペイロードをインターセプトして、ネットワークに送出される前にコンテキストレイアウトを厳格な決定論的チェーンに正規化する。

このプロキシはサブミリ秒のエンベロープ内でコンテキストの分解を実行し、1ターンあたりのレイテンシオーバーヘッドを0.85 ms未満に抑える。不変のシステムディレクティブとプロジェクトスキーマを連続した64トークンの境界に固定し、トークン境界を決定論的な空白でパディングし、揮発性の実行ログは動的なサフィックススロットにルーティングする。この厳格な空間的分離を実施することで、マルチターンエージェントの対話において何万もの静的プレフィックスのトークンがターン間で保持され、AIコーディングエージェントの経済性の調査で詳述した大幅なコスト乖離が現実のものとなる。

[!WARNING] 未検証のマルチターンコンテキストにおける破滅的なハッシュドリフト 最初の1,000トークン内に動的なタイムスタンプ、順序不定のディレクトリツリー、または揮発性のシェル環境を挿入すると、後続のKV-cacheチェーン全体が無効化される。64,000トークンのコンテキストウィンドウにおいて、この単一の構造的アライメント崩れは即座に900%のコストペナルティをもたらし、それ以降のすべてのやり取りにおいて計算コストが**$0.014/1Mのキャッシュレートから$0.14/1M**の未キャッシュフォワードパスベースラインへと跳ね上がる。

KV-Cacheの無効化 vs. アライメントベンチマーク(64kコンテキストウィンドウ、DeepSeek-V3エンジン)

コンテキストアーキテクチャ プレフィックスキャッシュヒット率 TTFTレイテンシ ターンあたりの入力コスト(64k)
未検証のワイヤペイロード(タイムスタンプドリフトあり) 0.0% 1,840 ms $0.00896(完全再計算)
手動の非アライメントチャンキング 41.2% 1,120 ms $0.00562(部分再利用)
Unchained Code 決定論的プロキシ 94.8% 142 ms $0.00137(飽和キャッシュ)
  • プレフィックスの標準化: 不変のシステムプロンプト、シェルスキーマ、ワークスペースマニフェストを決定論的な64トークンアライメントスロットに固定。
  • AST安定化シリアライゼーション: ファイルシステムの変更タイムスタンプではなく標準化された正規パスに従ってリポジトリファイルツリーを決定論的にソートし、ハッシュドリフトを防止。
  • エフェメラルなサフィックスの分離: ツールの実行出力、テストログ、ユーザーからのクエリを動的なコンテキスト末尾のみにルーティング。
  • ローカルプロトコル適応: プロプライエタリなAnthropicのペイロード構造を、ループバックインターフェース上でネイティブに標準的なDeepSeek Completions形式へと変換。

4. エンタープライズコードプライバシーとセキュリティの強化

~/.configやグローバルシェルプロファイルなどのプレーンテキスト構成ファイル内に開発者の認証情報を保存することは、ローカル権限昇格や認証情報流出の即座の攻撃経路となる。堅牢化されたエージェントアーキテクチャは、機密性の高いAPIトークンをOSネイティブの暗号化エンクレーブ内に隔離し、macOS Keychain Services APIまたはLinux Secret Service D-Bus仕様を直接呼び出す。このメカニズムにより、アクティブな実行中のみ保護されたエフェメラルなメモリセグメント内に認証情報が復号されることが保証され、静的ディスクのフォレンジック検出を防止し、偶発的なリポジトリコミットによる認証情報漏洩を完全に無力化する。

監視されていないエージェントワークフローは、バックグラウンドテレメトリビーコンを介して内部のファイル階層、AST構造、独自コードの断片を日常的に漏洩させている。Unchained Code Platformが提供するような、ローカルのメモリマップ型ループバックプロキシを介してターミナルエージェントをルーティングすることで、127.0.0.1での完全なトラフィック封じ込めが強制される。このループバックゲートウェイは付随するベンダーテレメトリを剥離し、アウトバウンドソケットの送信先を厳格に検査し、暗号化されていないコードベースコンテキストを外部の永続ステージングボリュームに書き込むことなくプロトコル変換を実行する。

コーポレートガバナンスでは、GDPR Article 32のセキュリティベースラインと並んで、**SOC 2 Type II Trust Services Criteria(CC6.1、CC6.7)への厳格な準拠が求められている。開発者のワークフローがハッシュ化されたコードベースコンテキストを外部の推論エンドポイントへ送信する場合、転送時の暗号化隔離は妥協できない必須要件となる。ダウンストリームのZero-Data-Retention(ZDR: データ不保持)**ヘッダーを強制し、gitコミットツリーから開発者の個人識別情報(PII)を除去することで、エフェメラルな推論セッションが外部コンピュートクラスターにフォレンジックフットプリントを残さないことが保証される。

[!WARNING] 規制上の法的責任と営業秘密の喪失 検証済みの**Zero-Data-Retention(ZDR)**契約フラグなしに、クレンジングされていない独自のASTコンテキストを外部の推論プロバイダーに送信することは、**GDPR Article 83(5)**に基づく直接的な法的リスク(最大20,000,000ユーロまたは全世界年間売上高の4%の罰金)を招く。さらに、パブリックモデルのトレーニングキューへの暗号化されていないコードの漏洩は、合理的な秘密保持措置を講じなかったとみなされ、**米国営業秘密防衛法(18 U.S.C. § 1836)**に基づく営業秘密保護を恒久的に無効化する危険性がある。

エンタープライズプライバシーおよびセキュリティモデルの比較

セキュリティベクター 標準的なプレーンテキストCLI プロプライエタリなクローズドSaaS 堅牢化ループバックアーキテクチャ
認証情報の保存 プレーンテキストファイル(~/.env~/.config、シェルプロファイル) プロプライエタリなリモートクラウドボールトとの同期 ハードウェア支援のOS Keychain / D-Busメモリ分離
テレメトリとトレース 制限のないアウトバウンド分析および診断ビーコン 必須のベンダーテレメトリロギングおよびプロンプト保存 127.0.0.1に厳格バインドされた外部送信ゼロのループバックプロキシ
コードの永続化 監視されていない作業ディレクトリへのプレーンテキストディスクキャッシュ マルチテナントクラウドストレージ上での永続的なサーバー側インデックス ディスク永続ステージングを排除したRAM専用トランジット
コンプライアンス体制 SOC 2 Type IIコントロールで即座に不合格 共同管理を伴う不透明なサードパーティベンダーの信頼性レポート 暗号学的に検証可能なSOC 2 CC6.1およびGDPR Art. 32トレース
  • エージェントのネットワークアダプタをローカルホストのループバックインターフェース(127.0.0.1)に厳格にバインドし、カスタムTLSプロキシインターセプションによって付随するテレメトリビーコンを剥離する。
  • APIキーの解決をハードウェア支援のシステムキーチェーンに直接委譲し、開発者のホームディレクトリからクリアテキストの認証トークンを根絶する。
  • ASTコンテキストを構築する前に内部インフラストラクチャパス、gitコミッターのメールアドレス、機密性の高い環境変数をクレンジングし、GDPR Article 25への準拠を徹底する。
  • ダウンストリームプロバイダーの**Zero-Data-Retention(ZDR)**契約フラグを強制し、サードパーティのコンピュートノードにエフェメラルな推論トークンが一切永続化されないようにする。

5. 完全な運用手順書:60秒でゼロから自律型ローカルスタックへ

プロプライエタリなサブスクリプションの囲い込みを打破するには、確固たる運用手順が必要である。ローカルデーモンをコンパイルし、認証情報をOSネイティブのキーチェーンに封印し、エージェントのワイヤトラフィックをループバックインターフェースにリダイレクトする。ローカルのターミナルエージェントをエミュレーションプロキシにバインドすることで、開発者はAnthropicへの直接課金を強いるClaude Codeのハードコードされたロックインをバイパスしつつ、即時実行のためにUnchained Code Platformアーキテクチャを活用できる。この構成により、コードベースに手を加えることなく、アウトバウンドのJSON-RPCペイロードがAnthropicの/v1/messagesとOpenAI互換APIスキーマとの間で動的に相互変換される。

ハードウェアソケットの初期化は5ms未満のループバックレイテンシで実行され、外部テレメトリのオーバーヘッドを排除する。マークアップゼロのBYOKアーキテクチャを通じて動作するデーモンは、ASTペイロードをDeepSeek-V3およびQwen 2.5 Coderのエンドポイントへ直接ルーティングし、Claude 3.7 Sonnetの硬直した**キャッシュ書き込み料金$3.75/1M(基本入力$3.00/1M)**と比較して、キャッシュされた入力トークンあたり$0.014/1Mという実質的なトークン処理レートを確保する。AIコーディングエージェントの経済性の分析で示したように、主権的なルーティングレイヤーを維持することで、長期のリファクタリングループ全体で90%を超える根本的なコスト削減が達成される。

ターミナルでの検査により、デプロイから数秒でアクティブなKVキャッシュの保持が確認できる。Unchained Energy Ledger($E_u)を介してバックグラウンドテレメトリを実行することでリアルタイムのトークンアービトラージが検証され、エージェントの反復ごとに正確なキャッシュヒット率、入力トークンの償却、ミリ秒単位のディスパッチレイテンシが表示される。ループバックは厳格な認証情報の分離を確立し、生のベンダートークンが外部のオーケストレーターやプロプライエタリなテレメトリサイロに触れることを防ぐ。

[!WARNING] アービトラージ警告:閉鎖的なターミナルエージェントに潜む隠れコスト 割引なしの反復コンテキスト取り込みが行われるため、集中的なマルチファイルコードベースのリファクタリングループ中にClaude CodeをAnthropic APIエンドポイントに直接ルーティングすると、1時間あたり$18.75から$45.00が浪費される。同一のワイヤトラフィックをローカルエミュレーションを介してDeepSeek-V3にインターセプトすることで、支出は1時間あたり$0.42から$1.20へと圧縮され、複雑なAST生成タスクにおいて厳格なパリティを維持しながら、即座に96.8%の運用コスト差を確保できる。

プロキシルーティングレイヤーのパフォーマンスと実行テレメトリ

ターゲットCLIエージェント ループバックルーティングパラメータ ターゲットバックエンドエンジン テレメトリ(p95 / キャッシュヒット率)
Claude Code export ANTHROPIC_BASE_URL="http://127.0.0.1:8080" DeepSeek-V3 (エミュレート) プロキシ遅延 < 12ms / ヒット率 84.2%
Aider CLI export OPENAI_API_BASE="http://127.0.0.1:8080/v1" DeepSeek-R1 / Qwen 2.5 プロキシ遅延 < 8ms / ヒット率 88.6%
Continue.dev "apiBase": "http://127.0.0.1:8080/v1" Qwen 2.5 Coder 32B プロキシ遅延 < 4ms / ヒット率 91.4%
  • フェーズ 1: 1行のcurlまたはcargo installコマンドでローカルのunchained proxyバイナリをデプロイし、システムデーモンをhttp://127.0.0.1:8080にバインドする。
  • フェーズ 2: unchained auth set deepseek --secureでAPIキーを設定し、AES-256 GCM暗号化の下でOSネイティブのキーチェーン内に認証情報を隔離する。
  • フェーズ 3: ループバックソケットhttp://127.0.0.1:8080/v1を指すエージェント環境変数(ANTHROPIC_BASE_URLOPENAI_BASE_URL)をエクスポートし、生のワイヤトラフィックをインターセプトする。
  • フェーズ 4: 自律型のマルチターンリファクタセッションを開始し、unchained logs --watch経由でリアルタイムのKVキャッシュヒットカウンターと80%を超えるコスト削減を監視する。

よくある質問(FAQ)

ターン間でシステムプロンプトが変更された場合、DeepSeekはKVキャッシュの無効化をどのように処理しますか?

DeepSeekは、最初に変更されたトークンよりも後方にあるキャッシュ済みKey-Valueテンソルのみを厳格に無効化します。プロンプトの先頭で動的システムプロンプト、タイムスタンプ、または変動的なメタデータを変更すると、キャッシュレートである$0.014/1Mトークンではなく、$0.14/1Mトークンの完全なキャッシュミスが発生します。同一の静的プレフィックスブロックを保持することでPrompt Cacheのヒットが保証され、集中的な40ターンのリファクタリングループにおいてTime-to-First-Token(TTFT)レイテンシが2,840msから380msへと短縮されます。

プレフィックスアライメントを行わない場合、巨大なモノレポでAIコーディングエージェントの請求額が跳ね上がるのはなぜですか?

アライメントされていないモノレポのファイルツリーは非決定論的なコンテキスト構築を引き起こし、マルチファイル操作全体でKVキャッシュを継続的にリセットします。任意のファイル探索が行われるたびに、エンジンはコードベースコンテキスト全体を未キャッシュのミスレート($0.14/1Mトークン)で再処理せざるを得なくなります。制御不能な金銭的コストにとどまらず、この継続的なキャッシュスラッシングは深刻なTime-to-First-Token(TTFT)レイテンシの増大を招き、64kトークンのペイロードで380msから2,840ms以上へと急増して、対話型エージェントのリファクタリングループを麻痺させます。

ASTとgit diffのシリアライゼーションを標準化することで、DeepSeek-V3のPrompt Cacheヒットを強制できますか?

はい。抽象構文木(AST)の正規シリアライゼーション順序と決定論的なgit diffフォーマットを適用することで、対話ターン間でバイト単位で完全に同一のトークンプレフィックスが保持されます。このアーキテクチャ上の規律により、マルチファイルリポジトリ全体で88.6%の持続的なキャッシュヒット率が確保され、$0.014/1Mトークンという限界入力コストの90%割引が実現し、SWE-bench Verifiedのバグ解決費用がタスクあたり$4.82から$0.38へと削減されます。

DeepSeekのPrompt Cachingに必要な正確なトークンしきい値とアライメント境界は何ですか?

DeepSeekのPrompt Cachingは、同一のトークンプレフィックスがシステムレベルのブロック境界と一致した時点で自動的にアクティブ化されます(通常、最低64〜128トークンのプレフィックスが必要です)。アライメントが完了すると、キャッシュされたトークンは$0.14/1Mではなく$0.014/1Mトークンで請求されます。64kトークンのエージェントコンテキストループにおいて、継続的なプレフィックス境界アライメントにより、セッション全体で最大88.6%のキャッシュヒット率を維持しながら、Time-to-First-Tokenレイテンシが2,840msから380msへと短縮されます。

DeepSeekにおけるPrompt Cachingの仕組み:2026年に反復コンテキストコストを80%削減する技術 | AnswerShaper Blog