DeepSeek-V4.1-Flash、KVキャッシュを約4分の1に圧縮 長文脈AIのメモリ負荷を軽減

Photo by Solen Feyissa on Unsplash[写真拡大]
DeepSeekは2026年9月、長文脈を扱うAIエージェントの計算量とメモリ負荷を抑える「DeepSeek-V4.1-Flash」を公開した。5520億パラメータのマルチモーダルMixture-of-Experts(MoE)モデルで、テキストと画像を入力でき、最大100万トークンのコンテキストに対応する。
同社の技術報告書によると、GPUの高帯域幅メモリ(HBM)に置くグローバルKVキャッシュはトークン当たり890バイトで、前世代のDeepSeek-V4-Flashの約4分の1となった。セッション状態の再利用に使う永続KVキャッシュも、SSDまたはホストメモリ上で前世代の約8分の1に削減したとしている。
■長文脈処理で重くなるKVキャッシュ
大規模言語モデルは文章を処理する際、過去のトークンから得たキーとバリューをKVキャッシュとして保存する。これにより、文章を生成するたびに過去のコンテキストを最初から計算し直す必要がなくなる。
AIエージェントでは、ツールの実行結果、取得した文書、コードの処理履歴、過去の対話などがコンテキストへ追加される。処理が長時間に及ぶほどキャッシュも増えるため、GPUメモリ容量のほか、キャッシュを退避するSSDやホストメモリ、再読み込み時のデータ転送帯域が運用効率を左右する。
DeepSeek-V4.1-Flashは、こうした入力の多いワークロードを想定して設計された。キャッシュの縮小は、同じ長さのコンテキストを扱う際に必要なメモリを減らし、同一のハードウェアで処理できるセッション数やコンテキスト長を増やす余地をもたらす。ただし、実際の同時処理数やコスト削減率は、モデルの配置方法、バッチ処理、キャッシュ管理、入出力比率などにも左右される。
■CEDで入力処理の計算量を削減
V4.1-Flashは、40層のTransformerを20層の因果エンコーダと20層のデコーダに分けたCausal Encoder-Decoder(CED)構造を採用する。デコーダのグローバルKVキャッシュは、各デコーダ層の隠れ状態から個別に生成するのではなく、エンコーダ最終層の隠れ状態から射影する。
これにより、長い入力を読み込んでKVキャッシュを構築するプリフィルでは、コンテキスト全体が通過する計算層を実質的に半分へ減らす。デコーダ側のスライディングウィンドウアテンションについては層ごとの処理を維持し、直近の一定範囲を再計算する構造を組み合わせる。
モデル本体は5520億パラメータで、これとは別に1960億パラメータの条件付きメモリ機構「Engram」を備える。トークン当たりで有効化されるモデル本体のパラメータは、プリフィル時が80億、出力を生成するデコード時が160億である。入力処理と出力生成で異なる計算量を割り当て、入力の比率が高いAIエージェント向け処理の効率化を狙った。
■CSA2とFP4でキャッシュを圧縮
KVキャッシュの削減には、Compressed Sparse Attention 2(CSA2)が使われている。CSA2は、グローバルKVデータや検索用のキー、参照対象として選ばれたトークン位置を複数の層で共有し、層ごとに同じ情報を保存・計算する重複を減らす。
各CSA2層にはFull、Reindex、Reuseのいずれかの動作モードが固定的に割り当てられる。FullはKVデータと参照位置を新たに計算し、Reindexは先行層のKVデータを再利用しながら参照位置を選び直す。ReuseはKVデータと参照位置の両方を先行層から引き継ぐ。
さらに、メインKVキャッシュは4ビット浮動小数点形式のFP4 E2M1で保存される。キャッシュはアテンション計算の前に逆量子化されるが、4ビット化に伴う精度への影響がなくなるわけではない。DeepSeekは量子化を考慮した学習を採用し、実験では性能低下を小幅に抑えたとしている。
CSA2による層間共有とFP4保存を組み合わせた結果、HBMに常駐するグローバルKVキャッシュはトークン当たり890バイトとなった。前世代のDeepSeek-V4-Flashは3514バイト、DeepSeek-V3.2は4万8068バイト、DeepSeek-V1は38万9120バイトであり、V4.1-Flashは前世代比で約4分の1、V1比で約437分の1となる。
■SWA Bounded Replayで永続キャッシュを削減
長時間動作するエージェントでは、セッションを中断した後に再開できるよう、KVキャッシュの一部をSSDやホストメモリへ保存する場合がある。V4.1-Flashは、この永続キャッシュの削減に「SWA Bounded Replay」を導入した。
この方式では、スライディングウィンドウアテンションのKV状態をSSDへすべて保存せず、セッション再開時に直近のウィンドウに相当するトークンを再処理して必要な状態を近似的に再構築する。ストレージ使用量とデータ転送を減らす代わりに、少量のプリフィル計算を行う設計である。
DeepSeekは、この近似的な再構築による性能低下は実験上わずかだったとしている。SWA Bounded Replayを含む最適化により、SSDまたはホストメモリに置く永続KVキャッシュは、同じシーケンス長におけるDeepSeek-V4-Flashの約8分の1になったという。
■最大100万トークンと画像入力に対応
V4.1-Flashは最大100万トークンのコンテキストを扱い、テキストに加えて画像も入力できる。画像は独自の視覚エンコーダで処理され、視覚特徴を言語モデルの埋め込みへ変換して、テキストとともに処理する。
DeepSeekは、450兆ではなく45兆トークンからなるマルチモーダルコーパスでモデルを事前学習したとしている。スパースアテンションは6万4000トークンの系列長で学習を開始し、学習途中でコンテキストを100万トークンまで拡張した。
技術報告書では、投機的デコード機構「DSpark」や、メモリアクセスを抑える「Single-Pass mHC」も説明されている。これらはKVキャッシュ圧縮とは別の側面から、出力生成の速度や推論時のデータ転送効率を改善するための技術である。
■ベンチマークはDeepSeekによる評価
DeepSeekが公表した評価では、V4.1-Flashはエージェント系ベンチマークのTerminal-Bench 2.1で90.6、DeepSWE v1.1で74.2を記録した。いずれも同社の評価条件による数値であり、実際の性能は使用するエージェント基盤、推論設定、ツール構成などによって変わり得る。
同社は、科学分野の専門知識を必要とするエージェント評価や、一部の推論評価では大規模なクローズドモデルとの差が残るとしている。また、層間でKVキャッシュや参照位置を共有する構造には、位置の選択に偏りが生じる可能性がある。
SWA Bounded Replayも近似的な再構築であるため、遠い過去の限られた情報を正確に探し出す必要がある処理では影響を受ける可能性がある。KVキャッシュ容量やベンチマーク値はいずれもDeepSeekの報告に基づくため、導入時には対象ワークロードで処理速度、メモリ使用量、精度を確認する必要がある。
■オープンウェイトとAPIで提供
V4.1-Flashのモデルウェイトは、MITライセンスでHugging Faceから公開されている。自社管理のインフラへ導入すれば、入力データをDeepSeekのAPIへ送らずに利用できるが、5520億パラメータのモデル本体に加えてEngramを備えるため、実際の運用には大規模な計算・メモリ資源と対応する推論ソフトウェアが必要となる。
DeepSeek APIでは「deepseek-flash」のモデル名で提供され、思考モードと非思考モード、画像入力、ツール呼び出し、JSON出力などに対応する。旧モデル名の「deepseek-v4-flash」と「deepseek-v4-flash-vision-exp」も当面利用できるが、リクエストはV4.1-Flashへ転送される。
2026年9月20日時点の公式料金は、入力キャッシュミス時のオフピーク料金が100万トークン当たり0.15ドル(約24円、1ドル=157円換算)、出力が0.60ドル(約94円、同)である。入力キャッシュヒット時は0.003ドル(約0.47円、同)となる。ピーク料金はいずれもオフピークの2倍で、料金や提供条件は変更される可能性がある。
V4.1-Flashが示したのは、長文脈AIの運用効率を高めるには、演算量だけでなく、KVキャッシュの保存形式、層間共有、永続化、データ転送まで一体で設計する必要があるという点だ。公表値の実環境での再現性は今後の検証課題となるが、メモリ容量がAIエージェントの同時実行数と運用コストを左右するなか、キャッシュ圧縮はモデル能力とは別の重要な競争軸になっている。
元記事: DeepSeek Cuts AI Agent Memory Cost 4x: New Architecture Fits More Sessions Per GPU
※この記事はTech Timesから提供を受けた記事を日本向けに翻訳・編集したものです。
スポンサードリンク
