LLMトークン推移分析
トークン推移はLLM APIのトークン使用パターンと処理効率を時系列ベースで分析するメニューです。ダッシュボードがリアルタイム状態のモニタリングに焦点を当てているのに対し、このページは区間別推移比較とモデル/アプリケーション間の詳細分析に活用されます。
上部オプションバーで時間範囲、フィルター、検索条件を設定してウィジェットデータを照会します。チャートドラッグで区間を絞り込んだり、チャート/ボックスプロットのクリックでプロンプトログページに移動できます。

トークン使用量
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート(Input、Output 2つのシリーズ) |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示 |
時間帯別のInput(入力)トークン数とOutput(出力)トークン数の推移を表示します。Inputトークンはプロンプトに含まれるトークン、Outputトークンはモデルが生成した応答トークンです。
- 特定の時間帯にトークン使用量が急増した場合、トラフィック変化、プロンプト変更、または異常リクエストの流入を確認してください。
- InputとOutputの比率変化を通じて、ワークロード特性(入力中心 vs 生成中心)の変化を把握できます。
- 個別表示で、どのモデルやエージェントにトークン消費が集中しているかを確認できます。
I/O比率推移
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート(%、エリア塗りつぶし) |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示 |
I/O比率は全体トークン (Input + Output)のうちOutputトークンが占める割合(%)です。50%基準線(点線)が合わせて表示されます。
- 50%以上: 応答生成の比率が高いワークロードです。要約、コード生成など出力の長いタスクが多い状態です。
- 50%以下: 入力比率が高いワークロードです。分類、エンベディング、RAG検索などプロンプトの長いタスクが多い状態です。
- 比率が急変した場合、ワークロードパターンやプロンプト構造が変更された可能性があるため確認してください。
I/O比率 = output_tokens合計 / (input_tokens合計 + output_tokens合計) x 100
TTFTパーセンタイル
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート(p50、p75、p95、p99 4つのシリーズ) |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示、パーセンタイル選択 |
TTFT(Time To First Token)のパーセンタイル推移を表示します。トークン使用量が急増する区間でTTFTも合わせて上昇する場合、トークン規模の増加が初期応答遅延に影響を与えていることを意味します。
- p50は安定しているのにp99だけ急騰する場合、断続的にキュー待ちやプロバイダ遅延が発生しているシグナルです。
- 異常区間を発見した場合、TTFT分布比較でどのモデルが原因かを確認できます。
TPOTパーセンタイル
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート(p50、p75、p95、p99 4つのシリーズ) |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示、パーセンタイル選択 |
TPOT(Time Per Output Token)のパーセンタイル推移を表示します。TTFTパーセンタイルと合わせて確認すると、「初回トークンも遅く生成も遅い区間」と「初回トークンは速いが生成が遅い区間」を区別できます。
- p99が急騰する場合、断続的にトークン生成が停止したり大幅に遅くなるリクエストが存在することを意味します。
- 異常区間を発見した場合、TPOT分布比較でどのモデルが原因かを確認できます。
TTFT分布比較
| Property | Value |
|---|---|
| チャートタイプ | ボックスプロット(x軸: モデル) |
| フィルター | タグフィルター(常時表示) |
| アクション | 詳細表示 |
タグ基準(モデルなど)別にTTFTの分布をボックスプロットで比較します。ボックス領域はp25~p75(中間50%範囲)、中央線は中央値、ウィスカーは最小値~最大値を表します。
- 中央値が低くボックスが狭いモデルが、最も安定して速い初期応答を提供します。
- ウィスカーが長く伸びているモデルは、断続的に極端な初期遅延が発生します。
- モデルをクリックすると、該当モデルのプロンプトログに移動します。
TPOT分布比較
| Property | Value |
|---|---|
| チャートタイプ | ボックスプロット(x軸: モデル) |
| フィルター | タグフィルター(常時表示) |
| アクション | 詳細表示 |
タグ基準(モデルなど)別にTPOTの分布をボックスプロットで比較します。
- 中央値が低くボックスが狭いモデルが、最も安定したストリーミング性能を提供します。
- ウィスカーが長く伸びているモデルは、断続的にトークン生成が大幅に遅くなる現象が発生します。
出力トークンスループット
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示 |
1秒あたりに生成される出力トークン数(Tokens Per Second)を表すスループット指標です。
- スループットが低下する区間は、モデル応答のボトルネックまたはRate Limitの影響を確認してください。
- トークン使用量と合わせて確認すると、「トークンは多く使用しているが処理速度が遅い区間」を識別できます。
- 個別表示でモデル別のスループットを比較できます。
キャッシュヒット率推移
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート(%、エリア塗りつぶし) |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示 |
全入力トークンのうちキャッシュから取得したトークンの割合(%)を時間帯別に表示します。
- ヒット率が高いほどプロンプトキャッシングが効果的に機能しており、コスト削減効果が大きくなります。
- ヒット率が急に低下した場合、プロンプト内容の変更、キャッシュTTLの期限切れ、または新しいタイプのリクエスト流入を確認してください。
- 個別表示でモデル別のキャッシュ効率を比較し、どのモデルでキャッシングが最も効果的かを確認できます。
キャッシュヒット率 = (cached_tokens合計 / input_tokens合計) x 100
リクエスト当たり平均トークン
| Property | Value |
|---|---|
| チャートタイプ | ラインチャート(Input、Output 2つのシリーズ、エリア塗りつぶし) |
| フィルター | タグフィルター |
| アクション | 個別表示、マージ表示、詳細表示 |
リクエスト1件あたりの平均Input/Outputトークン数の時間帯別推移を表示します。
- リクエスト当たりInputトークンが急増した場合、プロンプト長が長くなったか、長いコンテキストが含まれ始めた可能性があります。
- リクエスト当たりOutputトークンが急増した場合、応答長が伸びたことを意味し、コスト増加に直接影響します。
- トークン使用量が増加する際にこのウィジェットの数値も合わせて増加する場合はリクエスト当たりのサイズが大きくなったことを意味し、トークン使用量だけ増加する場合は単純にリクエスト数が増えたことを意味します。
トークン分析
| Property | Value |
|---|---|
| チャートタイプ | テーブル |
| フィルター | Agent / Model / Provider タブ切り替え |
| アクション | 詳細表示、CSVダウンロード、カラム設定 |
タグ基準(Agent、Model、Provider)別にトークン使用量、キャッシュ、コストの主要指標をテーブルで整理します。
| Column | Description |
|---|---|
Name | タグ値(アプリケーション名、モデル名、プロバイダ名) |
Requests | リクエスト件数 |
Total Input | 入力トークン総量 |
Total Output | 出力トークン総量 |
Total Tokens | 全体トークン総量 |
I/O Ratio (%) | 出力トークン比率 |
Cached Tokens | キャッシュトークン総量 |
Cache Hit (%) | キャッシュヒット率 |
Cached Cost ($) | キャッシュトークンコスト |
Input Cost ($) | 入力コスト |
Output Cost ($) | 出力コスト |
Total Cost ($) | 全体コスト |
Total Tokensが高い項目は全体コストで最も大きな割合を占めるため、最適化の優先対象です。I/O Ratioが高い項目は出力中心のワークロードで、Outputトークン単価の影響を大きく受けます。Cache Hitが低い項目はキャッシング戦略を確認し、コスト削減の余地を検討してください。Total Costを基準にソートすると、コスト最適化の優先順位を素早く把握できます。- 右上のダウンロードボタンで現在のデータをCSVにエクスポートできます。
- カラム設定で表示するカラムを選択できます。
参考
ダッシュボードとの違い
| 項目 | LLMダッシュボード | トークン推移 |
|---|---|---|
| 時間モード | リアルタイム(Live)+ 過去時点 | 過去区間(Range)専用 |
| 主な目的 | リアルタイム状態モニタリング | 区間別推移分析 |
| フィルター | エージェント選択 | 複合条件フィルター(Agent、Model、Provider、Operation、URL) |
| プロンプトログ連動 | なし | チャートクリック時にプロンプトログへ移動 |
| データエクスポート | なし | CSVダウンロード対応 |