GPUメトリクス
WhaTapサーバーモニタリングのGPUパフォーマンスメトリクスは、NVIDIA GPU環境においてGPUサーバー、個別GPU、GPU使用プロセス、GPU障害イベントの観点からパフォーマンスおよび状態情報を収集して提供します。GPU使用率、演算リソース活用度、メモリ使用量、電力、温度、クロック、PCIe/NVLink転送量、ECCエラー、パフォーマンス制限状態、Xidイベントなどを確認でき、GPUサーバー全体の活用水準の把握から個別GPUのボトルネック分析、プロセス単位の原因追跡、ドライバー・ハードウェアの異常イベント確認まで段階的に分析できます。一部の指標はPhysical GPUのみで収集され、MIG環境では収集対象と解釈基準が異なる場合があるため、GPU Typeと収集対象を併せて確認することをお勧めします。また、XidイベントはNVIDIAドライバーがシステムログに記録した障害/イベント履歴に基づいて収集します。原因分析の際は、イベント発生時刻、GPU識別情報、Xid Code、PID、Task Name、詳細メッセージを併せて確認してください。
GPUモニタリングを有効にするには、エージェント設定が必要です。詳細はGPU機能設定を参照してください。
GPUパフォーマンスメトリクスは分析の観点に応じて、サーバー全体のGPU集計、個別GPU詳細、GPU使用プロセス、GPU Xidイベント基準の4つのカテゴリで提供します。
-
infra_gpu
サーバーに搭載されたすべてのGPUのステータスを集計し、GPUサーバー全体の観点からパフォーマンスと状態を確認できるカテゴリです。GPU使用率、メモリ、電力、温度、クロック、PCIe/NVLink、ECC、Violation状態を平均・合計・最大値基準で提供し、GPUサーバー全体の活用水準とボトルネックの可能性を素早く確認できます。
-
infra_gpu_id
個別GPU単位のパフォーマンスと状態を提供するカテゴリです。GPU別の使用率、演算リソース活用度、メモリ、温度、電力、クロック、PCIe/NVLink、ECC、Violation状態を確認し、特定のGPUで発生するボトルネックや制約状態を分析できます。Physical GPUとMIGインスタンスによって収集可能な指標が異なる場合があるため、GPU Typeと収集対象を併せて確認する必要があります。
-
infra_gpu_process
GPUを使用するプロセス単位のリソース使用情報を提供するカテゴリです。PID、プロセス名、ユーザー、GPU UUIDとともにSM使用率、メモリコントローラー使用率、エンコーダー/デコーダー使用率、FBメモリ使用量などを確認し、どのプロセスがGPUリソースを使用しているかを追跡できます。ただし、一部のプロセス別GPU使用率指標はGPU全体の指標と測定基準が異なる場合があるため、個別プロセスの寄与度を判断する際はGPU全体の指標と合わせて解釈することをお勧めします。
-
infra_gpu_xid
NVIDIAドライバーが記録したGPU Xidイベント情報を提供するカテゴリです。
/var/log/messagesまたはシステムログに記録されたNVRM: Xidログを基に、Xid Code、GPU Index、PCI Bus ID、発生時刻、PID、Task Name、詳細メッセージを収集し、GPUドライバー、ハードウェア、PCIe、メモ リ、アプリケーションエラーなどのGPU異常イベントを追跡できます。すべてのXidイベントが直ちにハードウェア障害を意味するわけではないため、Xid Codeの意味、発生頻度、同時点のGPUパフォーマンス指標、プロセス情報、システムログを併せて確認して解釈することをお勧めします。
GPUメトリクス詳細
カテゴリ別の収集指標の詳細内容は次のとおりです。
infra_gpu
サーバーに搭載されたGPU全体を集計した使用状態を収集するカテゴリです。GPU使用率、メモリ使用量、電力、温度、クロック、PCIe/NVLink処理量、ECC、violation状態などをサーバー全体のGPU観点で平均、合計、最大値などに再構成して提供します。GPUサーバー全体の活用水準とボトルネック、制約状態を把握する際に使用します。
- DCP(Datacenter Profiling)指標の収集には、nvidia-dcgmサービス(またはnv-hostengineプロセス)が起動している必要があります。
- Agent 2.9.16以上のバージョンでnvidiav2.collector=trueを設定すると、接続可能なNVML、DCGM Libraryを通じてメトリクスデータを自動的に収集します。(nvidia-smiまたはdcgmiクエリは使用しません。)
- デフォルト収集周期:30s
| Field カテゴリフィールド名 | Title パフォーマンスサマリー/パフォーマンス詳細/メトリクスエクスプローラーの指標名 | Unit | Description | 備考 | メトリクス収集条件 | 最小サポートエージェントバージョン |
|---|---|---|---|---|---|---|
| name_50 | GPU Name | string | 該当GPUのモデル名を表す値です。ドライバーバージョンまたは収集経路によって表示文字列が若干異なる場合があります。 | 2.9.3 | ||
| model_family | GPU Model Family | string | ドライバーバージョン、ファームウェア、収集経路によって異なる表示となりうるGPUモデル名を、A100、H100、L40Sなどの代表的なファミリー名に正規化した値です。モデル別の集計、フィルタリング、比較分析を一貫して実行するための識別子として使用します。 | 2.9.7 | ||
| gpu_count | GPU Count | string | サーバーで認識されているPhysical GPUの数を表す値です。全GPU平均値、合計量、比率指標を解釈する際の基準となります。 | 2.9.3 | ||
| gpu_utilization | GPU Utilization | % | サーバー内の個別GPU活用率の平均値です。Physical GPU環境では一般的なGPU Util値を意味し、MIG環境では個別インスタンスのGR Engine Active値を代表GPU使用率として活用できます。サーバー全体のGPUの全般的な活用水準を示す指標です。 | 搭載Physical GPUのAVG値 | MIG有効環境では、nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.6 |
| enc_util_206 | Encoder Util | % | サーバー内の個別GPUのエンコーダー(Encoder)エンジン活用率の平均値です。動画エンコード作業がGPUでどの程度使用されているかを示します。値が高いほどNVENCファミリーエンジンの使用比率が高いことを意味します。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| dec_util_207 | Decoder Util | % | サーバー内の個別GPUのデコーダー(Decoder)エンジン活用率の平均値です。動画デコード作業がGPUでどの程度使用されているかを示します。値が高いほどNVDECファミリーエンジンの使用比率が高いことを意味します。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| gr_engine_active_1001 | GR Engine Active Util | % | サーバー内の個別GPUのGraphics/Compute Engine活性比率の平均値です。MIGインスタンス環境では、そのインスタンスのGPU使用率を代表的に解釈できる指標として活用します。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| sm_active_1002 | SM Active Util | % | サーバー内の個別GPUのSM(Streaming Multiprocessor)活性比率の平均値です。実際の演算処理に使用されたSMリソースの全般的な使用水準を示します。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| sm_occupancy_1003 | SM Occupancy | % | サーバー内の個別GPUのSM Occupancyの平均値です。アクティブワープがSMにどの程度充填されているかを示し、単純な活性率とは異なりSMリソース活用密度を表します。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| tensor_active_1004 | Tensor Core Util | % | サーバー内の個別GPUのTensor Core活性比率の平均値です。AI/ディープラーニング演算のようにTensor Coreを使用するワークロードの比率を把握する際に役立ちます。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| fp64_active_1006 | FP64 Compute Util | % | サーバー内の個別GPUのFP64演算活性比率の平均値です。倍精度(double precision)演算負荷水準を示します。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| fp32_active_1007 | FP32 Compute Util | % | サーバー内の個別GPUのFP32演算活性比率の平均値です。単精度(single precision)演算負荷水準を示します。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| fp16_active_1008 | FP16 Compute Util | % | サーバー内の個別GPUのFP16演算活性比率の平均値です。半精度(half precision)演算負荷水準を示し、AI推論/学習ワークロードで重要になる場合があります。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| memory_copy_util_204 | Memory Copy Util | % | サーバー内の個別GPUのメモリコピーエンジン活用率の平均値です。GPUメモリとGPU内部演算領域間のデータ移動、Host ↔ Deviceコピー、Device ↔ Deviceコピーなどのメモリコピーやデータ移動経路がどの程度使用されているかを示す指標です。値が高いほど、GPU演算自体よりデータ移動負荷が大きいか、メモリコピー作業がボトルネックになる可能性があります。この値はメモリ容量使用率ではなく、メモリコピー/転送エンジンの活動水準として解釈する必要があります。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| dram_active_1005 | DRAM Active Util | % | サーバー内の個別GPUのDRAM活性比率の平均値です。GPU DRAMメモリサブシステムがアクティブ状態だった比率を示します。GPUメモリ帯域幅がどの程度活発に使用されているかを示す指標で、メモリ読み取り/書き込み要求が多いか、メモリアクセス中心のワークロードで高くなる傾向があります。高い値が継続する場合、演算性能よりGPUメモリ帯域幅がボトルネックになっている状況かもしれません。この値はFB Memory Usedのようなメモリ使用容量ではなく、GPU DRAMが実際にどの程度バジーに動作したかを示す活性度指標です。 | 搭載Physical GPUのAVG値 | nvidia-dcgm serviceまたはnv-hostengineプロセスの起動が必須 | 2.9.3 |
| fb_total_250 | FB Total Memory | MiB | サーバー内の個別GPUのFB(Frame Buffer)全体メモリ容量を合計した値です。サーバー全体のGPUメモリ総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| fb_free_251 | FB Free Memory | MiB | サーバー内の個別GPUのFB空きメモリ容量を合計した値です。サーバー全体で利用可能なGPUメモリ総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| fb_used_252 | FB Used Memory | MiB | サーバー内の個別GPUのFB使用メモリ容量を合計した値です。サーバー全体のGPUメモ リ使用総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| fb_resv_253 | FB Reserved Memory | MiB | サーバー内の個別GPUのFB予約メモリ容量を合計した値です。システム/ドライバー/ファームウェアなどによって予約されたGPUメモリ総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| fb_USDP_254 | FB Memory Usage | % | サーバー全体のFBメモリ使用率を示す指標です。個別GPUのメモリ使用率を単純平均せず、FB Used合計 / FB Total合計 * 100で再計算した値です。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| bar1_total_90 | BAR1 Total Memory | MiB | サーバー内の個別GPUのBAR1全体容量を合計した値です。BAR1はホストがGPUメモリにアクセスするために使用するメモリマッピング領域で、サーバー全体のBAR1総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| bar1_used_92 | BAR1 Used Memory | MiB | サーバー内の個別GPUのBAR1使用量を合計した値です。サーバー全体で現在使用中のBAR1メモリ総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| bar1_free_93 | BAR1 Free Memory | MiB | サーバー内の個別GPUのBAR1空き容量を合計した値です。サーバー全体で利用可能なBAR1総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| bar1_usdp | BAR1 Memory Usage | % | サーバー全体のBAR1使用率を示す指標です。個別GPUの比率を単純平均せず、BAR1 Used合計 / BAR1 Total合計 * 100で再計算した値です。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| ecc_sbe_aggregate_total_312 | ECC SBE Total | count | サーバー内の個別GPUのECC Single Bit Error累積カウンターを合計した値です。サーバー全体で累積された単一ビットECCエラーの総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| ecc_dbe_aggregate_total_313 | ECC DBE Total | count | サーバー内の個別GPUのECC Double Bit Error累積カウンターを合計した値です。サーバー全体で累積された二重ビットECCエラーの総量を示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| ecc_sbe_aggregate_delta_312 | ECC SBE Delta | count | 収集区間中にサーバー内の個別GPUのECC Single Bit Error増加分を合計した値です。直近の区間で新たに発生した単一ビットECCエラー量を示します。 | 搭載Physical GPUのSUM値 | 2.9.16 | |
| ecc_dbe_aggregate_delta_313 | ECC DBE Delta | count | 収集区間中にサーバー内の個別GPUのECC Double Bit Error増加分を合計した値です。直近の区間で新たに発生した二重ビットECCエラー量を示します。 | 搭載Physical GPUのSUM値 | 2.9.16 | |
| gpu_temp_150 | GPU Temperature | °C | サーバー内の個別GPU温度の最大値を示す指標です。サーバー全体のGPUの中で最も高い温度を代表し、特定GPUの過熱の有無を素早く識別するために使用します。 | 搭載Physical GPUのMAX値 | 2.9.10 | |
| memTemp_140 | GPU Memory Temperature | °C | サーバー内の個別GPUメモリ温度の最大値を示す指標です。一般的にHBMまたはGDDRメモリ基準の温度で、メモリの発熱状態や冷却異常の有無を確認する際に使用します。メモリ集約型ワークロードではGPUコア温度より先に上昇することがあるため、合わせて確認することをお勧めします。 | 搭載Physical GPUのMAX値 | 2.9.16 | |
| power_usage_155 | Power Usage | watt | サーバー内の個別GPUの電力使用量を合計した値です。サーバー全体のGPUが消費している総電力をワット(W)単位で示します。 | 搭載Physical GPUのSUM値 | 2.9.3 | |
| energy_cumulative_daily_kwh | Energy Cumulative | kWh | 当日00時を基準に累積されたサーバー全体GPUのエネルギー使用量を示す指標です。NVIDIAドライバー/DCGMなどを通じて収集したpowerUsage値を収集周期単位で積算して計算した参考用推定値で、別途の電力計測器で測定した正確な電力量とは差異がある場合があります。GPU別の電力使用推移と日次使用パターンを参考にする用途で活用します。 | 搭載Physical GPUのSUM値 | 2.9.16 | |
| fan_speed_191 | Fan Speed | % | サーバー内の個別GPUのファン速度の平均値です。ファンが存在するGPUモデルで冷却装置の動作水準を示します。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| sm_clock_100 | SM Clock | MHz | サーバー内の個別GPUのSMクロックの平均値です。演算ユニットが動作中の平均コアクロック水準を示します。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| memory_clock_101 | Memory Clock | MHz | サーバー内の個別GPUのメモリクロックの平均値です。GPUメモリの動作速度水準を示します。 | 搭載Physical GPUのAVG値 | 2.9.3 | |
| video_clock_102 | Video Clock | MHz | サーバー内の個別GPUのビデオエンジンクロックの平均値です。映像処理関連エンジンの動作速度水準を示します。 |