GPU 상세
GPU 상세 페이지에서는 특정 서버의 GPU 사용 현황을 시계열 차트로 모니터링하고, GPU를 점유한 프로세스를 실시간으로 확인할 수 있습니다. 물리 GPU(Physical)와 MIG(Multi-Instance GPU) 인스턴스 정보를 한 화면에서 함께 볼 수 있어, 어떤 워크로드가 어떤 GPU 자원을 얼마나 사용하는지 빠르게 파악할 수 있습니다.
지원 에이전트 버전
Linux에서만 지원되며, 에이전트 2.9.16 이상 버전을 권고합니다.
기본 화면
화면 상단 옵션 바에서 조회 시간 범위와 서버를 선택할 수 있으며, 선택 서버의 인라인 정보(IP, OS Type, CPU Cores, Memory Total, OS Version)와 기능 활성화 안내 버튼이 함께 표시됩니다. 옵션 바 하단에서 GPU를 선택해 화면에 표시할 대상을 필터링할 수 있습니다.
각 항목의 사용 방법은 다음과 같습니다.
- 시간 범위: 조회할 시간 구간을 선택합니다. 좌우 화살표 버튼으로 구간을 이동할 수 있습니다.
- 서버 선택: 모니터링할 서버를 드롭다운에서 선택합니다. 호스트명과 IP가 함께 표시됩니다.
- GPU 선택: 화면에 표시할 GPU를 필터링합니다. 선택 박스를 클릭하면 GPU 선택 모달이 열립니다. 기본값은
* (Select All)로, 서버에 연결된 모든 Physical GPU와 MIG 인스턴스가 선택됩니다. - 기능 활성화 안내: 클릭하면 GPU 모니터링 지원 환경과 수집 가능한 메트릭 목록을 안내하는 패널이 열립니다.
GPU 인덱스는 차트 범례와 프로세스 표 전반에서 다음 형식으로 표기됩니다.
- Physical GPU:
0,1,4등 정수 - MIG 인스턴스:
7/1/0,6/4/0,5/8/0등 슬래시 표기 (Physical/GI/CI)
GPU 메트릭 차트
화면 왼쪽 영역에 선택한 서버의 GPU 사용 현황이 다섯 가지 시계열 차트 카드로 표시됩니다. 라인 차트 2개(Physical GPU + MIG 인스턴스 모두)와 스택/라인 전환 차트 3개(Physical GPU만)로 구성됩니다.
카드 우측 상단의 토글 버튼으로 라인 모드로 전환할 수 있습니다.
| 차트 | 유형 | 설명 |
|---|---|---|
| GPU Utilization (%) | 라인 | GPU 코어 사용률 |
| FB Memory Used (%) | 라인 | GPU 프레임 버퍼 메모리 사용률 |
| Power Usage | 스택/라인 | GPU 전력 소비량 |
| PCIe TX+RX | 스택/라인 | PCIe 송수신 대역폭 |
| NVLink TX+RX | 스택/라인 | NVLink 송수신 대역폭 |
각 차트 카드 오른쪽 상단의 아이콘으로 데이터를 CSV 파일로 다운로드하거나, 차트를 이미지로 저장할 수 있습니다. 확대 아이콘을 클릭하면 해당 메트릭 범주의 차트 상세 드로워가 열립니다.
각 메트릭의 상세 정의는 GPU 메트릭 문서를 참고하 시기 바랍니다.
차트 상세(Drawer)
각 차트 카드 우측 상단의 확대 아이콘을 클릭하면 해당 메트릭 범주의 세부 지표를 모아 볼 수 있는 드로워가 오른쪽에서 열립니다. 드로워 안에서 시간 범위와 GPU 선택을 메인 화면과 독립적으로 변경할 수 있습니다.
드로워 하단의 해석 가이드 섹션에서는 각 메트릭의 의미와 모니터링 포인트를 확인할 수 있습니다.
| 드로워 | 포함 메트릭 |
|---|---|
| GPU Utilization 상세 | GPU 코어 활용률, SM Active/Occupancy, FP·Tensor·DRAM 활성도 등 |
| GPU Memory 상세 | FB Total/Used/Free/Reserved, FB Used (%), 메모리 복사 활용도 등 |
| 전력/온도 상세 | Power Limit/Usage, 전력 위반율, GPU 온도, 온도 위반율 등 |
| PCIe 트래픽 상세 | PCIe TX+RX, PCIe TX, PCIe RX, NVLink TX+RX 등 |
| NVLink 트래픽 상세 | NVLink TX+RX, NVLink TX, NVLink RX, PCIe TX+RX 등 |
GPU 프로세스 표
화면 오른쪽 상단의 GPU 프로세스 표는 선택한 서버에서 GPU를 점유한 프로세스 목록을 표시합니다. 각 프로세스의 GPU·CPU·메모리 사용 추이를 한눈에 확인할 수 있고, 표 우측 상단의 검색창에서 프로세스명으로 필터링할 수 있습니다.
각 메트릭 셀에 조회 구간 동안의 시계열 미니 차트와 함께 최댓값(Max)이 표시됩니다.
| 컬럼 | 설명 |
|---|---|
| 프로세스 정보 | 프로세스명, 실행 명령어, PID xxxx · 계정 3줄 |
| GPU Utilization (%) | 해당 프로세스가 바인딩된 GPU 장치 전체의 GPU Utilization. 프로세스별 직접 측정값이 아니라 연결된 GPU의 전체 사용률을 함께 표시하므로, 동일 GPU를 사용하는 여러 프로세스에는 동일하거나 유사한 값이 표시될 수 있음. 미니 차트 + Max N% |
| FB Used (MiB) | 프로세스가 점유한 GPU 프레임 버퍼 메모리 크기. 미니 차트 + Max N MiB |
| CPU (%) | 프로세스의 CPU 사용률. 미니 차트 + Max N% |
| RSS (byte) | 프로세스의 호스트 시스템 메모리 사용량(Resident Set Size). 미니 차트 + Max N GiB |
| Process IO Total (bytes/s) | 프로세스의 I/O 대역폭. 미니 차트 + Max N KiB/s. 수집 데이터가 없으면 - 표시 |
| GPU Index | 프로세스가 점유한 GPU 인덱스. Physical은 정수(0, 1), MIG는 슬래시 표기(5/8/0) |
VLLM::Worker_TP0, VLLM::EngineCore, python3 app.py 등은 사용자 환경에서 실제 실행 중인 프로세스 이름입니다. 표에는 GPU를 점유한 모든 프로세스가 표시됩니다.
서버 정보 · GPU 인벤토리 패널
화면 오른쪽 하단 패널에서 서버 정보 또는 GPU 인벤토리 탭을 선택해 현재 조회 중인 서버의 상세 정보를 확인할 수 있습니다. GPU 프로세스 표와 이 패널 사이의 드래그 핸들로 위아래 비율을 조절할 수 있습니다.
서버 정보
| 항목 | 설명 |
|---|---|
| Host name (oid) | 호스트명과 OID |
| OS | 운영 체제 유형 및 버전 |
| GPU model | GPU 모델명 (예: A100-40GB) |
| GPU count | 서버에 연결된 GPU 수 (Physical N / MIG M 형태) |
| Server memory | 서버 전체 메모리 |
| Agent | 설치된 에이전트 버전 |
GPU 인벤토리
서버에 연결된 Physical GPU와 MIG 인스턴스 목록을 다음 컬럼으로 확인할 수 있습니다. 탭 우측의 상세보기 버튼을 클릭하면 모든 컬럼을 보여주는 드로워가 열립니다.
현재 시점의 인벤토리만 조회할 수 있습니다. 이전 시점 조회는 GPU 인벤토리 메뉴에서 가능합니다.
| 컬럼 | 설명 |
|---|---|
| GPU Index | Physical은 정수(0, 1), MIG는 슬래시 표기(5/7/0, 5/8/0) |
| GPU Type | Physical 또는 MIG |
| Model Name | 정식 GPU 모델명 (예: NVIDIA A100-SXM4-40GB) |
| Model Family | GPU 모델 패밀리 (예: A100) |
| GPU Memory Size (MiB) | GPU 메모리 크기. Physical은 전체 메모리, MIG는 분할된 단편 크기 |
인벤토리 메뉴 자체와 활용 방법은 GPU 인벤토리 페이지를 참조하세요.