# Environment manifest (2026-08-25T16:16:53Z)

## Host
hostname: gpusystem
kernel: Linux 6.8.0-100-generic
os: Ubuntu 24.04.4 LTS
cpu: Intel(R) Xeon(R) 6530P
cpu_cores: 128
ram_gb: 503

## GPU
index, name, memory.total [MiB], driver_version, compute_cap
0, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
1, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
2, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
3, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
4, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
5, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
6, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
7, NVIDIA RTX PRO 6000 Blackwell Server Edition, 97887 MiB, 590.48.01, 12.0
cuda_toolkit: 13.1

## Model
model: Qwen/Qwen3-8B (BF16) and Qwen/Qwen3-8B-FP8 (official FP8 checkpoint)
models--Qwen--Qwen3-8B revision: b968826d9c46dd6066d109eabc6255188de91218
models--Qwen--Qwen3-8B-FP8 revision: 220b46e3b2180893580a4454f21f22d3ebb187d3

## Stack versions
vllm: 0.27.1
vllm torch: 2.13.0+cu130
sglang: 0.5.9
sglang torch: 2.9.1+cu128
llama.cpp commit: 1729ed5371cd1ac6f6d6f3226f8803b080042839
llama.cpp build: GGML_CUDA=ON CMAKE_CUDA_ARCHITECTURES=120

## Bench client
python: Python 3.12.3
client: bench/client.py (httpx streaming, temperature 0, stream_options.include_usage)
