๐ŸŽฎ Card Catalog

per-GPU quant support (columns) & software quirks
CardArchVRAMMem BWNVFP4FP8INT8INT4BF16SoftwareQuirks & notes
RTX PRO 6000Blackwell~96 GB~1.8 TB/sโœ“โœ“โœ“โœ“โœ“CUDA 12.8+ ยท LightX2V / vLLMOnly tier that runs NVFP4. nvidia-smi --gpu-reset = Not Supported; WPR2 wedge clears only on HOST power-cycle. โ€” vastnode002
RTX PRO 5000Blackwell48 GB~1.3 TB/s (TBD)โœ“โœ“โœ“โœ“โœ“CUDA ยท vLLM 0.22.1 ยท on VastVast clones ONE defjob to BOTH cards โ€” no per-card unique jobs (caused the outage). โ€” vastnode003
RTX A5000Ampere24 GB768 GB/sโœ—โœ—โœ“โœ“โœ“driver 580.159.03 ยท CUDA 13.0 ยท diffusers / vLLMNo FP8 โ†’ use AWQ/bnb. Most mature stack: every kernel incl custom-CUDA TTS (NeMo). 24 GB tight โ†’ Omni capped at image:2. โ€” r730a
RTX 4090Ada24 GB~1008 GB/sโœ—โœ“โœ“โœ“โœ“CUDA ยท vLLM / transformers / diffusersFleet workhorse. Native FP8 (Ada), no NVFP4 (Blackwell-only). Highest bandwidth of the 24 GB tier. 24 GB caps model size; runs on Vast as per-GPU defjobs (YuE etc.). โ€” vastnode001 / infertha ร—2 / am4-4u-newintown
RTX 4070S TiAda16 GB~672 GB/sโœ—โœ“โœ“โœ“โœ“CUDA ยท transformersNative FP8 (Ada); no NVFP4 (Blackwell-only). 16 GB caps model size (โ‰ˆโ‰ค13B). โ€” 3930a / 3930b
RX 7900 XTXRDNA324 GB960 GB/sโœ—โœ—โœ“โœ“โœ“ROCm ยท llama.cpp-HIP ยท IPEXHighest bandwidth in fleet. No FP8/FP4. bnb spotty; GGUF best via ROCm/HIP, Vulkan fallback. โ€” vm905
Arc Pro B70Battlemage Xe232 GB608 GB/sโœ—โœ—โœ“โœ“โœ“XPU ยท vLLM-XPU / IPEX-LLM / llm-scalerCheapest 32 GB ($949). int8 367 TOPS / int4 WOQ. GGUF โ†’ use Vulkan (SYCL near-CPU-slow). MoE/prefill slow; W8A8 unverified. NOT OWNED โ€” evaluating

hardware-native   emulated/partial   not in silicon.
NVFP4 is Blackwell-only; FP8 needs Ada/Blackwell; Ampere/RDNA3/Battlemage top out at INT8. What's actually deployed per card is on Services.