{"product_id":"nvidia-b200-specs-b200-sxm6-hmb3e-192gb-blackwell-gpu-for-ai-2026-video-card","title":"NVIDIA B200 Specs B200 SXM6 HMB3E 192GB Blackwell GPU for AI (2026) Video Card","description":"\u003cp\u003eNVIDIA B200 Specs B200 SXM6 HMB3E 192GB Blackwell GPU for AI (2026) Video Card\u003c\/p\u003e\n\u003ch2 class=\"text-3xl font-semibold mt-12 mb-6\"\u003eB200 Key Specifications\u003c\/h2\u003e\n\u003cdiv class=\"overflow-x-auto my-8\"\u003e\n\u003ctable class=\"min-w-full border-collapse\"\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eSpecification\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eB200\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eH200 (for reference)\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eH100 (for reference)\u003c\/th\u003e\n\u003c\/tr\u003e\n\u003c\/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eArchitecture\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eBlackwell (GB200)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eHopper\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eHopper\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eTransistors\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e208 billion\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e80 billion\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e80 billion\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eMemory\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e192GB HBM3e\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e141GB HBM3e\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e80GB HBM3\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eMemory Bandwidth\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eUp to 8 TB\/s\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e4.8 TB\/s\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e3.35 TB\/s\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eFP4 Tensor Core\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eYes (native)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eNo\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eNo\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eFP8 Tensor Core\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eYes (2nd gen)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eYes\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eYes\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eTransformer Engine\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e2nd generation\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e1st generation\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e1st generation\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eNVLink\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e5th gen (1.8 TB\/s)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e4th gen (900 GB\/s)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e4th gen (900 GB\/s)\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eTDP\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eUp to 1000W\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eUp to 700W\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eUp to 700W\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eManufacturing\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eTSMC 4NP\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eTSMC 4N\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eTSMC 4N\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003c\/tbody\u003e\n\u003c\/table\u003e\n\u003c\/div\u003e\n\u003ch2 class=\"text-3xl font-semibold mt-12 mb-6\"\u003eArchitecture: What Blackwell Changes\u003c\/h2\u003e\n\u003ch3 class=\"text-xl font-semibold mt-4 mb-2\"\u003eSecond-Generation Transformer Engine\u003c\/h3\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eThe biggest improvement for AI workloads is the 2nd-gen Transformer Engine with native FP4 support:\u003c\/p\u003e\n\u003cul class=\"text-lg list-disc pl-12\"\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eFP4 precision\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003e— 4-bit floating point for inference. Halves memory usage vs FP8, enabling larger models or higher batch sizes on a single GPU\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eDynamic precision management\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003e— automatically switches between FP4, FP8, and FP16 based on what each layer needs\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eHigher throughput\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003e— combined with architectural improvements, NVIDIA claims up to 4x inference performance vs H100\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eFP4 is particularly impactful for LLM inference. A model that needs 80GB in FP8 on H100 would need only ~40GB in FP4 on B200, leaving 150GB+ free for KV cache and batching.\u003c\/p\u003e\n\u003ch3 class=\"text-xl font-semibold mt-4 mb-2\"\u003e192GB HBM3e Memory\u003c\/h3\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eThe memory jump is massive:\u003c\/p\u003e\n\u003cdiv class=\"overflow-x-auto my-8\"\u003e\n\u003ctable class=\"min-w-full border-collapse\"\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eGPU\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eMemory\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eMemory Bandwidth\u003c\/th\u003e\n\u003c\/tr\u003e\n\u003c\/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eH100\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e80GB HBM3\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e3.35 TB\/s\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eH200\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e141GB HBM3e\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e4.8 TB\/s\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eB200\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e192GB HBM3e\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eUp to 8 TB\/s\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003c\/tbody\u003e\n\u003c\/table\u003e\n\u003c\/div\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003e192GB means:\u003c\/p\u003e\n\u003cul class=\"text-lg list-disc pl-12\"\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eLlama 70B in FP16\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003efits on a single GPU (140GB) with 52GB to spare for KV cache\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eLlama 70B in FP8\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003eneeds only ~70GB, leaving 122GB for massive batch sizes\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eLlama 405B in FP4\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003ecould potentially fit on 2 B200s\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eMultiple models\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003eserved simultaneously from a single GPU\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003ch3 class=\"text-xl font-semibold mt-4 mb-2\"\u003eNVLink 5th Generation\u003c\/h3\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eNVLink bandwidth doubles from 900 GB\/s (H100\/H200) to 1.8 TB\/s per GPU. For multi-GPU training, this means:\u003c\/p\u003e\n\u003cul class=\"text-lg list-disc pl-12\"\u003e\n\u003cli class=\"my-1\"\u003eFaster gradient synchronization during distributed training\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003eMore efficient tensor parallelism for large model inference\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003eBetter scaling efficiency when using 4-8 GPUs per node\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003ch3 class=\"text-xl font-semibold mt-4 mb-2\"\u003eGB200 and NVL72\u003c\/h3\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eNVIDIA is also shipping the B200 in pre-configured rack-scale systems:\u003c\/p\u003e\n\u003cul class=\"text-lg list-disc pl-12\"\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eGB200\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003e— a compute module with 2 B200 GPUs + 1 Grace CPU, connected via NVLink\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e\n\u003cstrong\u003eGB200 NVL72\u003c\/strong\u003e\u003cspan\u003e \u003c\/span\u003e— a full rack with 36 Grace CPUs and 72 B200 GPUs interconnected via NVLink, delivering 720 petaFLOPS of FP4 compute\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eThese are designed for large-scale training and inference at the datacenter level.\u003c\/p\u003e\n\u003ch2 class=\"text-3xl font-semibold mt-12 mb-6\"\u003eB200 vs H100 vs H200\u003c\/h2\u003e\n\u003ch3 class=\"text-xl font-semibold mt-4 mb-2\"\u003eFor LLM Inference\u003c\/h3\u003e\n\u003cdiv class=\"overflow-x-auto my-8\"\u003e\n\u003ctable class=\"min-w-full border-collapse\"\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eMetric\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eB200\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eH200\u003c\/th\u003e\n\u003cth class=\"px-4 py-2 text-left font-semibold\"\u003eH100\u003c\/th\u003e\n\u003c\/tr\u003e\n\u003c\/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eLlama 70B (FP8) tokens\/sec\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e~4x H100*\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e~1.9x H100\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e1x (baseline)\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eMemory for Llama 70B FP8\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e70GB (122GB free)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e70GB (71GB free)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e70GB (10GB free)\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eMemory for Llama 70B FP4\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003e~35GB (157GB free)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eN\/A (no FP4)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eN\/A (no FP4)\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003ctr\u003e\n\u003ctd class=\"px-4 py-2\"\u003eMax batch size (70B FP8)\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eVery large\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eModerate\u003c\/td\u003e\n\u003ctd class=\"px-4 py-2\"\u003eSmall\u003c\/td\u003e\n\u003c\/tr\u003e\n\u003c\/tbody\u003e\n\u003c\/table\u003e\n\u003c\/div\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003e*NVIDIA published claims. Real-world performance will vary by implementation and workload.\u003c\/p\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eThe B200's combination of more memory, higher bandwidth, and FP4 support could make single-GPU serving of 70B models practical at scale — something that's tight on H100 and comfortable but not optimal on H200.\u003c\/p\u003e\n\u003ch3 class=\"text-xl font-semibold mt-4 mb-2\"\u003eFor Training\u003c\/h3\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eNVIDIA claims up to 4x training performance on GPT-class models compared to H100, primarily from:\u003c\/p\u003e\n\u003cul class=\"text-lg list-disc pl-12\"\u003e\n\u003cli class=\"my-1\"\u003eHigher Tensor Core throughput\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003eFP8 training improvements (2nd-gen Transformer Engine)\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003e2x NVLink bandwidth for better multi-GPU scaling\u003c\/li\u003e\n\u003cli class=\"my-1\"\u003eMore memory reducing the need for memory optimization techniques\u003c\/li\u003e\n\u003c\/ul\u003e\n\u003cp class=\"my-6 text-lg leading-relaxed\"\u003eFor large model training, the B200 could reduce training time (and cost) by 3-4x compared to H100, assuming the software stack fully utilizes the new hardware features.\u003c\/p\u003e","brand":"Neobitti Inc. In the field of artificial intelligence","offers":[{"title":"Default Title","offer_id":48952407261409,"sku":null,"price":89999.0,"currency_code":"USD","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/0833\/6654\/3585\/files\/B200_c3851d04-b413-4993-b640-3d91fc5a5e62.png?v=1787151738","url":"https:\/\/kingm.com\/fr\/products\/nvidia-b200-specs-b200-sxm6-hmb3e-192gb-blackwell-gpu-for-ai-2026-video-card","provider":"Neobitti Inc. In the field of artificial intelligence","version":"1.0","type":"link"}