Mua GPU NVIDIA tại MillionMiner, từ các dòng Consumer Blackwell đến các dòng dành cho trung tâm dữ liệu, dành cho AI và công việc chuyên nghiệp. Các card có sẵn gồm RTX 5090 32GB và RTX 4090 24GB dạng blower, RTX PRO 6000 Blackwell 96GB, cùng các GPU Tensor Core A100 và H100. Mới 100% có bảo hành của nhà sản xuất, trừ khi có ghi chú khác trong danh sách.
Mỗi GPU được vận chuyển miễn phí toàn cầu DDP, do đó giá tại bước thanh toán là tổng chi phí cuối cùng đã bao gồm phí vận chuyển. Đối với các bộ build nhiều card, xem các máy chủ GPU đã lắp ráp sẵn của chúng tôi hoặc có thể yêu cầu các card được triển khai vào trung tâm dữ liệu tại Mỹ, đi kèm điện và làm mát đã được xử lý. Mua sắm toàn bộ dòng GPU dưới đây.
Hàng tồn kho đã được xác minh
Mọi GPU đều được kiểm tra và kiểm thử trước khi vận chuyển
Gửi hàng nhanh
Gửi trong vòng 1–3 ngày làm việc
Chấp nhận Crypto
Thanh toán bằng BTC, ETH, USDT & nhiều hơn nữa
Hỗ trợ chuyên nghiệp
Chuyên gia về hạ tầng AI & GPU sẵn sàng hỗ trợ
Cách mạng AI được thúc đẩy bởi một bộ chip silicon cực kỳ nhỏ gọn. Dòng GPU trung tâm dữ liệu của NVIDIA, từ H100 và H200 Tensor Core GPU đến RTX PRO 6000 Blackwell và RTX 5090, là nền tảng tính toán trên đó các mô hình ngôn ngữ lớn, mô hình khuếch tán, mô phỏng khoa học và các pipeline suy luận tần suất cao chạy. Chúng tôi cung cấp đầy đủ dòng sản phẩm NVIDIA chuyên nghiệp — accelerators trung tâm dữ liệu, GPU cho máy trạm và card hiển thị chuyên nghiệp — dành cho các khách hàng doanh nghiệp, phòng nghiên cứu, startup AI và nhà vận hành hạ tầng đám mây.
Băng thông bộ nhớ H200
4.8 TB/s
HBM3e @ dung lượng 141 GB
Hiệu suất AI H100
3.9 PFLOPS
Các thao tác tensor rời rạc FP8
RTX PRO 6000 VRAM
96 GB
GDDR7 ECC — Kiến trúc Blackwell
VRAM của RTX 5090
32 GB GDDR7
Blackwell GB202 — 3352 GB/s BW
80 GB HBM2e
Xép chỉnh của AI doanh nghiệp đảm nhiệm đáp ứng các yêu cầu đáo tạo. 3,35 TFLOPS FP64, NVLink 900 GB/s. Phiên bản SXM được ưu tiên cho các mạng lưới NVSwitch đa GPU trong hệ thống DGX H100.
141 GB HBM3e
Người kế nhiệm H100. Cùng loại chip GPU Hopper nhưng có bộ nhớ nhiều gấp 1,76 lần và băng thông 4,8 TB/s — thiết yếu cho suy luận LLM với cửa sổ ngữ cảnh dài.
40 GB / 80 GB HBM2e
Máy chủ thế hệ trước vẫn đang được sử dụng nhiều. 312 TFLOPS FP16 Tensor Core. Phổ biến dưới dạng cấu hình PCIe gốc và tùy chỉnh.
96 GB GDDR7 ECC
Card đồ họa workstation mạnh nhất từng được xây dựng. Hình dạng PCIe toàn diện, hỗ trợ cầu NVLink, Tensor Cores thế hệ 4.
32 GB GDDR7
Dòng sản phẩm tiêu dùng hàng đầu của NVIDIA dựa trên kiến trúc Blackwell. 21.760 lõi CUDA, băng thông bộ nhớ 3.352 GB/giây. Lựa chọn tốt nhất cho GPU đơn cho các tác vụ pha trộn và suy luận.
24 GB GDDR6X
Thế hệ Ada trước. 16.384 lõi CUDA, băng thông 1008 GB/s. Vẫn là một hiệu suất mạnh và mức giá phù hợp hơn cho các cụm suy luận.
8 GB GDDR6
GPU chuyên nghiệp dạng thấp cho công việc suy luận biên và xuất hiển thị. Tiêu thụ công suất tối thiểu, hoạt động êm ái, triển khai mật độ trong giá đỡ.
16 / 24 GB GDDR6
GPU Ada và Ampere PCIe tối ưu cho suy luận. Thiết kế cho các khe cắm máy chủ hạn chế về công suất — TDP 72 W — với hiệu suất INT8 mạnh mẽ để triển khai quy mô lớn.
NVIDIA đã phát hành ba kiến trúc GPU chính kể từ khi cột mốc AI bắt đầu. Kiến trúc Hopper (H100, H200) giới thiệu Engine Transformer — một khối phần cứng chuyển đổi phạm vi chính xác giữa FP8 và FP16 một cách linh hoạt trong quá trình xử lý một lớp nhằm tối đa hoá năng suất mà không gây giảm độ chính xác đáng kể. Đây là bước đột phá trong thiết kế giúp huấn luyện các mô hình có hơn 70 tỷ tham số trở thành khả thi về mặt thương mại.
Ada Lovelace (RTX 4090, L4, L40S) đã mang Tensor Core thế hệ thứ 4 đến thị trường chuyên nghiệp và người tiêu dùng cao cấp, cùng với phần cứng theo dõi tia (ray tracing) được cải tiến đáng kể. Các card Ada chiếm vị trí trung tâm giữa khả năng tiếp cận dành cho người tiêu dùng và khả năng chuyên nghiệp, trở thành lựa chọn phổ biến cho các triển khai suy luận boutique và các trạm làm việc AI sáng tạo.
Blackwell (RTX 5090, RTX PRO 6000, GB200 NVL72) là thế hệ hiện tại. Blackwell giới thiệu thiết kế GPU dual-die cho các bộ phận trung tâm dữ liệu hàng đầu, NVLink 5.0 với băng thông die-to-die 1,8 TB/s và Tensor Cores thế hệ thứ năm hỗ trợ FP4. RTX PRO 6000 Blackwell mang đến bộ nhớ ECC 96 GB cho cấp độ workstation — nhiều hơn so với H100 PCIe — cho phép các khối lượng công việc trước đây chỉ có thể chạy trên đám mây nay có thể chạy cục bộ.
Ba GPU định hình hạ tầng AI hiện đại cho cấp độ trạm làm việc và máy chủ đơn nút.
Tiêu chuẩn vàng cho đào tạo phân tán. Phiên bản SXM kết nối NVSwitch là bắt buộc cho các nút DGX lớp 8-GPU. Phiên bản PCIe phù hợp với các máy chủ tiêu chuẩn.
Cùng Hopper GPU như H100 nhưng gần như gấp đôi dung lượng bộ nhớ và băng thông lớn hơn nhiều. Lý tưởng để phục vụ các mô hình có hơn 70 tỷ tham số với độ dài ngữ cảnh dài.
Nhiều VRAM hơn H100 trong một khe PCIe tiêu chuẩn. Phù hợp với bất kỳ máy trạm hoặc máy chủ dạng tháp nào. Chạy mô hình 70B tại chỗ. Phiên bản máy chủ RTX PRO 6000 loại bỏ các đầu ra hiển thị để triển khai tối ưu trong rack.
GPU đào tạo một mô hình không nhất thiết phải là GPU tốt nhất để phục vụ mô hình đó. Việc đào tạo đòi hỏi tối đa FLOPS và bộ nhớ lớn để chứa các tham số, gradient và trạng thái tối ưu hóa đồng thời — một mô hình 70B được tinh chỉnh với AdamW yêu cầu hơn 500 GB VRAM trong một cụm. Để đào tạo ở quy mô này, các nút H100 hoặc H200 SXM kết nối qua NVSwitch là tiêu chuẩn ngành, cung cấp sự kết hợp giữa khả năng tính toán thô và băng thông NVLink cần thiết để duy trì tất cả các GPU hoạt động liên tục.
Các công việc inference ít quan tâm hơn đến FLOPS và chú trọng hơn về dung lượng bộ nhớ và băng thông. Một mô hình định lượng 70B ở INT4 phù hợp lại khoảng 40 GB — có nghĩa là một H200 có thể phục vụ nó với không gian dư thừa, và một cặp thẻ RTX PRO 6000 Blackwell kết nối qua NVLink Bridge có thể làm điều tương tự. Đối với dịch vụ inference thông lượng cao, băng thông 4,8 TB/s của H200 giúp giữ độ trễ thấp ngay cả khi xử lý các lô yêu cầu đồng thời.
Các trường hợp sử dụng máy trạm tại chỗ — nghiên cứu, trí tuệ nhân tạo sáng tạo, trò chuyện LLM tại chỗ, tạo hình ảnh, tổng hợp video — được phục vụ tốt bởi RTX PRO 6000 Blackwell (96 GB), RTX 5090 (32 GB), hoặc A100 (40/80 GB) tùy thuộc vào yêu cầu kích thước mô hình. RTX 4090 vẫn là lựa chọn cạnh tranh về giá cho người dùng chạy các mô hình đã được lượng tử hóa dưới 24 GB.
Cụm Multi-node NVSwitch. Bắt buộc cho huấn luyện trước quy mô lớn và tinh chỉnh hoàn toàn.
Bộ nhớ băng thông cao cần thiết cho việc phục vụ ngữ cảnh dài. NVLink Bridge cho các cặp workstation.
32–80 GB đủ cho dịch vụ lượng tử hóa. Tốc độ xử lý INT8 mạnh mẽ.
Độ VRAM lớn nhất trong một card PCIe. Chạy các mô hình 34B không lượng hóa. ECC để đảm bảo độ tin cậy.
Số lượng lõi CUDA cao + băng thông GDDR7 nhanh phù hợp cho suy luận phân tán.
Sub-75 W TDP. Một khe cắm hoặc dạng thấp. Triển khai chỗ đặc trong rack.
Bộ nhớ ECC, driver chứng nhận, bộ đệm khung lớn cho 3D/CAD/mô phỏng.
GB200 ghép hai chip GPU Blackwell trên một gói duy nhất kết nối bằng NVLink-C2C với tốc độ 1,8 TB/s — loại bỏ hoàn toàn nút thắt PCIe giữa các đơn vị xử lý.
Chế độ chính xác mới FP4 mang lại hiệu suất gấp tới 2 lần so với FP8 cho các tác vụ suy luận. Duy trì độ chính xác thông qua định dạng vi mô của NVIDIA (MXFP4).
Tăng quy mô băng thông gấp đôi so với Hopper — 1,8 TB/s hai chiều trên mỗi GPU. Rất quan trọng cho cấu hình giá đỡ NVL72 kết nối 72 GPU Blackwell thành một đơn vị logic duy nhất.
Một bộ động cơ Độ tin cậy, Sẵn sàng & Khả năng Bảo trì dành riêng cho việc dự đoán lỗi phần cứng — giảm thiểu thời gian ngưng hoạt động không mong muốn trong các cụm suy luận sản xuất.
Môi trường thực thi tin cậy (TEE) phân lập phần cứng cho khối lượng công việc GPU. Cho phép chạy mô hình độc quyền và suy luận nhạy cảm trong hạ tầng đám mây chia sẻ một cách an toàn.
96 GB GDDR7 ECC dạng chuẩn PCIe hai khe cắm. Độ tin cậy cấp máy trạm với dung lượng bộ nhớ đạt tiêu chuẩn trung tâm dữ liệu. Phiên bản máy chủ loại bỏ đầu ra màn hình.
GeForce RTX 5090 đưa Blackwell vào thị trường người tiêu dùng và prosumer. Được xây dựng dựa trên die GB202 với 21.760 lõi CUDA và 32 GB bộ nhớ GDDR7 chạy ở băng thông 1.792 GB/giây, đây là Card VGA đơn mạnh nhất phù hợp với PC bàn làm việc tiêu chuẩn. Đối với các nhà nghiên cứu và phát triển AI cần thực hiện suy luận và thử nghiệm cục bộ mà không phải trả phí đám mây, RTX 5090 là sự lựa chọn thực dụng.
RTX PRO 6000 Blackwell có cách tiếp cận hoàn toàn khác biệt: thay vì tối đa hóa hiệu suất chơi game cho người tiêu dùng, NVIDIA đã thiết kế một GPU dành cho workstation với 96 GB bộ nhớ ECC GDDR7 — nhiều hơn bất kỳ GPU PCIe nào trước đây của bất kỳ nhà sản xuất nào. Các phiên bản Server Edition và Max-Q Workstation Edition phù hợp với lắp đặt trên giá đỡ rack và di động tương ứng. Hai card RTX PRO 6000 kết nối qua NVLink Bridge cung cấp tổng cộng 192 GB bộ nhớ pooled — đủ để chạy các mô hình 70B tham số không dạng lượng tử.
Đối với các studio, phòng nghiên cứu, và các startup AI không thể hoặc không muốn chạy mọi tác vụ trong đám mây, dòng sản phẩm Blackwell workstation thay đổi hoàn toàn cách tính toán. Các mô hình độc quyền được giữ trong nội bộ hệ thống. Độ trễ suy luận giảm xuống. Chủ quyền dữ liệu được duy trì. Chi phí phần cứng ban đầu được phân bổ dựa trên hóa đơn suy luận đám mây, sẽ không còn tích tụ vô hạn định như trước.
Dưới đây là danh mục đầy đủ các GPU NVIDIA chuyên nghiệp của chúng tôi, từ các card workstation đơn lẻ đến các cấu hình máy chủ đa GPU. Dù bạn đang huấn luyện mô hình đầu tiên hay mở rộng một cụm suy luận, nhóm của chúng tôi sẽ giúp bạn chọn đúng phần cứng phù hợp với khối lượng công việc và ngân sách của mình.