Mua GPU để bán: NVIDIA RTX 5090, A100, H100 và RTX PRO 6000

Mua GPU NVIDIA tại MillionMiner, từ các dòng Consumer Blackwell đến các dòng dành cho trung tâm dữ liệu, dành cho AI và công việc chuyên nghiệp. Các card có sẵn gồm RTX 5090 32GB và RTX 4090 24GB dạng blower, RTX PRO 6000 Blackwell 96GB, cùng các GPU Tensor Core A100 và H100. Mới 100% có bảo hành của nhà sản xuất, trừ khi có ghi chú khác trong danh sách.

Mỗi GPU được vận chuyển miễn phí toàn cầu DDP, do đó giá tại bước thanh toán là tổng chi phí cuối cùng đã bao gồm phí vận chuyển. Đối với các bộ build nhiều card, xem các máy chủ GPU đã lắp ráp sẵn của chúng tôi hoặc có thể yêu cầu các card được triển khai vào trung tâm dữ liệu tại Mỹ, đi kèm điện và làm mát đã được xử lý. Mua sắm toàn bộ dòng GPU dưới đây.

5.0
ngôi sao ngôi sao ngôi sao ngôi sao ngôi sao
4.97
ngôi sao ngôi sao ngôi sao ngôi sao ngôi sao
4.5
ngôi sao ngôi sao ngôi sao ngôi sao ngôi sao
lưới tổ ong lưới tổ ong
Lọc & Sắp xếp

Hàng tồn kho đã được xác minh

Mọi GPU đều được kiểm tra và kiểm thử trước khi vận chuyển

Gửi hàng nhanh

Gửi trong vòng 1–3 ngày làm việc

Chấp nhận Crypto

Thanh toán bằng BTC, ETH, USDT & nhiều hơn nữa

Hỗ trợ chuyên nghiệp

Chuyên gia về hạ tầng AI & GPU sẵn sàng hỗ trợ

Điều khiển AI & GPU

GPU AI chuyên nghiệp cho Đào tạo, suy luận và xử lý tải công suất cao

Cách mạng AI được thúc đẩy bởi một bộ chip silicon cực kỳ nhỏ gọn. Dòng GPU trung tâm dữ liệu của NVIDIA, từ H100 và H200 Tensor Core GPU đến RTX PRO 6000 Blackwell và RTX 5090, là nền tảng tính toán trên đó các mô hình ngôn ngữ lớn, mô hình khuếch tán, mô phỏng khoa học và các pipeline suy luận tần suất cao chạy. Chúng tôi cung cấp đầy đủ dòng sản phẩm NVIDIA chuyên nghiệp — accelerators trung tâm dữ liệu, GPU cho máy trạm và card hiển thị chuyên nghiệp — dành cho các khách hàng doanh nghiệp, phòng nghiên cứu, startup AI và nhà vận hành hạ tầng đám mây.

Băng thông bộ nhớ H200

4.8 TB/s

HBM3e @ dung lượng 141 GB

Hiệu suất AI H100

3.9 PFLOPS

Các thao tác tensor rời rạc FP8

RTX PRO 6000 VRAM

96 GB

GDDR7 ECC — Kiến trúc Blackwell

VRAM của RTX 5090

32 GB GDDR7

Blackwell GB202 — 3352 GB/s BW


Dòng GPU chuyên nghiệp của NVIDIA

Từ Máy làm việc đến Trung tâm Dữ liệu quy mô siêu lớn

H100 SXM / PCIe

80 GB HBM2e

Xép chỉnh của AI doanh nghiệp đảm nhiệm đáp ứng các yêu cầu đáo tạo. 3,35 TFLOPS FP64, NVLink 900 GB/s. Phiên bản SXM được ưu tiên cho các mạng lưới NVSwitch đa GPU trong hệ thống DGX H100.

H200 SXM / PCIe

141 GB HBM3e

Người kế nhiệm H100. Cùng loại chip GPU Hopper nhưng có bộ nhớ nhiều gấp 1,76 lần và băng thông 4,8 TB/s — thiết yếu cho suy luận LLM với cửa sổ ngữ cảnh dài.

A100 PCIe / SXM

40 GB / 80 GB HBM2e

Máy chủ thế hệ trước vẫn đang được sử dụng nhiều. 312 TFLOPS FP16 Tensor Core. Phổ biến dưới dạng cấu hình PCIe gốc và tùy chỉnh.

RTX PRO 6000 Blackwell

96 GB GDDR7 ECC

Card đồ họa workstation mạnh nhất từng được xây dựng. Hình dạng PCIe toàn diện, hỗ trợ cầu NVLink, Tensor Cores thế hệ 4.

RTX 5090 (GB202)

32 GB GDDR7

Dòng sản phẩm tiêu dùng hàng đầu của NVIDIA dựa trên kiến trúc Blackwell. 21.760 lõi CUDA, băng thông bộ nhớ 3.352 GB/giây. Lựa chọn tốt nhất cho GPU đơn cho các tác vụ pha trộn và suy luận.

RTX 4090 (Ada)

24 GB GDDR6X

Thế hệ Ada trước. 16.384 lõi CUDA, băng thông 1008 GB/s. Vẫn là một hiệu suất mạnh và mức giá phù hợp hơn cho các cụm suy luận.

T1000 (Professional)

8 GB GDDR6

GPU chuyên nghiệp dạng thấp cho công việc suy luận biên và xuất hiển thị. Tiêu thụ công suất tối thiểu, hoạt động êm ái, triển khai mật độ trong giá đỡ.

A2 / L4 (PCIe)

16 / 24 GB GDDR6

GPU Ada và Ampere PCIe tối ưu cho suy luận. Thiết kế cho các khe cắm máy chủ hạn chế về công suất — TDP 72 W — với hiệu suất INT8 mạnh mẽ để triển khai quy mô lớn.

Câu chuyện về kiến trúc NVIDIA

Hopper, Ada Lovelace & Blackwell — Ba thế hệ thúc đẩy kỷ nguyên AI

NVIDIA đã phát hành ba kiến trúc GPU chính kể từ khi cột mốc AI bắt đầu. Kiến trúc Hopper (H100, H200) giới thiệu Engine Transformer — một khối phần cứng chuyển đổi phạm vi chính xác giữa FP8 và FP16 một cách linh hoạt trong quá trình xử lý một lớp nhằm tối đa hoá năng suất mà không gây giảm độ chính xác đáng kể. Đây là bước đột phá trong thiết kế giúp huấn luyện các mô hình có hơn 70 tỷ tham số trở thành khả thi về mặt thương mại.

Ada Lovelace (RTX 4090, L4, L40S) đã mang Tensor Core thế hệ thứ 4 đến thị trường chuyên nghiệp và người tiêu dùng cao cấp, cùng với phần cứng theo dõi tia (ray tracing) được cải tiến đáng kể. Các card Ada chiếm vị trí trung tâm giữa khả năng tiếp cận dành cho người tiêu dùng và khả năng chuyên nghiệp, trở thành lựa chọn phổ biến cho các triển khai suy luận boutique và các trạm làm việc AI sáng tạo.

Blackwell (RTX 5090, RTX PRO 6000, GB200 NVL72) là thế hệ hiện tại. Blackwell giới thiệu thiết kế GPU dual-die cho các bộ phận trung tâm dữ liệu hàng đầu, NVLink 5.0 với băng thông die-to-die 1,8 TB/s và Tensor Cores thế hệ thứ năm hỗ trợ FP4. RTX PRO 6000 Blackwell mang đến bộ nhớ ECC 96 GB cho cấp độ workstation — nhiều hơn so với H100 PCIe — cho phép các khối lượng công việc trước đây chỉ có thể chạy trên đám mây nay có thể chạy cục bộ.


Song song

H100 so với H200 so với RTX PRO 6000 Blackwell

Ba GPU định hình hạ tầng AI hiện đại cho cấp độ trạm làm việc và máy chủ đơn nút.

Hopper

H100 SXM5

Tốt nhất để đào tạo
Bộ nhớ 80 GB HBM2e
Băng thông bộ nhớ 3.35 TB/s
FP8 Sparse 3.9 PFLOPS
TDP 700 W (SXM)
NVLink NVLink 4 — 900 GB/s
Yếu tố hình dạng SXM5 / PCIe

Tiêu chuẩn vàng cho đào tạo phân tán. Phiên bản SXM kết nối NVSwitch là bắt buộc cho các nút DGX lớp 8-GPU. Phiên bản PCIe phù hợp với các máy chủ tiêu chuẩn.

Hopper

H200 SXM5

Tốt nhất cho suy luận
Bộ nhớ 141 GB HBM3e
Băng thông bộ nhớ 4.8 TB/s
FP8 Sparse 3.9 PFLOPS
TDP 700 W (SXM)
NVLink NVLink 4 — 900 GB/s
Yếu tố hình dạng SXM5 / PCIe

Cùng Hopper GPU như H100 nhưng gần như gấp đôi dung lượng bộ nhớ và băng thông lớn hơn nhiều. Lý tưởng để phục vụ các mô hình có hơn 70 tỷ tham số với độ dài ngữ cảnh dài.

Blackwell

RTX PRO 6000 BW

Cây làm việc tốt nhất
Bộ nhớ 96 GB GDDR7 ECC
Băng thông bộ nhớ ~1.8 TB/s
Tensor Cores 5th-gen, FP4/FP8/FP16
TDP 300 W (PCIe)
NVLink NVLink Bridge (optional)
Yếu tố hình dạng Dual-slot PCIe x16

Nhiều VRAM hơn H100 trong một khe PCIe tiêu chuẩn. Phù hợp với bất kỳ máy trạm hoặc máy chủ dạng tháp nào. Chạy mô hình 70B tại chỗ. Phiên bản máy chủ RTX PRO 6000 loại bỏ các đầu ra hiển thị để triển khai tối ưu trong rack.


Chọn GPU phù hợp

Đào tạo so với Dự đoán so với Trạm làm việc: Bạn cần loại GPU nào?

GPU đào tạo một mô hình không nhất thiết phải là GPU tốt nhất để phục vụ mô hình đó. Việc đào tạo đòi hỏi tối đa FLOPS và bộ nhớ lớn để chứa các tham số, gradient và trạng thái tối ưu hóa đồng thời — một mô hình 70B được tinh chỉnh với AdamW yêu cầu hơn 500 GB VRAM trong một cụm. Để đào tạo ở quy mô này, các nút H100 hoặc H200 SXM kết nối qua NVSwitch là tiêu chuẩn ngành, cung cấp sự kết hợp giữa khả năng tính toán thô và băng thông NVLink cần thiết để duy trì tất cả các GPU hoạt động liên tục.

Các công việc inference ít quan tâm hơn đến FLOPS và chú trọng hơn về dung lượng bộ nhớ và băng thông. Một mô hình định lượng 70B ở INT4 phù hợp lại khoảng 40 GB — có nghĩa là một H200 có thể phục vụ nó với không gian dư thừa, và một cặp thẻ RTX PRO 6000 Blackwell kết nối qua NVLink Bridge có thể làm điều tương tự. Đối với dịch vụ inference thông lượng cao, băng thông 4,8 TB/s của H200 giúp giữ độ trễ thấp ngay cả khi xử lý các lô yêu cầu đồng thời.

Các trường hợp sử dụng máy trạm tại chỗ — nghiên cứu, trí tuệ nhân tạo sáng tạo, trò chuyện LLM tại chỗ, tạo hình ảnh, tổng hợp video — được phục vụ tốt bởi RTX PRO 6000 Blackwell (96 GB), RTX 5090 (32 GB), hoặc A100 (40/80 GB) tùy thuộc vào yêu cầu kích thước mô hình. RTX 4090 vẫn là lựa chọn cạnh tranh về giá cho người dùng chạy các mô hình đã được lượng tử hóa dưới 24 GB.

Hướng Dẫn Chọn Lọc Nhanh

Phù hợp Khối lượng Công việc của Bạn với Phần cứng Phù hợp

Đào tạo LLM (70B+)
H100 / H200 SXM

Cụm Multi-node NVSwitch. Bắt buộc cho huấn luyện trước quy mô lớn và tinh chỉnh hoàn toàn.

Phân tích LLM (70B)
H200 or 2× RTX PRO 6000

Bộ nhớ băng thông cao cần thiết cho việc phục vụ ngữ cảnh dài. NVLink Bridge cho các cặp workstation.

Phân tích LLM (7–13B)
RTX 5090 / A100 80GB

32–80 GB đủ cho dịch vụ lượng tử hóa. Tốc độ xử lý INT8 mạnh mẽ.

Máy trạm AI cục bộ
RTX PRO 6000 BW (96 GB)

Độ VRAM lớn nhất trong một card PCIe. Chạy các mô hình 34B không lượng hóa. ECC để đảm bảo độ tin cậy.

Tạo hình ảnh / video
RTX 5090 / RTX 4090

Số lượng lõi CUDA cao + băng thông GDDR7 nhanh phù hợp cho suy luận phân tán.

Edge / Phân tích dữ liệu tiêu thụ thấp
T1000 / L4 / A2

Sub-75 W TDP. Một khe cắm hoặc dạng thấp. Triển khai chỗ đặc trong rack.

Hình ảnh chuyên nghiệp
RTX PRO 6000 / A100

Bộ nhớ ECC, driver chứng nhận, bộ đệm khung lớn cho 3D/CAD/mô phỏng.


Nổi bật về kiến trúc của Blackwell

Điều gì khiến Blackwell trở thành bước nhảy đột phá về mặt thế hệ

Thiết kế GPU Dual-Die

GB200 ghép hai chip GPU Blackwell trên một gói duy nhất kết nối bằng NVLink-C2C với tốc độ 1,8 TB/s — loại bỏ hoàn toàn nút thắt PCIe giữa các đơn vị xử lý.

Lõi Tensor thế hệ 5

Chế độ chính xác mới FP4 mang lại hiệu suất gấp tới 2 lần so với FP8 cho các tác vụ suy luận. Duy trì độ chính xác thông qua định dạng vi mô của NVIDIA (MXFP4).

NVLink 5.0

Tăng quy mô băng thông gấp đôi so với Hopper — 1,8 TB/s hai chiều trên mỗi GPU. Rất quan trọng cho cấu hình giá đỡ NVL72 kết nối 72 GPU Blackwell thành một đơn vị logic duy nhất.

Công cụ RAS

Một bộ động cơ Độ tin cậy, Sẵn sàng & Khả năng Bảo trì dành riêng cho việc dự đoán lỗi phần cứng — giảm thiểu thời gian ngưng hoạt động không mong muốn trong các cụm suy luận sản xuất.

Tin học Bảo mật

Môi trường thực thi tin cậy (TEE) phân lập phần cứng cho khối lượng công việc GPU. Cho phép chạy mô hình độc quyền và suy luận nhạy cảm trong hạ tầng đám mây chia sẻ một cách an toàn.

RTX PRO 6000 — Ngọn cờ PCIe

96 GB GDDR7 ECC dạng chuẩn PCIe hai khe cắm. Độ tin cậy cấp máy trạm với dung lượng bộ nhớ đạt tiêu chuẩn trung tâm dữ liệu. Phiên bản máy chủ loại bỏ đầu ra màn hình.

NVIDIA Blackwell

RTX 5090 và RTX PRO 6000: Blackwell dành cho Chuyên gia

GeForce RTX 5090 đưa Blackwell vào thị trường người tiêu dùng và prosumer. Được xây dựng dựa trên die GB202 với 21.760 lõi CUDA và 32 GB bộ nhớ GDDR7 chạy ở băng thông 1.792 GB/giây, đây là Card VGA đơn mạnh nhất phù hợp với PC bàn làm việc tiêu chuẩn. Đối với các nhà nghiên cứu và phát triển AI cần thực hiện suy luận và thử nghiệm cục bộ mà không phải trả phí đám mây, RTX 5090 là sự lựa chọn thực dụng.

RTX PRO 6000 Blackwell có cách tiếp cận hoàn toàn khác biệt: thay vì tối đa hóa hiệu suất chơi game cho người tiêu dùng, NVIDIA đã thiết kế một GPU dành cho workstation với 96 GB bộ nhớ ECC GDDR7 — nhiều hơn bất kỳ GPU PCIe nào trước đây của bất kỳ nhà sản xuất nào. Các phiên bản Server Edition và Max-Q Workstation Edition phù hợp với lắp đặt trên giá đỡ rack và di động tương ứng. Hai card RTX PRO 6000 kết nối qua NVLink Bridge cung cấp tổng cộng 192 GB bộ nhớ pooled — đủ để chạy các mô hình 70B tham số không dạng lượng tử.

Đối với các studio, phòng nghiên cứu, và các startup AI không thể hoặc không muốn chạy mọi tác vụ trong đám mây, dòng sản phẩm Blackwell workstation thay đổi hoàn toàn cách tính toán. Các mô hình độc quyền được giữ trong nội bộ hệ thống. Độ trễ suy luận giảm xuống. Chủ quyền dữ liệu được duy trì. Chi phí phần cứng ban đầu được phân bổ dựa trên hóa đơn suy luận đám mây, sẽ không còn tích tụ vô hạn định như trước.


Câu hỏi thường gặp

Câu hỏi thường gặp

Cả hai đều sử dụng cùng một die GPU GH100 Hopper và cung cấp hiệu suất tính toán FLOPS tương tự (~3,9 PFLOPS FP8 rỗng sparse). H200 thay thế HBM2e bằng bộ nhớ HBM3e: dung lượng tăng từ 80 GB lên 141 GB và băng thông tăng từ 3,35 TB/s lên 4,8 TB/s. Do đó, H200 vượt trội hơn cho các khối lượng công việc nặng về suy luận, nơi các mô hình lớn phải phù hợp trên một GPU duy nhất và yêu cầu throughput cao.

Đối với các công việc suy diễn, vâng — dung lượng ECC GDDR7 96 GB của nó vượt quá 80 GB của H100 PCIe và phù hợp với bất kỳ khe PCIe tiêu chuẩn nào trong máy trạm. Đối với đào tạo, dạng dạng H100/H200 SXM với NVSwitch cung cấp băng thông inter-GPU cao hơn đáng kể và số FLOPS thô lớn hơn cùng TDP. RTX PRO 6000 là sự lựa chọn tốt hơn khi quý vị cần dung lượng VRAM lớn tại chỗ mà không cần hạ tầng NVSwitch.

GPU SXM (H100 SXM5, H200 SXM5) gắn vào bo mạch chủ chuyên dụng thay vì khe PCIe và kết nối với nhau qua mạng NVSwitch, cho phép băng thông liên GPU lên đến 900 GB/s mỗi GPU. Các biến thể PCIe phù hợp với máy chủ tiêu chuẩn và workstation nhưng giới hạn ở cầu NVLink (2 GPU) hoặc băng thông PCIe (x16, khoảng 64 GB/s) cho việc giao tiếp đa GPU. Đối với các cụm 8 GPU trở lên yêu cầu giao tiếp tất cả với tất cả, các hệ thống SXM NVSwitch là bắt buộc.

Ở độ chính xác FP16 (16-bit), một mô hình 70B yêu cầu khoảng 140 GB VRAM — một H200 (141 GB) có thể xử lý điều này trong phạm vi. Ở định dạng phân quan INT8, cần khoảng 70 GB. Ở định dạng INT4 (GGUF Q4), khoảng 35–40 GB, phù hợp với H100 80 GB hoặc một cặp RTX 4090. RTX PRO 6000 Blackwell (96 GB) có thể xử lý các mô hình INT8 70B trên một GPU với khoảng trống cho cache KV.

RTX 5090 rất phù hợp cho suy luận AI cục bộ, tạo hình ảnh (Stable Diffusion, Flux, DALL-E 3 bản sao), tổng hợp video và tinh chỉnh các mô hình nhỏ đến trung bình. Bộ nhớ GDDR7 32 GB của nó đủ để chạy các mô hình 13B ở dạng FP16 và 70B ở dạng INT4. Đối với các cụm đào tạo đa GPU, GPU của trung tâm dữ liệu vẫn là lựa chọn ưu tiên nhờ băng thông NVLink và dung lượng bộ nhớ lớn hơn.

NVIDIA A100 (kiến trúc Ampere, năm 2020) vẫn là một GPU AI mạnh mẽ và phổ biến. Nó được cung cấp với cấu hình 40 GB và 80 GB HBM2e, đạt hiệu suất Tensor Core FP16 312 TFLOPS. Khi nguồn cung đã giảm so với H100, giá của A100 trở nên phù hợp hơn. Đối với các công việc suy luận và huấn luyện vừa phải, nó vẫn rất mạnh mẽ. Đối với nghiên cứu tiên tiến hoặc các mô hình lớn nhất, H100/H200 hiện được ưu tiên.

Vâng. MillionMiner phục vụ khách hàng doanh nghiệp, nghiên cứu và hạ tầng đám mây với các đơn hàng GPU số lượng lớn. Liên hệ với đội ngũ bán hàng của chúng tôi để biết giá cho các đơn hàng mua nhiều H100, H200, A100 và RTX PRO 6000. Chúng tôi có thể sắp xếp logistics vận chuyển, chuẩn bị hàng và lập hóa đơn bằng nhiều loại tiền tệ bao gồm tiền điện tử.

Đội ngũ của chúng tôi sẵn sàng 24/7 qua WhatsApp (+49 176 777 888 33), email và điện thoại. Chúng tôi hỗ trợ chọn lựa GPU cho các công việc huấn luyện và suy luận, thiết kế cụm GPU đa, và mua sắm B2B. Hãy liên hệ với chúng tôi hoặc truy cập phần FAQ của chúng tôi để có câu trả lời nhanh chóng.

Sẵn sàng xây dựng hạ tầng AI của quý vị chưa?

Dưới đây là danh mục đầy đủ các GPU NVIDIA chuyên nghiệp của chúng tôi, từ các card workstation đơn lẻ đến các cấu hình máy chủ đa GPU. Dù bạn đang huấn luyện mô hình đầu tiên hay mở rộng một cụm suy luận, nhóm của chúng tôi sẽ giúp bạn chọn đúng phần cứng phù hợp với khối lượng công việc và ngân sách của mình.