Hai @mingmanhk
Terima kasih atas pertanyaannya — ini memang contoh kasus yang bagus untuk dipikirkan.
Pertama, poin terpenting: ini tentang pendinginan, bukan sekadar kompatibilitas.
L4, A2, dan A30 semuanya adalah GPU data center pasif, yang dirancang pada 2021–2023 untuk server GPU generasi sebelumnya. GPU ini tidak memiliki kipas sendiri dan sepenuhnya mengandalkan aliran udara depan-ke-belakang yang kuat dan terarah dari server GPU khusus agar tetap dalam batas termal. Tanpa aliran udara yang direkayasa itu, kartu-kartu ini sangat mudah mengalami overheat — bahkan di luar NAS, hanya memasukkan salah satu GPU ini ke workstation PC biasa pun sudah berisiko. TS-h2490FU adalah platform penyimpanan all-flash, dan aliran udaranya disetel untuk pendinginan umum, sehingga kartu-kartu ini tidak cocok secara fisik untuk chassis tersebut.
Kedua, dari sisi driver, ada kendala lain.
Kartu data center dan kartu workstation berperilaku sangat berbeda dalam hal deteksi GPU, dukungan driver, dan passthrough. Platform NAS kami tidak menyertakan driver untuk kartu data center tersebut — itulah sebabnya Anda tidak menemukannya di daftar kompatibilitas. Jadi bahkan jika urusan termal diabaikan, L4/A2/A30 juga tidak bisa terdeteksi dengan mulus.
Ketiga, catatan singkat soal ketersediaan, untuk rencana Anda.
A2 sudah mendapat pemberitahuan end-of-life (hanya penjualan sisa stok), A30 adalah kartu generasi Ampere yang lebih lama dan secara bertahap sedang dihentikan produksinya (masih mungkin bisa dipesan lewat SI/distributor, tapi makin sulit didapat), dan L4 adalah satu-satunya dari ketiga kartu tersebut yang masih menjadi produk aktif dan mudah ditemukan.
Keempat, tentang sizing model untuk workload LLaMA Anda.
VRAM adalah faktor penentu. Semua kartu tersebut punya VRAM 24 GB, yang cukup untuk Llama 3 8B saja — model ini bisa berjalan lancar bahkan di FP16. Tapi, model 70B seperti Llama 3 70B, atau Llama 4 Scout, membutuhkan kurang lebih 40~70 GB+ bahkan di 4-bit dan jelas tidak akan cukup di 24 GB; model seperti ini butuh kartu kelas 96 GB atau multi-GPU. Jadi tetap kembali ke arah pengembangan dan aplikasi yang Anda butuhkan.
Jadi, rekomendasi kami:
Daripada memaksakan kartu data center pasif ke dalam NAS storage, cara yang lebih tepat adalah memilih sistem yang memang dirancang untuk komputasi GPU dan dikombinasikan dengan kartu profesional yang berpendingin aktif. Untuk dua workload Anda — analitik surveilans plus LLM lokal kelas 8B — titik awal yang bagus adalah NVIDIA RTX PRO 4000 Blackwell SFF. VRAM-nya juga 24 GB, tapi ini kartu generasi Blackwell terbaru dengan GDDR7 dan dukungan FP4, konsumsi daya hanya 70 W, kipas sudah built-in, serta cukup daya slot saja. Kartu ini lebih baru, lebih kencang, dan secara signifikan lebih terjangkau dari L4.
Kalau nanti ingin upgrade ke Llama 3 70B atau Llama 4, itu level berbeda: Anda akan butuh RTX PRO 6000 Blackwell (96 GB), yang memang butuh perangkat khusus seperti QAI-h1290FX — didesain khusus untuk jenis GPU seperti ini, dan tidak bisa ditempatkan di TS-h1290FX standar.