Try our cookies Alza.cz a. s., Company identification number 27082440, use cookies and other data to ensure the proper functioning of the website and, with your consent, also, among other things, to personalize advertising and the content of our websites. By clicking on the “I understand“ button, you agree to the use of cookies and the transfer of data regarding the behavior on the website for displaying targeted advertising on social networks and advertising networks on other websites.
Alzak icon

Kolik lidí zvládne AI server? Výkon na papíře může klamat a omyly jsou drahé

Article

• Autor: Peter Vnuk

Víte, proč se výkon AI serveru nedá posuzovat jen podle GPU v datasheetu, jak přepočítat tokeny na reálné uživatele a podle čeho poznat, zda infrastruktura zvládne vašeho nového chatbota, RAG nebo interní AI asistenty ve firemním provozu?

AI servery a kapacita

Kolik lidí zvládne AI server – OBSAH

  1. Výkon AI serveru se nepočítá jen z parametrů
  2. Proč jedna odpověď nestačí
  3. Kolik uživatelů vlastně znamená kolik?
  4. Datasheet pomůže, ale kapacitu za vás nespočítá
  5. Základní výpočet: kolik tokenů spotřebuje jeden uživatel
  6. Model rozhoduje víc než název serveru
  7. RAG: když chatbot nehádá, ale hledá ve firemních dokumentech
  8. Jeden server může stačit, pokud víte, co od něj čekáte
  9. Jak zadat benchmark, který má obchodní hodnotu

Výkon AI serveru se nepočítá jen z parametrů

Výkon AI serveru vypadá na první pohled jako disciplína, kterou lze vyřešit pohledem do technických parametrů. Firma si porovná počet GPU, velikost paměti, hodnoty TFLOPS v datasheetu a snadno získá pocit, že tím má základní kapacitu spočítanou. Jenže u generativní umělé inteligence se právě v tomto bodě často rodí nejdražší omyly, protože samotný hardware ještě neříká, kolik lidí bude službu používat pohodlně, kolik jich začne čekat a kdy se systém dostane na hranici rozumné odezvy.

U AI serveru záleží na tom, jaký model umělé inteligence na něm poběží, jak dlouhé budou dotazy, jak rozsáhlé budou odpovědi, jak rychle má text přibývat na obrazovce a kolik požadavků dorazí ve stejný okamžik. Stejný server tak může být pro jednoduchého interního asistenta výrazně předimenzovaný, zatímco při práci s dlouhými smlouvami, technickou dokumentací nebo větším modelem začne narážet mnohem dříve.

AI servery a kapacita

Proč jedna odpověď nestačí

Číslo z datasheetu je užitečný začátek technické debaty, ale samo o sobě nestačí k odpovědi na otázku, kolik uživatelů server skutečně utáhne. U běžné webové aplikace se výkon často přepočítává na požadavky za sekundu, protože server zpracuje dotaz, vrátí výsledek a může se věnovat dalšímu požadavku. U chatbota je situace složitější, protože model odpověď postupně generuje a po celou dobu spotřebovává část výkonu.

Jeden uživatel navíc server nezatěžuje po celou dobu přihlášení, protože chvíli píše dotaz, potom čeká na první slova odpovědi, následně výsledek čte a až poté se vrací s dalším požadavkem. Krátké interní dotazy, jednoduchá klasifikace dokumentů a právní asistent pracující s dlouhými texty jsou proto tři naprosto odlišné scénáře. V prezentaci mohou všechny spadat pod firemní AI, ale z pohledu infrastruktury znamenají jiné nároky na paměť, latenci, propustnost i rezervu pro špičky, a právě proto nemá smysl ptát se jen na to, jak výkonný server je, ale především na to, jakou konkrétní práci má dělat.

AI server

Kolik uživatelů vlastně znamená kolik?

První problém vzniká už u samotného slova uživatel. Firma může mít 10 000 zaměstnanců, ale to neznamená, že AI server musí současně generovat 10 000 odpovědí. V jeden okamžik bude většina lidí mimo aplikaci, část bude číst hotový výstup a jen menší skupina bude právě čekat, až model vytvoří další část odpovědi.

Pro kapacitní plánování je proto důležitější počet současně obsluhovaných požadavků než celkový počet lidí s přístupem ke službě. U generativního chatbota je ještě přesnější sledovat počet odpovědí, které model aktivně generuje ve stejném okamžiku. Pokud dvacet lidí čte výsledek a pět lidí v té chvíli dostává novou odpověď, největší zátěž pro GPU představuje zrovna těch pět běžících generování.

Formulace typu „server zvládne 500 uživatelů“ tak má smysl jen tehdy, pokud je jasné, o jaké uživatele jde. Může jít o přihlášené účty, aktivní session, souběžné dotazy nebo současně generované odpovědi. Pro nákupní rozhodnutí je nejpraktičtější poslední možnost, protože právě ta se dá spojit s rychlostí generování, latencí a reálným pocitem uživatele z aplikace.

i

Agner Krarup Erlang formalizoval problém souběžnosti pro telefonní ústředny už v roce 1909. Z registrovaných předplatitelů bylo ve špičce aktivních jen 5–15 %. U AI služeb platí stejná logika – z tisíce zaměstnanců s přístupem k chatbotu čeká ve špičce na odpověď jen několik desítek. Klíč ke správné kapacitě je dimenzovat podle souběžnosti, ne podle celkového počtu uživatelů.

Kde běží umělá inteligence

Datasheet pomůže, ale kapacitu za vás nespočítá

Parametry GPU mají při návrhu AI serveru jasnou hodnotu. Výpočetní výkon ukazuje, jak silný čip server používá, kapacita VRAM určuje, jak velký model a kontext se vejdou do paměti, paměťová propustnost ovlivňuje rychlost generování a interconnect rozhoduje o tom, jak efektivně spolupracuje více GPU. Problém nastává ve chvíli, kdy se z těchto údajů udělá jediný nákupní argument a zbytek provozní reality zůstane mimo výpočet.

U jazykových modelů se výkon v praxi láme na metrikách, které jsou bližší chování aplikace. Latence říká, jak dlouho uživatel čeká, throughput ukazuje, kolik práce systém zvládne celkově, a tokens/s popisují, jak rychle model generuje výstup. Důležitý je také TTFT, tedy time to first token, protože čas do první viditelné části odpovědi často rozhoduje o tom, zda aplikace působí svižně, nebo pomalu.

Metrika Co ukazuje Jak ji číst v praxi
VRAM Kapacitu paměti GPU Rozhoduje, jak velký model, kontext a počet session se vejde do paměti
Tokens/s Rychlost generování textu Základní metrika pro přepočet na současně obsluhované uživatele
TTFT Čas do prvního tokenu Ovlivňuje první dojem ze svižnosti aplikace
Latence p95/p99 Odezvu většiny a nejpomalejších požadavků Ukazuje, zda systém drží kvalitu i ve špičce
Throughput Celkovou propustnost služby Pomáhá plánovat kapacitu pro větší počet požadavků
Délka kontextu Kolik textu model drží v paměti U dlouhých dokumentů rychle zvyšuje nároky na VRAM

Nejlepší číslo z benchmarku bývá často méně důležité než podmínky, za kterých vzniklo. Test s krátkým promptem, krátkou odpovědí a ideálním batchingem může vypadat výborně, ale o firemním asistentovi s dokumenty, češtinou a ranní špičkou řekne jen omezenou část pravdy. Rozhodující je proto testovat výkon při podobné délce dotazů, podobné délce odpovědí a podobné souběžnosti, jakou bude mít budoucí produkční služba.

Vývoj a provoz umělé inteligence

Základní výpočet: kolik tokenů spotřebuje jeden uživatel

U generativní AI se dá začít jednoduchým kapacitním modelem. Pokud server zvládne například 6 000 výstupních tokenů za sekundu a firma chce, aby jeden aktuálně obsluhovaný uživatel dostával odpověď rychlostí 15 tokenů za sekundu, vychází hrubá kapacita na 400 současně generovaných odpovědí. V produkci je potřeba z tohoto čísla odečíst rezervu na špičky, delší dotazy, práci s kontextem, nerovnoměrné chování uživatelů a režii celé aplikace.

Takový výpočet není přesná předpověď reálného provozu, ale velmi dobrý rozhodovací filtr. Rychle ukáže, zda se firma baví o serveru pro pilotní projekt, interního asistenta pro menší tým nebo infrastrukturu pro stovky lidí ve špičce. Zároveň donutí zadavatele definovat, jaká rychlost odpovědi je pro danou službu ještě pohodlná a jaká už bude působit jako brzda v práci.

Důležitá je také provozní rezerva, protože produkční systém nemůže být navržený tak, aby při běžné špičce trvale běžel na hranici možností. Stačí delší dokument, složitější dotaz, pomalejší část aplikační vrstvy nebo servisní zásah a odezva se začne rychle zhoršovat. Rezerva proto není luxus, ale pojistka, že služba zůstane použitelná i mimo ideální podmínky.

Otázka Praktický dopad
Kolik tokenů má běžná odpověď? Delší odpověď drží GPU obsazenou déle
Kolik tokenů za sekundu má uživatel dostat? Vyšší komfort snižuje počet současných odpovědí
Jak dlouhý bude vstupní kontext? Delší prompt zvyšuje paměťové nároky a zpomaluje zpracování
Kolik lidí bude službu používat ve špičce? Celkový počet zaměstnanců je méně důležitý než souběžnost
Jaká má být rezerva? Produkční systém nesmí být navržený na trvalých 100 % vytížení

U negenerativních úloh se kapacita počítá jiným způsobem. Klasifikace, embeddingy nebo jednoduché vyhledávání se často dají vyjádřit přes požadavky za sekundu, protože odpověď nevzniká postupným generováním dlouhého textu. Pokud služba zvládne 2 000 požadavků za sekundu a jeden aktivní uživatel posílá průměrně jeden požadavek za deset sekund, vychází kapacitní model úplně jinak než u chatbota, který vytváří dlouhou odpověď token po tokenu.

Model rozhoduje víc než název serveru

Velikost modelu dramaticky mění nároky na infrastrukturu. Menší modely zhruba do 10 miliard parametrů mohou při dobré optimalizaci obsloužit velmi slušný počet interních dotazů, zvlášť pokud firma nepotřebuje extrémně dlouhý kontext. Větší modely mohou nabídnout vyšší kvalitu odpovědí u náročnějších úloh, ale zároveň výrazně zvyšují nároky na VRAM, paměťovou propustnost a efektivní provoz přes více GPU.

Samotné parametry modelu jsou přitom jen první část paměťové rovnice. Do paměti se musí vejít také KV cache, tedy průběžná paměť modelu pro už zpracované tokeny. Další prostor potřebuje inference engine a dávkové zpracování požadavků. Pokud server obsluhuje více modelů najednou, je nutné počítat i s jejich samostatnou paměťovou rezervou.

Kvantizace dokáže nároky snížit, ale měla by se ověřovat na konkrétním úkolu, nejen podle obecného benchmarku. U interního asistenta, který odpovídá na opakované provozní dotazy, může být úspornější konfigurace rozumným kompromisem. U právních, technických nebo finančních výstupů je naopak potřeba zkontrolovat, zda zvolená přesnost neovlivňuje práci s detaily, například jestli model nezačne hůř rozlišovat podobné smluvní formulace, nepřehlíží malé rozdíly v technické specifikaci nebo nezjednodušuje číselné údaje způsobem, který v krátkém laboratorním testu nemusí vyjít najevo.

i

KV cache (key-value cache) ukládá mezivýpočty pro každý token v kontextu – a to pro každou běžící session zvlášť. Při délce kontextu 32 000 tokenů zabere zhruba čtyřikrát více VRAM než kontext 8 000 tokenů. Při 50 souběžných sezeních se tento rozdíl násobí padesáti. Větší modely s delším kontextem proto nenaráží jen na výpočetní výkon, ale především na objem paměti – a právě proto se u RAG asistentů pracujících s dlouhými dokumenty kapacita škáluje jinak než u asistentů pro krátké dotazy.

Vývoj a provoz umělé inteligence

RAG: když chatbot nehádá, ale hledá ve firemních dokumentech

Firemní AI asistent často nemá odpovídat jen z obecných znalostí modelu. Mnohem užitečnější je, když si před odpovědí najde relevantní informace v interních dokumentech, manuálech, smlouvách nebo znalostní bázi. Tomu se říká RAG, tedy retrieval-augmented generation. Jednoduše řečeno jde o kombinaci vyhledávání a generování: systém nejdřív najde podklady a teprve potom z nich model sestaví odpověď.

Pro firmu je to zásadní rozdíl. Model nemusí mít všechno „v hlavě“, tedy uložené v natrénovaných parametrech, a může pracovat s aktuálními daty, která se ve firmě průběžně mění. Chatbot tak může odpovídat podle poslední verze interní směrnice, produktové dokumentace nebo obchodních podmínek, nejen podle toho, co se model naučil při tréninku.

Z hlediska výkonu ale přibývá další práce, kterou musí systém stihnout před samotnou odpovědí. Nejdřív je potřeba dotaz převést do podoby vhodné pro vyhledávání, najít relevantní pasáže, někdy je ještě znovu seřadit podle přesnosti, což se označuje jako reranking, a potom je vložit do promptu pro jazykový model. Teprve poté začne samotné generování odpovědi.

Vývoj a provoz umělé inteligence

To je důvod, proč může být RAG asistent pomalejší a náročnější než jednoduchý chatbot bez napojení na dokumenty. Kapacitu neurčuje jen rychlost generování tokenů, ale i vyhledávání, databáze, práce s delším kontextem, kvalita dokumentů a aplikační vrstva kolem modelu. Tady se často ukáže rozdíl mezi pěkným demem a nástrojem, který se dá nasadit do každodenní práce. Demo může pracovat s několika připravenými otázkami a krátkými dokumenty. Produkční provoz ale přinese dlouhé soubory a nepřesné dotazy, které systém musí správně pochopit. Přidají se také různé verze dokumentů a více lidí, kteří budou asistenta používat ve stejný čas.

Demo proto může být dobrý začátek, ale nemělo by být posledním krokem před nákupem serveru. V praxi dává smysl chtít po dodavateli nebo interním IT týmu praktické ověření na realistickém scénáři, například s podobnými dokumenty, podobnou délkou dotazů a očekávaným počtem souběžných uživatelů. Může jít o technický proof of concept, tedy krátké ověření, zda řešení funguje v daných podmínkách, nebo o pilotní provoz pro vybraný tým. Forma se liší podle dodavatele i velikosti projektu, cílem je ale vždy zjistit ještě před investicí, zda se výkon z prezentace potká s realitou firmy.

Jak RAG asistent v dokumentech hledá

RAG asistent nehledá v dokumentech slovem po slově. Každý dokument je nejdříve převeden na embedding – číselný vektor zachycující jeho přibližný smysl. Tyto vektory jsou uloženy ve vektorové databázi a při dotazu se hledají ty nejpodobnější vektoru dotazu samotného. Jde tedy o sémantické, nikoli klíčové vyhledávání: systém najde relevantní pasáže, i když v nich chybí přesné slovo z dotazu.

Výkon tohoto procesu závisí na velikosti vektorové databáze, rychlosti embedovacího modelu a latenzi vyhledávacího dotazu. Produkční RAG proto neobsahuje jen jazykový model, ale celý pipeline – embedovací model, vektorovou databázi, reranker a aplikační vrstvu. Každý z těchto komponent přidává latenci a tvoří potenciální úzké hrdlo, které se v benchmarku bez RAG jednoduše nezjeví.

Jeden server může stačit, pokud víte, co od něj čekáte

Pro vývoj, testování menších modelů nebo interního asistenta pro omezený počet lidí může být jeden výkonný AI server velmi dobré řešení. Firma získá kontrolu nad daty, stabilnější nákladový rámec a možnost ladit modely bez neustálého posílání citlivých vstupů do externí služby. U předvídatelné zátěže může vlastní infrastruktura dávat ekonomicky větší smysl než dlouhodobé placení cloudové kapacity.

U jedné mašiny je potřeba myslet hlavně na špičky a dostupnost služby. Pokud server obsluhuje kritickou aplikaci, musí mít část výkonu vyhrazenou pro provozní rezervu. Potřebné jsou také aktualizace modelu, ovladačů nebo inference enginu, které mohou dočasně změnit chování celé služby a ovlivnit její výkon. Jakmile se AI asistent přesune z omezeného nasazení do každodenní práce více týmů, začíná dávat smysl replikace modelu, více GPU nebo cluster více serverů.

Cloud zůstává silný tam, kde se pracovní zátěž mění, roste skokově nebo se teprve hledá správný model. Vlastní server je vhodnější ve chvíli, kdy už firma zná provozní profil a ví, že bude infrastrukturu využívat pravidelně. Rozhodnutí proto nemá stát jen na srovnání pořizovací ceny serveru a cloudového ceníku, ale také na tom, jak stabilní bude vytížení, jak citlivá jsou data a jak náročná bude správa celého prostředí.

Scénář Co obvykle dává smysl
První experimenty s AI Cloud nebo menší lokální testovací server
Interní chatbot pro tým Jeden silnější server s rezervou
RAG nad firemní dokumentací Server dimenzovaný podle end-to-end latence a délky kontextu
Asistent pro stovky uživatelů Více GPU, replikace modelu nebo cluster
Citlivá data a stabilní provoz Vlastní infrastruktura nebo hybridní model
Nepravidelné špičky Cloudová kapacita jako doplněk
Jeden server stačí

Jak zadat benchmark, který má obchodní hodnotu

Dobrý kapacitní test začíná popisem služby, ne výběrem GPU. Firma by měla vědět, jaký typ uživatelů bude systém používat, jaké dotazy budou pokládat, jak dlouhé dokumenty se budou zpracovávat a jaká odezva je ještě přijatelná. Bez těchto vstupů se z benchmarku stane technické cvičení, které s budoucím provozem nemusí mít mnoho společného.

Technický tým by měl měřit nejen průměrnou odezvu, ale také p95 a p99 latenci. Tyto hodnoty ukazují, do jakého času se vejde 95 nebo 99 % požadavků, takže lépe odhalí pomalé odpovědi, které průměr snadno zakryje. Ve firemním provozu přitom často rozhodují špičky, dlouhé dokumenty a méně typické dotazy, protože tam se ukáže skutečná rezerva infrastruktury. V testu by měly být stejné komponenty jako v produkci. Pokud bude aplikace používat RAG, musí být v benchmarku i vyhledávání v dokumentech. Pokud se má odpovídat česky, mají být v testu české dotazy, a pokud budou uživatelé posílat dlouhé přílohy, krátký ukázkový prompt je pro kapacitní rozhodnutí zavádějící.

Prakticky stačí začít pěti čísly, která přeloží technický výkon serveru do reálného provozu firmy.

Co si ujasnit před benchmarkem AI serveru?

  • Cílová doba do první viditelné odpovědi – Určuje, jak rychle má uživatel poznat, že systém začal pracovat. U chatbota často rozhoduje víc než celkový čas dokončení odpovědi.
  • Požadovaná rychlost generování – Ukazuje, kolik tokenů za sekundu má uživatel dostávat, aby odpověď působila svižně a použitelně v běžné práci.
  • Průměrná délka vstupu – Delší dotazy nebo vložené dokumenty zvyšují nároky na paměť i zpracování před samotným generováním odpovědi.
  • Průměrná délka výstupu – Čím delší odpovědi má model vytvářet, tím déle drží výpočetní kapacitu serveru.
  • Počet souběžných uživatelů ve špičce – Pro dimenzování infrastruktury je důležitější skutečná souběžnost než celkový počet lidí, kteří mají ke službě přístup.

Jakmile tato čísla existují, dá se server porovnávat podle reality, ne podle marketingových parametrů. Bez nich se z výběru infrastruktury snadno stane drahá sázka na to, že výkon v datasheetu bude odpovídat skutečnému firemnímu provozu.

i

Mohlo by vás zajímat

Nejlepší otázka při výběru AI serveru tedy nezní, jak výkonnou GPU má uvnitř. Mnohem užitečnější je zjistit, kolik tokenů za sekundu dokáže dodat v konkrétní aplikaci, při konkrétním modelu, s konkrétní délkou kontextu a s rezervou na špičku. Právě tam vzniká rozdíl mezi AI serverem, který v prezentaci vypadá skvěle, a infrastrukturou, která bude lidem skutečně zrychlovat práci. Firma, která chce AI používat seriózně, by proto měla začít malým kapacitním modelem a reálným pilotem, ale ne proto, aby se nákup zdržoval. Smyslem je utratit peníze za výkon, který bude vidět v provozu a který půjde dál rozumně škálovat. U AI serverů totiž nejdráže nevychází slabší hardware, ale výkon, který nikdo neumí správně využít.

Co je TTFT u AI serveru?

TTFT (time to first token) je čas od odeslání dotazu do okamžiku, kdy se na obrazovce objeví první část odpovědi. Pro uživatelský zážitek je TTFT často důležitější než celková délka odpovědi – pokud server začne odpovídat rychle, aplikace působí svižně, i když dokončení trvá déle.

Jak zjistím, kolik uživatelů zvládne AI server?

Klíčová metrika není počet registrovaných uživatelů, ale počet současně generovaných odpovědí. Základní výpočet: vydělte celkový výkon serveru v tokenech za sekundu počtem tokenů za sekundu, které chcete dodat jednomu uživateli. Od výsledku odečtěte rezervu na špičky (typicky 20–30 %). Přesnější číslo získáte pilotem nebo benchmarkem s realistickými dotazy.

Co je KV cache a proč závisí výkon na délce kontextu?

KV cache ukládá mezivýpočty pro každý token v aktuálním kontextu. Čím delší kontext, tím více VRAM KV cache spotřebuje – a tím méně souběžných sessions se do paměti vejde. U RAG asistentů pracujících s dlouhými dokumenty je proto správné dimenzování KV cache stejně důležité jako výkon GPU.

Co je RAG a jak ovlivňuje výkon AI serveru?

RAG (retrieval-augmented generation) je technika, při které asistent před sestavením odpovědi prohledá interní dokumenty a do odpovědi zahrne nalezené relevantní pasáže. RAG zvyšuje přesnost odpovědí na firemní témata, ale přidává latenci – vyhledávání, embedování a reranking probíhají dříve než samotné generování. Benchmark bez RAG pipeline proto výkon produkčního RAG asistenta podcení.

Kdy si pořídit vlastní AI server místo cloudu?

Vlastní server dává smysl při předvídatelné a stabilní zátěži, práci s citlivými daty nebo tehdy, kdy cloudové náklady při pravidelném provozu převýší pořizovací cenu serveru. Cloud je výhodnější při nestabilní zátěži, rychlém růstu nebo když firma teprve hledá správný model a scénář využití.

Co je kvantizace modelu a kdy ji použít?

Kvantizace snižuje přesnost vah modelu (například z 32bitových čísel na 8bitová nebo 4bitová), čímž zmenšuje nároky na VRAM a zrychluje generování. U jednoduchých interních asistentů jde o rozumný kompromis. U právních, finančních nebo technických výstupů je vhodné ověřit, zda nižší přesnost neovlivní kvalitu odpovědí na konkrétním úkolu.

NVIDIA DGX Spark - Work Station Free delivery
Alzaboxes and stores
4.5 7×
Watch Price/Availability
NVIDIA DGX Spark
Work Station , NVIDIA GB10, NVIDIA GB10 128GB, RAM 128GB LPDDR5x, SSD 4000GB, Without Optical Drive, Wi-Fi, HDMI and USB-C, Case Type: SFF, NVIDIA DGX OS 7
  169,990,-
Buy
In stock > 5 pcs
Order by midnight, get it at the AlzaBox in the morning.
Info
Order Code: NRn2000
5.0 1×
Watch Price/Availability
Inter-Tech IPC 4U-40255 - Rack 4U
PC Case - ATX, mATX (Micro ATX), mITX (Mini ITX), eATX (Extended ATX), uATX, SSI-CEB and SSI-EEB, 11× 3,5" slot(s), 4× 2,5" slot(s), max. heat sink height: 150mm, max. graphics card length: 330mm, side panel made of
  3,999,-
Buy
Ordered on request
Order Code: ITEsipc18
HPE DL20 Gen11 - Server Free delivery
Alzaboxes and stores
Watch Price/Availability
HPE DL20 Gen11
Server , Intel Xeon E-2436, Without graphics card, RAM 32GB DDR5, SSD 960GB, Case Type: Rack, without Operating System
  144,990,-
Buy
In stock 1 pcs at the supplier's
Order Code: TH703a68b8
Watch Price/Availability
Inter-Tech IPC 4U-4724 - Rack 4U
PC Case - ATX, mATX (Micro ATX), mITX (Mini ITX), eATX (Extended ATX) and SSI-EEB, 2× 2,5" slot(s), USB 3.2 Gen 1, 2×80mm, max. heat sink height: 155mm, max. graphics card length: 340mm, without power supply, side panel made of steel
  15,290,-
Buy
In stock 1 pcs
Order Code: ITEcsipc09
Watch Price/Availability
MSI Cubi 5 1M-440BEU
Mini PC , Intel Core 3 100U 4,7 GHz, Intel Graphics, RAM 0GB DDR5-SDRAM, SSD 0GB, Without Optical Drive, Wi-Fi, HDMI, DisplayPort and Thunderbolt, Case Type: Micro Tower, without Operating System
  6,490,-
Currently Unavailable
Order Code: TB237a3n33
MSI Cubi NUC AI+ 3MG-002EU - Mini PC Free delivery
Alzaboxes and stores
Watch Price/Availability
MSI Cubi NUC AI+ 3MG-002EU
Mini PC , Intel Core Ultra 9 386H 4,9 GHz, Intel Graphics, RAM 32GB DDR5-SDRAM, SSD 1000GB, Without Optical Drive, Wi-Fi, HDMI and Thunderbolt, 1× USB 2.0, Case Type: Mini ITX, Windows 11 Pro
  39,290,-
Buy
In stock > 5 pcs at the supplier's
Order Code: TB237a3n49
NVIDIA RTX PRO 6000 Blackwell Server Edition Short Bracket Passive 96GB - Graphics Card for Businesses
This item cannot be returned by withdrawing from a distance sales contract once it has been unpacked. For more information, see the Terms and Conditions.
Free delivery
to Alza branch
Watch Price/Availability
NVIDIA RTX PRO 6000 Blackwell Server Edition Short Bracket Passive 96GB
Graphics Card for Businesses - 96GB GDDR7 (28000MHz), NVIDIA Blackwell (GB202, 1590 MHz), Boost 2288 MHz, PCI Express x16 5.0, 512Bit, DisplayPort 2.1, width 266,7 mm
Pre-sale price 419,990,-
Currently Unavailable
Order Code: NVrpbs02
NVIDIA H200 NVL Passive PCIe 141GB with NVIDIA AI Enterprise - Graphics Card for Businesses
This item cannot be returned by withdrawing from a distance sales contract once it has been unpacked. For more information, see the Terms and Conditions.
Free delivery
to Alza branch
Watch Price/Availability
NVIDIA H200 NVL Passive PCIe 141GB with NVIDIA AI Enterprise
Graphics Card for Businesses - 141GB HBM3e (6400MHz), NVIDIA (GH100, 1365 MHz), Boost 1785 MHz, PCI Express x16 5.0, 6144Bit, width 266,7 mm
Pre-sale price 799,999,-
Currently Unavailable
Order Code: NVh01
HP ZGX Nano G1n AI - Work Station Free delivery
Alzaboxes and stores
Watch Price/Availability
HP ZGX Nano G1n AI
Work Station , NVIDIA GB10, NVIDIA GB10 128GB, RAM 128GB LPDDR5x, SSD 4000GB, Wi-Fi, HDMI, Case Type: SFF, NVIDIA DGX OS 7
Currently Unavailable
Order Code: HPBD5024d1
MSI Cubi NUC AI+ 3MG-003EU - Mini PC Free delivery
Alzaboxes and stores
Watch Price/Availability
MSI Cubi NUC AI+ 3MG-003EU
Mini PC , Intel Core Ultra 7 355 4,7 GHz, Intel Graphics, RAM 16GB DDR5-SDRAM, SSD 1000GB, Without Optical Drive, Wi-Fi, HDMI and Thunderbolt, 1× USB 2.0, Case Type: Mini ITX, Windows 11 Pro
  29,990,-
Buy
In stock > 5 pcs
Order by midnight, get it at the AlzaBox in the morning.
Info
Order Code: TB237a3n50
Lenovo ThinkSystem ST45v3 - Server Free delivery
Alzaboxes and stores
Watch Price/Availability
Lenovo ThinkSystem ST45v3
Server , AMD Epyc 4344P 5,3 GHz, RAM 16GB DDR5, Without Optical Drive, HDMI and DisplayPort, 4× USB 3.1, 4× USB 2.0, Case Type: Mini Tower, without Operating System
  99,990,-
Buy
In stock 2 pcs
Order by midnight, get it at the AlzaBox in the morning.
Info
Order Code: TI896a2
NVIDIA RTX PRO 2000 16GB Blackwell Low Profile - Graphics Card Free delivery
Alzaboxes and stores
Watch Price/Availability
NVIDIA RTX PRO 2000 16GB Blackwell Low Profile
Graphics Card - 16GB GDDR7 (18000MHz), NVIDIA Blackwell (GB206, 790 MHz), Boost 1950 MHz, PCI Express x16 5.0, 128Bit, mini DisplayPort 2.1, width 167,64 mm
  39,999,-
Buy
In stock 3 pcs
Order by midnight, get it at the AlzaBox in the morning.
Info
Order Code: NVrpr08
NVIDIA RTX PRO 4500 32GB Blackwell - Graphics Card Free delivery
Alzaboxes and stores
Watch Price/Availability
NVIDIA RTX PRO 4500 32GB Blackwell
Graphics Card - 32GB GDDR7 (28000MHz), NVIDIA Blackwell (GB203, 1590 MHz), Boost 2617 MHz, PCI Express x16 5.0, 256Bit, DisplayPort 2.1b, width 266,7 mm
  116,999,-
Buy
In stock > 5 pcs
Order by midnight, get it at the AlzaBox in the morning.
Info
Order Code: NVrpr05
NVIDIA DGX Station - Workstation for Businesses
This item cannot be returned by withdrawing from a distance sales contract once it has been unpacked. For more information, see the Terms and Conditions.
Free delivery
to Alza branch
Watch Price/Availability
NVIDIA DGX Station
Workstation for Businesses , NVIDIA GB300, NVIDIA GB300 252GB, RAM 496GB LPDDR5x, Case Type: Midi Tower, Linux Ubuntu
Currently Unavailable
Order Code: NRn2001nad
NVIDIA RTX PRO 5000 48GB Blackwell - Graphics Card Free delivery
Alzaboxes and stores
5.0 1×
Watch Price/Availability
NVIDIA RTX PRO 5000 48GB Blackwell
Graphics Card - 48GB GDDR7 (28000MHz), NVIDIA Blackwell (GB202, 1590 MHz), Boost 2617 MHz, PCI Express x16 5.0, 384Bit, DisplayPort 2.1b, width 266,7 mm
  198,999,-
Buy
In stock 3 pcs
Order by midnight, get it at the AlzaBox in the morning.
Info
Order Code: NVrpr04
Print
P-DC1-WEB02