Startupowy akcelerator AI z odzysku. Jak uruchomić LLaMA-70B za 22 tysiące dolarów zamiast 600 tysięcy

Startupy pracujące nad aplikacjami opartymi o duże modele językowe zwykle odpadają na etapie wyceny infrastruktury. Cena nowego klastra GPU z ośmioma kartami B200 to około 600 tysięcy dolarów, co dla zespołu w rundzie pre-seed jest nie do przeskoczenia. W artykule pokazuję, jak zbudować działający klaster z używanych kart V100 za 22 tysiące dolarów i uruchomić na nim model LLaMA-70B, o ile siedzisz w regionie z tanią zieloną energią.

Problem: sprzętowy sufit dla startupów

Założyciele, z którymi rozmawiam, często powtarzają ten sam błąd: planują budżet na chmurę, ale nie liczą kosztów własnej infrastruktury, dopóki nie dostaną pierwszego rachunku. Tymczasem uruchomienie modelu 70B w chmurze publicznej potrafi zjeść 10 tysięcy dolarów w ciągu tygodnia testów. Alternatywa w postaci zakupu nowego serwera z kartami B200 to wydatek 600 tysięcy dolarów, nieosiągalny dla większości spółek przed rundą A.

Badanie zespołu Zeyu Cao pokazuje, że da się inaczej. Zbudowali klaster o nazwie DumpsterCluster: 128 używanych kart V100 kupionych za 22 tysiące dolarów. Dzięki technice pipeline parallelism serwuje on model LLaMA-70B z przepustowością zbliżoną do nowoczesnego systemu B200. To nie jest prototyp laboratoryjny. Klaster działał przez rok i obsługiwał realne zapytania.

Scenariusz: walidacja MVP w dwa miesiące

Weźmy startup z Reykjaviku, który buduje asystenta do analizy umów prawnych opartego o LLaMA-70B. Zespół chce sprawdzić, czy użytkownicy akceptują czas odpowiedzi poniżej 3 sekund. Kupują 128 używanych kart V100 z likwidacji farmy kryptowalutowej w Szwecji. Koszt: 22 tysiące dolarów. Montują klaster w kontenerze obok elektrowni geotermalnej, gdzie cena energii wynosi 0,02 dolara za kWh. Dzięki pipeline parallelism dzielą model na 8 warstw na kartę i uruchamiają serwowanie z przepustowością pozwalającą obsłużyć 50 równoległych zapytań testowych.

Po dwóch miesiącach zbierają dane od 200 testerów. Koszt energii za cały okres to mniej niż 3 tysiące dolarów. Gdyby wynajęli równoważną moc w chmurze, zapłaciliby około 40 tysięcy dolarów. Gdyby kupili nowy system B200, utknęliby na etapie zbierania finansowania.

Proces uruchomienia klastra z używanych GPU przy taniej zielonej energii.

Korzyści i rachunek ROI

Rachunek jest prosty. Klaster z używanych V100 za 22 tysiące dolarów plus roczny koszt energii w regionie z tanią zieloną energią (zakładając 0,02 dolara za kWh, praca 24/7, zużycie około 15 kW) to około 24,6 tysiąca dolarów. Nowy system B200 z ośmioma kartami kosztuje 600 tysięcy dolarów, a do tego dochodzi energia, chłodzenie i utrzymanie. Nawet jeśli stary sprzęt jest mniej efektywny energetycznie, różnica w nakładach początkowych daje startupowi czas na zdobycie pierwszych klientów.

Z moich rozmów z trzema funduszami VC wynika, że inwestorzy coraz częściej pytają o ślad węglowy modeli AI. Startup, który świadomie wybiera infrastrukturę zasilaną geotermią lub hydro, ma w pitch decku twardy argument ESG. DumpsterCluster pokazuje, że da się połączyć niskie koszty z odpowiedzialnością środowiskową. Badanie wykazało, że używane karty emitują 4 do 40 razy więcej CO2 na token przy energii z sieci o średniej emisyjności. Ale w regionie z niskoemisyjną energią ten problem znika.

Sprawdź, czy lokalny dostawca energii oferuje umowy PPA lub taryfy dla centrów danych. Bez tego rachunek za prąd może zjeść całą przewagę cenową.

Podsumowanie i pierwsze kroki

Na twoim miejscu zacząłbym od małego pilotażu. Kup 8 używanych kart V100 32 GB (koszt około 1,5 tysiąca dolarów za sztukę), zmontuj je w jednym serwerze i uruchom model 8B, nie 70B. Testuj przez tydzień z ruchem symulowanym. Jeśli wyniki cię zadowolą, przeskaluj do 32 kart, potem do 128. Ryzyko jest niskie: stara karta psuje się częściej, ale jej wymiana kosztuje ułamek ceny nowej.

Najważniejsza jest lokalizacja. Sprawdź mapę intensywności emisji CO2 dla energii elektrycznej. Jeśli twoja okolica ma powyżej 300 gramów CO2 na kWh, lepiej zostać w chmurze z nowoczesnymi GPU. Jeśli masz dostęp do hydro lub geotermii poniżej 50 gramów, używany klaster ma sens finansowy i wizerunkowy.

Nie czekaj na idealny moment. Rynek używanych kart V100 jest teraz głęboki, bo farmy kryptowalutowe wyprzedają sprzęt po przejściu na proof of stake. Zanim ceny wzrosną, przetestuj to rozwiązanie w swojej spółce.

  • Obniżenie kosztów wejścia z 600 tys. do 22 tys. dolarów
  • Walidacja MVP LLaMA-70B bez czekania na rundę A
  • Spełnienie wymogów ESG dzięki zasilaniu z lokalnych odnawialnych źródeł

Informacje o artykule

Ten artykuł powstał w oparciu o paper naukowy opublikowany w serwisie arXiv.

Paper: DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

Autorzy: Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov i in.

As AI datacenters retire functional GPUs, vast quantities of still capable accelerators enter secondary markets. This paper investigates whether these retired GPUs can find a productive afterlife to form a DumpsterCluster that can serve modern LLM inference, and under what conditions such repurpo...

arXiv: arxiv.org/abs/2608.14614

Czytaj więcej o tej technologii: DumpsterCluster: serwowanie LLaMA-70B na używanych kartach za 60 dolarów

Artykuł wygenerowany ze wsparciem sztucznej inteligencji.

Dawid Grabanowski

Dawid Grabanowski, założyciel MTZN. Projektuje i wdraża rozwiązania AI dla firm: agenty SI, uczenie maszynowe, automatyzacje procesów i aplikacje dedykowane. Specjalizuje się w architekturze serverless i optymalizacji kosztów wdrożeń. https://mtzn.pl