„Czy do lokalnej AI potrzebujemy serwerowni w piwnicy?” Słyszę to pytanie często, gdy rozmawiamy o AI zgodnej z RODO, pracującej na firmowych dokumentach. Szczera odpowiedź: zwykle nie. System RAG, który przeszukuje twoje umowy, instrukcje i oferty i formułuje z nich odpowiedzi ze źródłami, działa dla małego zespołu na jednym serwerze z odpowiednią kartą graficzną. Tutaj wyjaśniam, element po elemencie, co robi każda część, kiedy wystarczy pilotaż, a kiedy lepszym wyborem jest wynajęty serwer w niemieckim centrum danych.
Dlaczego w ogóle lokalnie: ochrona danych w jednym akapicie
Przy AI w chmurze twoje pytania i dokumenty trafiają do zewnętrznego dostawcy, często z siedzibą w USA. Jeśli model językowy działa na twoim sprzęcie albo na dedykowanym serwerze w UE, krąg zaangażowanych pozostaje mały: brak zewnętrznego dostawcy AI, brak przekazywania danych do państwa trzeciego, a przy wynajętym serwerze umowa powierzenia przetwarzania z centrum danych. Podstawa prawna, koncepcja uprawnień i zasady usuwania danych są potrzebne i tak. Szczegóły znajdziesz w artykule o systemach RAG zgodnych z RODO. Ocenę prawną przeprowadzasz razem ze swoim inspektorem ochrony danych.

Chcesz zająć się tym w swojej firmie?
Napisz krótko albo zadzwoń. Odezwę się w dni robocze w ciągu 24 godzin.
Karta graficzna i pamięć VRAM: najważniejszy element
Model językowy pisze odpowiedź słowo po słowie i powinien przy tym w całości mieścić się w szybkiej pamięci karty graficznej. Dlatego w lokalnej AI liczy się przede wszystkim pamięć karty (VRAM), a mniej sama moc obliczeniowa. Jeśli model nie mieści się w całości, programy takie jak Ollama przenoszą jego część do zwykłej pamięci RAM. To działa, ale odpowiedzi przychodzą wtedy wyraźnie wolniej.
Ile pamięci potrzebuje model, można z grubsza oszacować. Przy pełnej precyzji 16-bitowej każdy miliard parametrów zajmuje około 2 GB. Kwantyzacja, czyli zapis wag z mniejszą dokładnością, mocno to zmniejsza: model z 8 miliardami parametrów w popularnej wersji 4-bitowej ma niecałe 5 GB, model z 70 miliardami parametrów nieco ponad 40 GB. Jakość przy 4 bitach często spada tylko nieznacznie, ale warto to sprawdzić na własnych pytaniach.
Do tego dochodzi pamięć na kontekst: pytanie, znalezione fragmenty i powstającą odpowiedź. W RAG ten kontekst jest większy niż w zwykłym czacie, bo za każdym razem wysyłanych jest kilka fragmentów dokumentów. Praktyczna zasada brzmi więc: rozmiar modelu plus zapas na kontekst i równoczesnych użytkowników.
Pamięć RAM, dyski i procesor
Pozostałe elementy są mniej krytyczne, ale nie bez znaczenia:
- Pamięć RAM: mieści system operacyjny, indeks wyszukiwania, bazę danych i przetwarzanie nowych dokumentów. Zaplanuj ją z zapasem, żeby model miał miejsce przy ładowaniu i w razie potrzeby.
- Dyski: szybkie SSD skracają ładowanie modeli i przeszukiwanie indeksu. Modele zajmują od kilku do wielu gigabajtów, indeks rośnie razem z twoimi dokumentami, a wersje modeli trzymane do porównania potrzebują dodatkowego miejsca.
- Procesor (CPU): rozkłada pliki PDF i Office, odczytuje skany przez rozpoznawanie tekstu i steruje całością. Zwykle wystarcza aktualny procesor serwerowy, bo pisaniem odpowiedzi zajmuje się karta graficzna.
- Model embeddingów: zamienia twoje dokumenty na wektory liczb do wyszukiwania i jest w porównaniu bardzo mały. Popularny model open source do tego celu ma mniej niż 300 MB i działa obok modelu językowego.
Pilotaż czy pełna praca: co się zmienia
W pilotażu dwie, trzy osoby testują jedno zastosowanie na prawdziwych dokumentach. Pytania rzadko przychodzą jednocześnie, a krótkie oczekiwanie nikomu nie przeszkadza. Często wystarczy istniejący sprzęt albo mniejszy model i właśnie o to chodzi: na prawdziwym przypadku widzisz, czy odpowiedzi są przydatne, zanim kupisz sprzęt.
W pełnej pracy zmieniają się dwie rzeczy. Po pierwsze, kilka osób pyta jednocześnie, a każde równoległe zapytanie potrzebuje własnej pamięci na kontekst. W Ollamie na przykład zapotrzebowanie na pamięć rośnie z liczbą równoległych zapytań razy długość kontekstu. Dla wielu równoczesnych użytkowników istnieje wyspecjalizowane oprogramowanie serwerowe, takie jak vLLM, które zarządza tą pamięcią wydajniej. Po drugie, rosną oczekiwania: odpowiedzi mają przychodzić szybko, serwer ma działać niezawodnie, a dostęp ma być logowany.
Jak znaleźć właściwe pierwsze zastosowanie, opisuje artykuł AI w małej i średniej firmie: gdzie naprawdę oszczędza czas.
Dobór sprzętu według użytkowników i zastosowania
Tabela w stylu „tylu pracowników, tyle pamięci VRAM” nie byłaby rzetelna, bo współgrają tu trzy czynniki:
- Ile osób pyta jednocześnie? Liczy się nie liczba kont, tylko szczyty, na przykład rano albo przed terminami.
- Jak długie są pytania i odpowiedzi? Pytanie o umowę z krótką odpowiedzią wymaga mniej kontekstu niż kilkustronicowy projekt oferty.
- Jaki język i jaka jakość? Wiele mniejszych modeli pisze poprawnie po niemiecku i po polsku, ale przy wymagających tekstach większy model może zrobić różnicę.
Co możesz wykorzystać ponownie
Dlatego w pilotażu mierzę: jak szybko przychodzą odpowiedzi, jak są dobre i ile pamięci jest zajęte? Z tego wynika wyposażenie do pracy na co dzień, z zapasem na kolejne zastosowanie. W BSU-Holding lokalnie działający system RAG tworzy z umów, specyfikacji usług i dawnych ofert projekty ofert, które opuszczają firmę dopiero po akceptacji. Długie projekty takie jak te stawiają sprzętowi inne wymagania niż krótka odpowiedź z instrukcji.
Często da się wykorzystać więcej, niż się wydaje: istniejący serwer albo stację roboczą z kartą graficzną do pilotażu, dysk sieciowy, SharePoint lub DMS jako źródło dokumentów, istniejący backup oraz konta użytkowników razem z uprawnieniami. Nowy bywa wtedy tylko sam serwer AI.
We własnym biurze czy w centrum danych w UE?
Serwer AI w biurze ma sens, jeśli masz serwerownię albo przynajmniej dobrze wentylowaną szafę rack, a dane w ogóle nie powinny opuszczać budynku. Nie lekceważ skutków ubocznych: wydajna karta graficzna pod obciążeniem pobiera dużo prądu, wytwarza ciepło i hałas wentylatorów. Obok biurka albo w schowku bez wentylacji to zły pomysł. Zasilacz awaryjny UPS i porządne podłączenie do sieci firmowej są częścią rozwiązania, to element mojej usługi konfiguracji sieci i serwerów.
Dedykowany serwer GPU w niemieckim lub unijnym centrum danych ma sens, jeśli nie masz odpowiedniego pomieszczenia, korzysta z niego kilka lokalizacji albo nie chcesz zajmować się sprzętem. Zasilaniem, chłodzeniem i wymianą sprzętu zajmuje się centrum danych. Potrzebujesz umowy powierzenia przetwarzania i szyfrowanego połączenia. Ważne jest słowo „dedykowany”: serwer jest do twojej wyłącznej dyspozycji, a model językowy działa na nim jako twoja instalacja, nie jako usługa dostawcy AI.
Oprogramowanie jest w obu przypadkach takie samo. Pilotaż na wynajętym sprzęcie, a później własny serwer w firmie, albo odwrotnie, nie oznacza więc zaczynania od zera.
Utrzymanie: aktualizacje, backupy i kontrola
Serwer AI to serwer jak każdy inny i wymaga tej samej opieki: aktualizacji bezpieczeństwa systemu i oprogramowania, aktualizacji sterowników karty graficznej testowanych przed wdrożeniem oraz monitoringu, który zgłasza, gdy kończy się pamięć lub miejsce na dysku. Nowych wersji modeli nie instaluję w ciemno, tylko najpierw sprawdzam je na zestawie prawdziwych pytań.
Przy backupie mniej liczy się sam model, bo zawsze można go pobrać ponownie, a bardziej wszystko, co powstało u ciebie: konfiguracja, zasady dostępu, logi i indeks. Obowiązuje tu ta sama zasada 3-2-1 co dla reszty twojego IT, łącznie z przetestowanym odtwarzaniem.
I niezależnie od sprzętu: AI może się mylić, także lokalna. RAG sprawia, że odpowiedzi da się sprawdzić, bo każde stwierdzenie podaje swoje źródło. Sprawdzić musi je jednak człowiek, zwłaszcza zanim cokolwiek opuści firmę.
Lokalna AI nie potrzebuje własnego centrum danych, ale potrzebuje wyposażenia dopasowanego do twojego zastosowania. Moja rada: zacznij od małego, od jednego zastosowania i pilotażu na prawdziwych dokumentach, a sprzęt wybierz dopiero po pomiarach. Czy twój obecny sprzęt wystarczy, czy lepszy będzie serwer w UE, wyjaśnimy podczas bezpłatnej konsultacji. Potem dostaniesz stałą cenę za wdrożenie twojej lokalnej AI i szczerą ocenę, jakiego sprzętu naprawdę potrzebujesz.