Ile kosztuje utrzymanie DocCompan w chmurze
Model rozdziela rachunek na dwie części, które zachowują się zupełnie inaczej: infrastrukturę — stałą, skokową i negocjowalną — oraz tokeny modelu AI — zmienną, rosnącą liniowo i sterowaną decyzjami produktowymi. Przesuń suwaki, a policzy się wszystko: rachunek miesięczny, koszt na użytkownika, marża przy zadanej cenie za miejsce i porównanie sześciu wariantów wdrożenia.
Kalkulator
Wszystkie założenia są suwakami — żadna liczba nie jest zaszyta na sztywno. Zmiana dowolnego parametru przelicza cały rachunek, wykres, porównanie dostawców i marżę. Gotowe ustawienia wyeksportujesz do dokumentu Worda.
Założenia
Skala i użycie
Model AI i tokeny
Infrastruktura
Waluta i cena za miejsce
Rachunek miesięczny
GCP · Cloud Run + Cloud SQL (HA)Z czego składa się rachunek
udział w koszcie miesięcznymKoszt na użytkownika w funkcji skali
te same założenia · oś Y: USD / mies.Dostawcy przy tych samych założeniach
| Wariant | Infrastruktura | Razem | Na usera |
|---|
Tokeny AI są identyczne u każdego dostawcy — różni je wyłącznie infrastruktura.
Marża przy cenie za miejsce
Co dalej
dźwignie policzone dla bieżących ustawień| Dźwignia | Oszczędność / mies. | Zmiana |
|---|
Każda dźwignia liczona osobno, wobec bieżących ustawień. Nie sumują się wprost — część zachodzi na siebie.
Trzy progi skali
Scenariusz bazowy: GCP europe-central2 (Warszawa), Cloud Run + Cloud SQL, ceny listowe, tokeny na naszym kluczu. Próg 10 użytkowników bez wysokiej dostępności, progi 100 i 1000 z HA.
| Pozycja | 10 userów | 100 userów | 1000 userów |
|---|---|---|---|
| Infrastruktura | 254 USD | 610 USD | 1 860 USD |
| Tokeny AI — node'y w workflowach | 10 USD | 103 USD | 1 034 USD |
| Tokeny AI — asystent czatowy | 18 USD | 177 USD | 1 772 USD |
| Razem miesięcznie | 282 USD | 891 USD | 4 665 USD |
| Razem miesięcznie (PLN) | 1 051 zł | 3 324 zł | 17 408 zł |
| Na użytkownika | 28,18 USD | 8,91 USD | 4,67 USD |
| Koszt jednego uruchomienia | 0,70 USD | 0,22 USD | 0,12 USD |
| Udział tokenów AI | 10 % | 32 % | 60 % |
Cztery wnioski, które zmieniają decyzje
- Chmura zarządzana ma podłogę ~250 USD/mies. — niezależnie od tego, czy userów jest 3 czy 30. Przy 10 użytkownikach 90 % rachunku to koszt, który i tak by stał. Dzisiejszy VPS kosztuje w tym scenariuszu 48 USD łącznie z tokenami — 5,8× mniej.
- Koszt AI na użytkownika jest stały: 2,81 USD/mies. i nie maleje ze skalą. To jedyny składnik rosnący liniowo. Przy 1000 userów tokeny to 60 % rachunku — czyli przy skali o marży decyduje produkt, a nie DevOps.
- Koszt na użytkownika spada 6× między 10 a 1000 miejsc. Próg, na którym chmura zarządzana przestaje boleć, to okolice 60–80 płacących użytkowników.
- Trzy dźwignie ścinają ~45 % rachunku przy 100 userach i żadna nie wymaga zmiany dostawcy: prompt caching w asystencie (−8,7 %), tańszy model (−18 %), własny klucz klienta (−31,5 %).
Rekomendacja
GCP, region europe-central2 (Warszawa), Cloud Run + Cloud SQL — wdrażane etapami.
Czysto cenowo AWS jest tańszy o 13 % przy 100 userach i o 18 % przy 1000. Mimo to rekomendujemy GCP, bo AWS nie ma regionu w Polsce, a w wertykałach, w które celujemy — farmacja, finanse, medycyna, sektor publiczny — „dane nie opuszczają Polski” jest argumentem sprzedażowym wartym więcej niż różnica w rachunku.
Ścieżka
- do ~50 userów — VPS + Coolify, stan obecny, 48–160 USD/mies.
- 50–150 — Cloud Run + Cloud SQL bez HA, 460–790 USD
- 150–800 — HA regionalne i replika odczytu, 900–1 500 USD
- 800+ — GKE Autopilot albo Cloud Run z rabatem CUD
Nie migrujemy „bo chmura”. Migrujemy, gdy pojawi się pierwszy klient płacący za SLA albo wymagający rezydencji danych i audytu.
Jak to jest policzone
Model jest świadomie przejrzysty, nie „dokładny do centa”. Każdy krok da się prześledzić i podważyć osobno, a wpływ błędnego założenia pokazuje analiza wrażliwości wbudowana w kalkulator.
Zasada: popyt → zasoby → cennik
Trzy stopnie, każdy do podważenia niezależnie od pozostałych:
Skąd pochodzą ceny
Wszystkie stawki jednostkowe zostały pobrane programowo z publicznych API cennikowych, nie przepisane ze stron marketingowych ani odtworzone z pamięci:
- Google Cloud — Cloud Billing Catalog API, region
europe-central2(Warszawa) - AWS — AWS Price List API, region
eu-central-1(Frankfurt — AWS nie ma regionu w Polsce) - Azure — Azure Retail Prices API, region
polandcentral - Anthropic — cennik Claude API (first-party), USD za 1 mln tokenów
- Kurs — NBP tabela A nr 168/A/NBP/2026: 1 USD = 3,7314 PLN
Ceny są listowe, on-demand, netto. Faktury Google Cloud EMEA idą na odwrotne obciążenie, więc dla czynnego podatnika VAT kwota netto jest kosztem docelowym. Rabaty wolumenowe nie są wliczone w scenariusz bazowy — są dostępne jako opcja w kalkulatorze.
Pełny cennik z podanym źródłem każdej pozycji: pricing-2026-08.json. Kod modelu: cost_model.py.
Definicja „użytkownika”
Jedno aktywne miejsce (seat) — osoba, która w danym miesiącu faktycznie uruchamia workflow. Konta założone i nieużywane nie generują ani obciążenia, ani kosztu, i w modelu ich nie ma. „1000 userów” oznacza tysiąc osób pracujących na platformie, a nie tysiąc rekordów w bazie.
Co właściwie hostujemy
Pięć źródeł kosztu, każde o innej charakterystyce skalowania:
- Backend (Django + daphne) — REST API i WebSockety ze statusami runów na żywo. Musi stać 24/7; długożyjących połączeń nie da się rozliczać per żądanie.
- Workery Celery — wykonanie node'ów. Node AI blokuje slot workera na czas odpowiedzi API, prawie nie zużywając CPU — to równoległość, nie moc, wyznacza ich liczbę.
- PostgreSQL + pgvector — rośnie monotonicznie z liczbą userów i historią. Najdroższa pozycja infrastruktury przy skali.
- Redis — broker Celery, wyniki i warstwa Channels. Mały wolumen, wymagany 24/7, w wersji zarządzanej zaskakująco drogi.
- Storage obiektowy — artefakty content-addressed. Poniżej 1 % rachunku.
Trzy rzeczy, które już dziś obniżają koszt
To przewagi wpisane w architekturę, nie optymalizacje do zrobienia:
- Przewaga kroków deterministycznych. Model dostaje tylko to, czego regułą zrobić się nie da — w scenariuszu bazowym 2 z 8 node'ów.
- Embeddingi liczone lokalnie — deterministyczny embedder plus pgvector, bez płatnego API embeddingów. Cały RAG kosztuje CPU i dysk, zero tokenów.
- Cache wykonania po treści — identyczne wejście nie jest liczone drugi raz, co ścina i tokeny, i CPU.
Do tego twarde bezpieczniki w kodzie: budżet tokenów na wywołanie narzędzia, budżet na turę czatu i miesięczny limit per użytkownik z twardą blokadą.
Czego model świadomie nie liczy
- Ruchu w skali doby — używamy okna roboczego 176 h/mies. i mnożnika szczytu 3× zamiast symulacji kolejkowej.
- Sezonowości — końce miesiąca u księgowych, kwartały w planowaniu. Piki 2–3× w kilku dniach.
- Kosztów jednorazowych — migracja, testy obciążeniowe, transfer danych.
- Kosztów zespołu utrzymania — przy ścieżce zarządzanej ~0,2 FTE, przy self-hosted ~0,5 FTE. Przy stawkach rynkowych ta różnica przewyższa całą oszczędność na infrastrukturze przy 100 userach.
- Narzut operacyjny (monitoring, logi, rejestr obrazów, backupy, sekrety) modelujemy ryczałtem 8 %, a nie pozycja po pozycji.
Ograniczenie, które wycina połowę opcji: WebSockety
DocCompan streamuje statusy node'ów i odpowiedzi asystenta przez Django Channels. To oznacza długożyjące połączenia, więc klasyczny „serverless per żądanie” — Cloud Run w rozliczeniu request-based, Lambda, Azure Functions — nie pasuje: połączenie trwa minuty, nie milisekundy.
Backend musi mieć minimum jedną instancję zawsze aktywną, dlatego w modelu użyliśmy rozliczenia instancyjnego Cloud Run, a nie tańszego z pozoru request-based. To podnosi podłogę kosztową, ale jest ceną za funkcję, która sprzedaje produkt.
DocCompan jest lekki obliczeniowo
Przy 1000 użytkowników to 40 000 uruchomień miesięcznie — około 63 na godzinę w oknie roboczym, czyli 0,14 node'a na sekundę. Nawet z trzykrotnym zapasem na szczyt dwa vCPU workerów obsługują tysiąc użytkowników.
To nie jest błąd modelu, tylko konsekwencja architektury: ciężką pracę wykonuje model AI po drugiej stronie sieci, a nasze workery głównie czekają. Dlatego nie ma sensu kupować dużych maszyn, a najdroższym zasobem staje się baza danych.
Gdzie naprawdę idą tokeny
Przy 100 użytkownikach 875 tur czatu zużywa więcej tokenów wejściowych niż 6 400 kroków AI w workflowach — 55 tys. na turę wobec 6 tys. na krok. Powód jest strukturalny: pętla tool-use w każdej iteracji przesyła od nowa cały statyczny prefiks (prompt systemowy, skille i schematy narzędzi — około 12 tys. tokenów), a iteracji bywa do dwudziestu.
To najważniejsza pojedyncza obserwacja kosztowa w całej analizie: czat, nie przetwarzanie dokumentów, jest kosztowym środkiem ciężkości produktu — i jest to koszt w dużej mierze usuwalny przez prompt caching, gdzie odczyt z pamięci podręcznej kosztuje 0,1× ceny wejścia.
Cennik modeli (USD / 1 mln tokenów)
| Model | Wejście | Wyjście |
|---|---|---|
| Claude Haiku 4.5 — domyślny dla narzędzi | 1,00 | 5,00 |
| Claude Sonnet 5 | 2,00 | 10,00 |
| Claude Sonnet 4.6 — domyślny dla asystenta | 3,00 | 15,00 |
| Claude Opus 4.8 | 5,00 | 25,00 |
Modyfikatory: odczyt z cache 0,1× wejścia · zapis cache 1,25× · Batch API −50 % w zamian za realizację do 24 h.
Jak używać kalkulatora
Kalkulator odpowiada na pytanie „ile to kosztuje przy takich założeniach”. Nie odpowiada na pytanie „ile powinniśmy brać od klienta” — cena powinna wynikać z wartości, a nie z kosztu wytworzenia.
-
Ustaw skalę
Suwak liczby użytkowników albo jeden ze skrótów 10 / 100 / 1000. Pamiętaj, że liczą się aktywne miejsca — osoby, które rzeczywiście uruchamiają procesy w danym miesiącu.
-
Skoryguj profil użycia
Uruchomienia na użytkownika, liczba node'ów i udział kroków AI to trzy parametry, które najmocniej zmieniają wynik po stronie popytu. Jeśli znasz realne dane z produkcji — wpisz je zamiast wartości domyślnych.
-
Zdecyduj o modelu AI
Wybór modelu i adopcja asystenta mają ~2,5× większy wpływ na rachunek niż podwojenie ruchu. Włącz prompt caching i sprawdź BYO-key, żeby zobaczyć widełki między najgorszym a najlepszym wariantem.
-
Wybierz architekturę
Sekcja „Infrastruktura”: dostawca, wysoka dostępność, rabat CUD. Tabela dostawców przelicza się dla tych samych założeń, więc porównanie jest uczciwe — różni je wyłącznie infrastruktura, bo tokeny są identyczne wszędzie.
-
Sprawdź marżę i wyeksportuj
Wpisz rozważaną cenę za miejsce i zobacz marżę brutto oraz próg rentowności. Na koniec Pobierz dokument .docx — dostaniesz gotowy materiał z bieżącymi ustawieniami.
Trzy gotowe przepisy
„Ile kosztuje pilotaż dla jednego klienta?”
10–25 userów · dostawca VPS / Coolify · HA wyłączone · BYO-key 100 %. Zobaczysz najniższy realny koszt wejścia — to liczba do rozmowy o darmowym albo tanim pilotażu.
„Czy cena X za miejsce się broni?”
Ustaw docelową skalę · GCP Cloud Run · HA włączone · wpisz cenę w sekcji waluty. Panel marży pokaże próg rentowności i to, ile trzeba wziąć dla 60 i 80 % marży brutto.
„Co jeśli wszyscy pokochają asystenta?”
Adopcja asystenta 100 % · tury 50 · model Opus 4.8. To scenariusz stresowy — porównaj go z bazowym, żeby wiedzieć, ile miejsca zostawić w cenie i gdzie ustawić miesięczne limity tokenów.
Co zawiera dokument .docx
- Metrykę scenariusza — datę, skalę, architekturę, walutę i kurs
- Podsumowanie: rachunek miesięczny i roczny, koszt na użytkownika i na uruchomienie
- Pełne rozbicie kosztów pozycja po pozycji, z udziałem procentowym
- Komplet założeń, na których policzono wynik — żeby dało się go odtworzyć
- Porównanie sześciu wariantów wdrożenia przy tych samych założeniach
- Analizę marży przy zadanej cenie oraz progi dla 60 i 80 % marży brutto
- Dźwignie optymalizacyjne z policzoną oszczędnością
- Notę metodyczną ze źródłami cen i listą uproszczeń
Zanim wyślesz to dalej
Dokument opisuje koszt techniczny wytworzenia usługi (COGS), a nie pełny rachunek wyników — nie ma w nim kosztów zespołu, sprzedaży, zgodności ani licencji.
Liczby są estymatami opartymi na założeniach, nie pomiarem produkcji. Po trzech miesiącach realnego ruchu wszystkie parametry z sekcji „Skala i użycie” należy zmierzyć i przeliczyć model na danych — wszystkie potrzebne zdarzenia platforma już zapisuje.