Rachunek za DocCompankoszty chmury
DocCompan · analiza kosztu wytworzenia usługi

Ile kosztuje utrzymanie DocCompan w chmurze

Model rozdziela rachunek na dwie części, które zachowują się zupełnie inaczej: infrastrukturę — stałą, skokową i negocjowalną — oraz tokeny modelu AI — zmienną, rosnącą liniowo i sterowaną decyzjami produktowymi. Przesuń suwaki, a policzy się wszystko: rachunek miesięczny, koszt na użytkownika, marża przy zadanej cenie za miejsce i porównanie sześciu wariantów wdrożenia.

ceny listowe z 2026-08-31 NBP 1 USD = 3,7314 zł GCP · AWS · Azure · VPS
10 użytkowników
282 USD
28,18 USD na osobę · 90 % to koszt stały
100 użytkowników
891 USD
8,91 USD na osobę · AI to 32 % rachunku
1000 użytkowników
4 665 USD
4,67 USD na osobę · AI to 60 % rachunku
Narzędzie

Kalkulator

Wszystkie założenia są suwakami — żadna liczba nie jest zaszyta na sztywno. Zmiana dowolnego parametru przelicza cały rachunek, wykres, porównanie dostawców i marżę. Gotowe ustawienia wyeksportujesz do dokumentu Worda.

Założenia

Skala i użycie
100
Aktywne miejsca (seat) — osoby, które w danym miesiącu faktycznie uruchamiają workflow.
40
8
25 %
Reszta to kroki deterministyczne — parsowanie, join, kalkulacje, eksport. Zero tokenów.
20 %
Identyczne wejście nie jest liczone drugi raz (artefakty content-addressed).
Model AI i tokeny
6 000
700
35 %
25
55 000
Pętla tool-use przesyła w każdej iteracji cały statyczny prefiks: prompt + skille + schematy narzędzi ≈ 12 tys. tokenów.
Prompt caching w asystencie
0 %
Ich tokeny znikają z naszego rachunku — mechanizm już jest w produkcie.
0 %
−50 % ceny w zamian za czas realizacji do 24 h. Tylko dla runów planowanych.
Infrastruktura
Wysoka dostępność (HA)
8 %
Monitoring, logi, rejestr obrazów, kopie zapasowe, sekrety.
Waluta i cena za miejsce
Domyślnie kurs NBP z 2026-08-31.
29

Rachunek miesięczny

GCP · Cloud Run + Cloud SQL (HA)
Razem / mies.
Na użytkownika
Udział tokenów AI
Jedno uruchomienie

Z czego składa się rachunek

udział w koszcie miesięcznym
Infrastruktura Tokeny — node'y AI Tokeny — asystent

Koszt na użytkownika w funkcji skali

te same założenia · oś Y: USD / mies.
Infrastruktura na użytkownika Tokeny AI na użytkownika

Dostawcy przy tych samych założeniach

WariantInfrastrukturaRazemNa usera

Tokeny AI są identyczne u każdego dostawcy — różni je wyłącznie infrastruktura.

Marża przy cenie za miejsce

Co dalej

dźwignie policzone dla bieżących ustawień
DźwigniaOszczędność / mies.Zmiana

Każda dźwignia liczona osobno, wobec bieżących ustawień. Nie sumują się wprost — część zachodzi na siebie.

Cennik źródłowy (JSON) Dokument zawiera bieżące ustawienia, pełne rozbicie kosztów, porównanie dostawców, analizę marży i notę metodyczną.
Wynik bazowy

Trzy progi skali

Scenariusz bazowy: GCP europe-central2 (Warszawa), Cloud Run + Cloud SQL, ceny listowe, tokeny na naszym kluczu. Próg 10 użytkowników bez wysokiej dostępności, progi 100 i 1000 z HA.

Pozycja10 userów100 userów1000 userów
Infrastruktura254 USD610 USD1 860 USD
Tokeny AI — node'y w workflowach10 USD103 USD1 034 USD
Tokeny AI — asystent czatowy18 USD177 USD1 772 USD
Razem miesięcznie282 USD891 USD4 665 USD
Razem miesięcznie (PLN)1 051 zł3 324 zł17 408 zł
Na użytkownika28,18 USD8,91 USD4,67 USD
Koszt jednego uruchomienia0,70 USD0,22 USD0,12 USD
Udział tokenów AI10 %32 %60 %

Cztery wnioski, które zmieniają decyzje

  1. Chmura zarządzana ma podłogę ~250 USD/mies. — niezależnie od tego, czy userów jest 3 czy 30. Przy 10 użytkownikach 90 % rachunku to koszt, który i tak by stał. Dzisiejszy VPS kosztuje w tym scenariuszu 48 USD łącznie z tokenami — 5,8× mniej.
  2. Koszt AI na użytkownika jest stały: 2,81 USD/mies. i nie maleje ze skalą. To jedyny składnik rosnący liniowo. Przy 1000 userów tokeny to 60 % rachunku — czyli przy skali o marży decyduje produkt, a nie DevOps.
  3. Koszt na użytkownika spada 6× między 10 a 1000 miejsc. Próg, na którym chmura zarządzana przestaje boleć, to okolice 60–80 płacących użytkowników.
  4. Trzy dźwignie ścinają ~45 % rachunku przy 100 userach i żadna nie wymaga zmiany dostawcy: prompt caching w asystencie (−8,7 %), tańszy model (−18 %), własny klucz klienta (−31,5 %).

Rekomendacja

GCP, region europe-central2 (Warszawa), Cloud Run + Cloud SQL — wdrażane etapami.

Czysto cenowo AWS jest tańszy o 13 % przy 100 userach i o 18 % przy 1000. Mimo to rekomendujemy GCP, bo AWS nie ma regionu w Polsce, a w wertykałach, w które celujemy — farmacja, finanse, medycyna, sektor publiczny — „dane nie opuszczają Polski” jest argumentem sprzedażowym wartym więcej niż różnica w rachunku.

Ścieżka

  • do ~50 userów — VPS + Coolify, stan obecny, 48–160 USD/mies.
  • 50–150 — Cloud Run + Cloud SQL bez HA, 460–790 USD
  • 150–800 — HA regionalne i replika odczytu, 900–1 500 USD
  • 800+ — GKE Autopilot albo Cloud Run z rabatem CUD

Nie migrujemy „bo chmura”. Migrujemy, gdy pojawi się pierwszy klient płacący za SLA albo wymagający rezydencji danych i audytu.

Metodyka

Jak to jest policzone

Model jest świadomie przejrzysty, nie „dokładny do centa”. Każdy krok da się prześledzić i podważyć osobno, a wpływ błędnego założenia pokazuje analiza wrażliwości wbudowana w kalkulator.

Zasada: popyt → zasoby → cennik

Trzy stopnie, każdy do podważenia niezależnie od pozostałych:

założenia o zachowaniu użytkownika │ × liczba użytkowników ▼ popyt: uruchomienia, node'y, tokeny, sekundy CPU, GB │ ÷ wydajność jednostki, × współczynnik szczytu ▼ zasoby: vCPU, GiB RAM, GB dysku, GB transferu │ × cena jednostkowa dostawcy ▼ koszt miesięczny

Skąd pochodzą ceny

Wszystkie stawki jednostkowe zostały pobrane programowo z publicznych API cennikowych, nie przepisane ze stron marketingowych ani odtworzone z pamięci:

  • Google Cloud — Cloud Billing Catalog API, region europe-central2 (Warszawa)
  • AWS — AWS Price List API, region eu-central-1 (Frankfurt — AWS nie ma regionu w Polsce)
  • Azure — Azure Retail Prices API, region polandcentral
  • Anthropic — cennik Claude API (first-party), USD za 1 mln tokenów
  • Kurs — NBP tabela A nr 168/A/NBP/2026: 1 USD = 3,7314 PLN

Ceny są listowe, on-demand, netto. Faktury Google Cloud EMEA idą na odwrotne obciążenie, więc dla czynnego podatnika VAT kwota netto jest kosztem docelowym. Rabaty wolumenowe nie są wliczone w scenariusz bazowy — są dostępne jako opcja w kalkulatorze.

Pełny cennik z podanym źródłem każdej pozycji: pricing-2026-08.json. Kod modelu: cost_model.py.

Definicja „użytkownika”

Jedno aktywne miejsce (seat) — osoba, która w danym miesiącu faktycznie uruchamia workflow. Konta założone i nieużywane nie generują ani obciążenia, ani kosztu, i w modelu ich nie ma. „1000 userów” oznacza tysiąc osób pracujących na platformie, a nie tysiąc rekordów w bazie.

Co właściwie hostujemy

Pięć źródeł kosztu, każde o innej charakterystyce skalowania:

  • Backend (Django + daphne) — REST API i WebSockety ze statusami runów na żywo. Musi stać 24/7; długożyjących połączeń nie da się rozliczać per żądanie.
  • Workery Celery — wykonanie node'ów. Node AI blokuje slot workera na czas odpowiedzi API, prawie nie zużywając CPU — to równoległość, nie moc, wyznacza ich liczbę.
  • PostgreSQL + pgvector — rośnie monotonicznie z liczbą userów i historią. Najdroższa pozycja infrastruktury przy skali.
  • Redis — broker Celery, wyniki i warstwa Channels. Mały wolumen, wymagany 24/7, w wersji zarządzanej zaskakująco drogi.
  • Storage obiektowy — artefakty content-addressed. Poniżej 1 % rachunku.

Trzy rzeczy, które już dziś obniżają koszt

To przewagi wpisane w architekturę, nie optymalizacje do zrobienia:

  1. Przewaga kroków deterministycznych. Model dostaje tylko to, czego regułą zrobić się nie da — w scenariuszu bazowym 2 z 8 node'ów.
  2. Embeddingi liczone lokalnie — deterministyczny embedder plus pgvector, bez płatnego API embeddingów. Cały RAG kosztuje CPU i dysk, zero tokenów.
  3. Cache wykonania po treści — identyczne wejście nie jest liczone drugi raz, co ścina i tokeny, i CPU.

Do tego twarde bezpieczniki w kodzie: budżet tokenów na wywołanie narzędzia, budżet na turę czatu i miesięczny limit per użytkownik z twardą blokadą.

Czego model świadomie nie liczy

  • Ruchu w skali doby — używamy okna roboczego 176 h/mies. i mnożnika szczytu 3× zamiast symulacji kolejkowej.
  • Sezonowości — końce miesiąca u księgowych, kwartały w planowaniu. Piki 2–3× w kilku dniach.
  • Kosztów jednorazowych — migracja, testy obciążeniowe, transfer danych.
  • Kosztów zespołu utrzymania — przy ścieżce zarządzanej ~0,2 FTE, przy self-hosted ~0,5 FTE. Przy stawkach rynkowych ta różnica przewyższa całą oszczędność na infrastrukturze przy 100 userach.
  • Narzut operacyjny (monitoring, logi, rejestr obrazów, backupy, sekrety) modelujemy ryczałtem 8 %, a nie pozycja po pozycji.

Ograniczenie, które wycina połowę opcji: WebSockety

DocCompan streamuje statusy node'ów i odpowiedzi asystenta przez Django Channels. To oznacza długożyjące połączenia, więc klasyczny „serverless per żądanie” — Cloud Run w rozliczeniu request-based, Lambda, Azure Functions — nie pasuje: połączenie trwa minuty, nie milisekundy.

Backend musi mieć minimum jedną instancję zawsze aktywną, dlatego w modelu użyliśmy rozliczenia instancyjnego Cloud Run, a nie tańszego z pozoru request-based. To podnosi podłogę kosztową, ale jest ceną za funkcję, która sprzedaje produkt.

DocCompan jest lekki obliczeniowo

Przy 1000 użytkowników to 40 000 uruchomień miesięcznie — około 63 na godzinę w oknie roboczym, czyli 0,14 node'a na sekundę. Nawet z trzykrotnym zapasem na szczyt dwa vCPU workerów obsługują tysiąc użytkowników.

To nie jest błąd modelu, tylko konsekwencja architektury: ciężką pracę wykonuje model AI po drugiej stronie sieci, a nasze workery głównie czekają. Dlatego nie ma sensu kupować dużych maszyn, a najdroższym zasobem staje się baza danych.

Gdzie naprawdę idą tokeny

Przy 100 użytkownikach 875 tur czatu zużywa więcej tokenów wejściowych niż 6 400 kroków AI w workflowach — 55 tys. na turę wobec 6 tys. na krok. Powód jest strukturalny: pętla tool-use w każdej iteracji przesyła od nowa cały statyczny prefiks (prompt systemowy, skille i schematy narzędzi — około 12 tys. tokenów), a iteracji bywa do dwudziestu.

To najważniejsza pojedyncza obserwacja kosztowa w całej analizie: czat, nie przetwarzanie dokumentów, jest kosztowym środkiem ciężkości produktu — i jest to koszt w dużej mierze usuwalny przez prompt caching, gdzie odczyt z pamięci podręcznej kosztuje 0,1× ceny wejścia.

Cennik modeli (USD / 1 mln tokenów)

ModelWejścieWyjście
Claude Haiku 4.5 — domyślny dla narzędzi1,005,00
Claude Sonnet 52,0010,00
Claude Sonnet 4.6 — domyślny dla asystenta3,0015,00
Claude Opus 4.85,0025,00

Modyfikatory: odczyt z cache 0,1× wejścia · zapis cache 1,25× · Batch API −50 % w zamian za realizację do 24 h.

Instrukcja

Jak używać kalkulatora

Kalkulator odpowiada na pytanie „ile to kosztuje przy takich założeniach”. Nie odpowiada na pytanie „ile powinniśmy brać od klienta” — cena powinna wynikać z wartości, a nie z kosztu wytworzenia.

  1. Ustaw skalę

    Suwak liczby użytkowników albo jeden ze skrótów 10 / 100 / 1000. Pamiętaj, że liczą się aktywne miejsca — osoby, które rzeczywiście uruchamiają procesy w danym miesiącu.

  2. Skoryguj profil użycia

    Uruchomienia na użytkownika, liczba node'ów i udział kroków AI to trzy parametry, które najmocniej zmieniają wynik po stronie popytu. Jeśli znasz realne dane z produkcji — wpisz je zamiast wartości domyślnych.

  3. Zdecyduj o modelu AI

    Wybór modelu i adopcja asystenta mają ~2,5× większy wpływ na rachunek niż podwojenie ruchu. Włącz prompt caching i sprawdź BYO-key, żeby zobaczyć widełki między najgorszym a najlepszym wariantem.

  4. Wybierz architekturę

    Sekcja „Infrastruktura”: dostawca, wysoka dostępność, rabat CUD. Tabela dostawców przelicza się dla tych samych założeń, więc porównanie jest uczciwe — różni je wyłącznie infrastruktura, bo tokeny są identyczne wszędzie.

  5. Sprawdź marżę i wyeksportuj

    Wpisz rozważaną cenę za miejsce i zobacz marżę brutto oraz próg rentowności. Na koniec Pobierz dokument .docx — dostaniesz gotowy materiał z bieżącymi ustawieniami.

Trzy gotowe przepisy

„Ile kosztuje pilotaż dla jednego klienta?”

10–25 userów · dostawca VPS / Coolify · HA wyłączone · BYO-key 100 %. Zobaczysz najniższy realny koszt wejścia — to liczba do rozmowy o darmowym albo tanim pilotażu.

„Czy cena X za miejsce się broni?”

Ustaw docelową skalę · GCP Cloud Run · HA włączone · wpisz cenę w sekcji waluty. Panel marży pokaże próg rentowności i to, ile trzeba wziąć dla 60 i 80 % marży brutto.

„Co jeśli wszyscy pokochają asystenta?”

Adopcja asystenta 100 % · tury 50 · model Opus 4.8. To scenariusz stresowy — porównaj go z bazowym, żeby wiedzieć, ile miejsca zostawić w cenie i gdzie ustawić miesięczne limity tokenów.

Co zawiera dokument .docx

  • Metrykę scenariusza — datę, skalę, architekturę, walutę i kurs
  • Podsumowanie: rachunek miesięczny i roczny, koszt na użytkownika i na uruchomienie
  • Pełne rozbicie kosztów pozycja po pozycji, z udziałem procentowym
  • Komplet założeń, na których policzono wynik — żeby dało się go odtworzyć
  • Porównanie sześciu wariantów wdrożenia przy tych samych założeniach
  • Analizę marży przy zadanej cenie oraz progi dla 60 i 80 % marży brutto
  • Dźwignie optymalizacyjne z policzoną oszczędnością
  • Notę metodyczną ze źródłami cen i listą uproszczeń

Zanim wyślesz to dalej

Dokument opisuje koszt techniczny wytworzenia usługi (COGS), a nie pełny rachunek wyników — nie ma w nim kosztów zespołu, sprzedaży, zgodności ani licencji.

Liczby są estymatami opartymi na założeniach, nie pomiarem produkcji. Po trzech miesiącach realnego ruchu wszystkie parametry z sekcji „Skala i użycie” należy zmierzyć i przeliczyć model na danych — wszystkie potrzebne zdarzenia platforma już zapisuje.