Inżynieria platform i DevOps wraz z bieżącym utrzymaniem tego, co budujemy
Platformy Kubernetes, chmurowe i CI/CD zaprojektowane z myślą o niezawodnym działaniu, a następnie przez nas obsługiwane: wspólne dyżury on-call, SLO, kontrola kosztów i konkretna osoba odpowiedzialna za dostępność. Tworzone dla platform, które muszą wytrzymać szczyty ruchu w trakcie promocji, procesy akceptacji wdrożeń i zadeklarowane zobowiązania dotyczące dostępności.
Sygnały, że platforma nie jest w pełni pod kontrolą
Zanim przejdziemy do czegokolwiek innego, to jedno pytanie zwykle pokazuje, czy platforma jest faktycznie pod kontrolą. Sześć sygnałów, że odpowiedź nie jest jeszcze wystarczająco dobra:
WŁAŚCICIEL
Brak imiennego właściciela. Za niezawodność odpowiada ten, kto akurat jest online – co staje się zastrzeżeniem audytowym, gdy audytor po raz pierwszy zapyta, kto za to odpowiada.
KOSZTY
Niekontrolowany wzrost kosztów. Wydatki na chmurę rosną szybciej niż jej wykorzystanie i nie da się ich przypisać do konkretnego rynku, marki czy linii biznesowej.
DRYF
Cichy dryf konfiguracji. Kod infrastruktury i rzeczywistość rozjechały się, więc nie da się udowodnić, że środowisko jest skonfigurowane zgodnie z założeniami.
PROCES
Reagowanie na incydenty oparte na wiedzy plemiennej. Naprawy zależą od tego, kto pamięta, co zrobiono ostatnio, a przygotowanie raportu poincydentalnego zajmuje wiele dni.
WYDANIA
Kruche wydania. Wdrożenia wydają się ryzykowne, a nie rutynowe, a okresy zamrożenia zmian ciągle się wydłużają.
WIDOCZNOŚĆ
Awarie wykrywane przez klientów. Dashboardy dowiadują się o problemie po użytkownikach – zwykle w godzinach największego ruchu sprzedażowego.
Żadnego z tych problemów nie da się rozwiązać za jednym zamachem. Traktowanie tego jak jednego projektu zwykle kończy się tym, że stare ryzyka wciąż są aktywne, a na nie nakładają się nowe. Dlatego pracujemy etapami – przez kolejne punkty kontrolne, z których każdy samodzielnie zamyka konkretną lukę. Zazwyczaj to jedyne sensowne podejście tam, gdzie wydania wymagają akceptacji lub platforma jest objęta zobowiązaniem dotyczącym dostępności.
Jak zwykle przebiega współpraca – od oceny do pełnej obsługi
Każdy z poniższych kroków to realny punkt, w którym można się zatrzymać. Współpraca może zakończyć się na dowolnym szczeblu, a platforma i tak będzie wymiernie łatwiejsza w utrzymaniu niż wcześniej. Ta drabina opisuje, jak daleko sięga relacja. To, po czym faktycznie się wspina, to trzy warstwy działające pod spodem – każda z własnymi rodzajami awarii i każda wymagająca kogoś, kto za nią odpowiada. Dowiedz się więcej podczas rozmowy z naszymi inżynierami.
1
Ocena
Przegląd działającej architektury, IaC, pipeline'ów, organizacji dyżurów i kosztów chmury w odniesieniu do tego, co faktycznie dzieje się na produkcji – w tym sposobu zatwierdzania zmian i nadawania dostępów. Efekt – rejestr ryzyk z priorytetami i rzeczywisty punkt odniesienia dla niezawodności
2
Fundamenty
Infrastruktura ustandaryzowana jako kod, zrównane środowiska, a CI/CD przebudowane w ścieżkę, której zespoły ufają. Efekt – powtarzalna infrastruktura i jeden sposób wdrażania
3
Obserwowalność
SLO zdefiniowane w odniesieniu do rzeczywistego wpływu na użytkowników, wdrożona telemetria, alerty powiązane z runbookami, a okresy szczytowej sprzedaży zamodelowane, a nie zakładane. Efekt – incydenty wykrywane przez monitoring, zanim zauważą je klienci
4
Obsługa
Wspólne dyżury, dowodzenie incydentami, kontrola wydajności i kosztów: współobsługa lub pełne zarządzanie. Efekt – platforma z imiennym właścicielem i wspólnym grafikiem dyżurów
5
Optymalizacja
Koszty, wydajność i poziom bezpieczeństwa weryfikowane w stałym rytmie, a nie tylko w sytuacji kryzysowej, z kosztami przypisanymi do zespołu, rynku lub marki. Efekt – platforma, która jest ulepszana według harmonogramu
Co faktycznie obejmuje stack platformowy, który obsługujemy
Połączenie tych trzech warstw zmienia przede wszystkim jedno: kto pierwszy zauważa, że coś poszło nie tak, i co dzieje się w kolejnych minutach.
Kubernetes, chmurowe landing zones i infrastruktura jako kod, projektowane z myślą o tym, jak platforma będzie działać w trzecim roku. Topologie wieloregionowe tam, gdzie wymagana jest rezydencja danych.
Projektowanie klastrów EKS / AKS
Topologie multi-tenant i wieloregionowe
Biblioteki modułów Terraform
Zdalny stan i kontrola dryfu konfiguracji
Projektowanie IAM według zasady najmniejszych uprawnień i rozdział obowiązków
Przeglądy zgodne z Well-Architected

JTI: obsługa globalnej infrastruktury chmurowej na produkcji
Globalne, wieloregionowe, regulowane środowisko; co zostało zbudowane i jest obecnie przez nas obsługiwane; potwierdzone rezultaty w zakresie niezawodności, kosztów i reagowania na incydenty.

Co się zmienia, gdy odpowiedzialność za dyżury przechodzi na nas
To nie jest hipotetyczny model działania. Tak na co dzień wygląda już kilka środowisk produkcyjnych.
Za niezawodność odpowiada ten, kto akurat jest online
Imiennie wskazany zespół, wspólne dyżury i SLO z przypisanym właścicielem
Zmiany w infrastrukturze wprowadzane ręcznie, po cichu
Wszystko jako kod, a dryf konfiguracji wykrywany automatycznie
Koszty rosną i nikt nie potrafi wyjaśnić dlaczego
Koszty powiązane z wykorzystaniem i limitami, widoczne w podziale na zespoły, rynki lub marki
Incydenty żyją w pamięci organizacji, a nie w dokumentacji, którą można przedstawić na żądanie
Runbooki i postmortemy: udokumentowany plan działania
Bezpieczeństwo dodawane po fakcie
Hardening i logi audytowe są częścią projektu
Umów się na bezpłatną konsultację z naszymi ekspertami i CTO
Porozmawiajmy o Twoich obecnych wyzwaniach i sprawdźmy, w czym możemy pomóc.

Sprawdzone na produkcji
- 0+
- środowisk produkcyjnych obsługiwanych w bankowości, FMCG i retailu
- 0%
- dostępności względem uzgodnionych SLO
- 0%
- niższe koszty chmury po przeglądzie FinOps
Platformy obsługiwane dla klientów z branży retail, bankowości i FMCG od 2008 roku
Poziomy współpracy – od pojedynczej oceny po pełną odpowiedzialność
Nie każda organizacja potrzebuje nas w tym samym zakresie – zwykle jest to jasne już po jednej rozmowie. Większość współprac zaczyna się od Projektu lub Usługi zarządzanej i rozszerza się wraz ze wzrostem zaufania.
Masz pytania dotyczące inżynierii platform i DevOps?
Porozmawiajmy o wyzwaniach infrastrukturalnych
Rozmowa techniczna z inżynierami, którzy obsługują platformy produkcyjne w warunkach kontroli zmian, szczytowych obciążeń i audytów.
