AIOps & felsökning

Automatiserad root cause analysis i en körning

En AI-agent som genererar sina egna utredningsflöden, kör dem via en kontrollerad MCP-server och levererar root cause plus åtgärdsförslag, samma resultat varje gång.

En körningSjälvgenererande skillsRead-only exekveringRepeterbartUtbyggbart
Vad får du ut
Hela utredningen i en körning, incident in, root cause ut.
Read-only exekvering, isolerade secrets, full logg.
Nya system kopplas på som skills, inte som projekt.
1
körning från incident till svar
6
system utreds automatiskt
100%
read-only, inget rörs i drift
Alltid
samma analys, oavsett vem som kör
Problemet

Manuell felsökning över flera system är seg och inkonsekvent. Samma incident utreds olika beroende på vem som tittar, och korreleringen mellan kluster, moln och GitOps sker i huvudet på en stressad person.

  • Utredningen tar timmar när själva svaret finns i tre API-anrop.
  • Två personer på samma incident når två olika slutsatser.
  • Ingen dokumenterad kedja från symptom till root cause, analysen går inte att upprepa.
  • Kunskapen stannar hos den som råkade lösa det förra gången.
Så funkar det

Från incident till root cause.

Ett flöde, en körning. Ingen hoppar mellan fem verktyg.

01

Ta emot incidenten

Agenten (Claude Code) får incidentbeskrivningen och avgör vilka system som behöver undersökas.

02

Generera skills

Agenten skriver sin egen kod, utredningsflöden som skills, anpassade efter just den här incidenten.

03

Kör isolerat

Skillet körs read-only i en Podman-container via FastMCP-servern, med secrets injicerade utanför agentens kontext.

04

Anropa systemen

Kontrollerade API-anrop mot AWS, EKS, ArgoCD och GitHub, aldrig direktaccess från agenten.

05

Strukturerat svar

Resultatet returneras strukturerat: root cause, bevisning och föreslagna åtgärder i en och samma körning.

Det här kopplas in
Kubernetes (EKS)GitOps (ArgoCD)Källkod & manifestContainer & imagesNätverk & accessMiljöskillnader

Agenten når aldrig er infrastruktur direkt. All exekvering sker read-only via MCP-servern.

Skillnaden

Före och efter.

Så ser det ut idag
  • Timmar av manuell felsökning i tre olika konsoler.
  • Två personer, två slutsatser, ingen dokumentation.
  • Drift mellan dev och prod upptäcks av en slump.
  • Nytt system = nytt integrationsprojekt.
Så ser det ut med lösningen
  • Hela utredningen körs i ett svep och sammanfattas.
  • Root cause med bevis, spårbart och repeterbart.
  • Miljöskillnader jämförs automatiskt vid varje körning.
  • Nytt system = en ny skill, inkopplad på dagar.
Effekten

Vad det ger i drift.

  • Kortare väg från incident till root cause.
  • Samma analys varje gång, oberoende av vem som är på jour.
  • Ingen manuell korrelering mellan verktyg och domäner.
  • Nya system kopplas på som modulära skills, inte som nya integrationsprojekt.
Exempel på fynd
Konfigurationsavvikelser mellan miljöerFelaktiga image-taggar och deployment-felArgoCD out-of-sync och konfigurationsdriftNätverks- och åtkomstproblemSecurity groups som blockerar trafikOverlay-fel mellan dev och prod
Så hålls det säkert

Agenten gissar inte

Den exekverar, varje slutsats bygger på faktiskt hämtad data från systemen.

Ingen direktaccess

All åtkomst går via MCP-servern med tydligt avgränsade behörigheter.

Isolerade secrets

Hemligheter injiceras i containern, aldrig in i agentens kontext.

Modulärt utbyggbart

Nya målsystem, molnleverantörer, tredjeparts-API:er, interna verktyg, läggs till som skills.

Stacken

Verktyg vi litar på.

Claude CodeMCPFastMCPPodmanPython 3.11AWS EKSArgoCDGitHubECRKustomize
Skillnaden är inte att agenten är smartare än oss. Det är att den gör exakt samma sak varje gång och aldrig hoppar över steg tre för att det känns tråkigt.
Emilija Trpchevska
Emilija Trpchevska
DevOps Consultant · Stockholm
Kundcase
1 körning
hela analysen
Viaplay

Mönstret började som ett demo-case i en DevSecOps-miljö med EKS, ArgoCD och GitOps-manifest, men är direkt applicerbart i skarp drift. I hybridmiljöer som Viaplays, där en incident nästan alltid spänner över kluster, moln och GitOps, gör agenten hela genomgången i ett svep och lämnar ifrån sig root cause, bevis och nästa steg.

Läs hela caset
Se den live

Boka en demo av automatiserad root cause analysis i en körning

30 minuter, digitalt. Vi visar lösningen i praktiken och vad den skulle göra i just er miljö, utan säljpitch.