Om du fortfarande övervakar varje steg din AI-agent tar, läser varje kodrad och manuellt kopierar in felmeddelanden, litar du inte ännu på agenten.

Du hade inte hängt över axeln på en kollega och granskat varje tangenttryckning. Du hade gett hen en uppgift och sedan granskat en färdig pull request. Att arbeta med en agent bör fungera likadant: ge den uppgiften, peka mot relevant kontext och låt den arbeta. Agenten kan köra projektet, hitta sina egna misstag och iterera tills den har bevis för att lösningen fungerar.

Under tiden arbetar du med något annat. Du kommer tillbaka till en pull request som är redo att granskas.

Förtroendet är det som står mellan dig och de produktivitetsvinster som alla pratar om.

Flaskhalsen är inte modellen. Det är miljön runt den.

Förtroende är något man förtjänar. Det kan finnas goda skäl till att du inte litar på dina agenter ännu. Det kan också vara så att du aldrig har gett dem chansen. Ge i så fall agenten din nästa uppgift, släpp tangentbordet och se vad som händer. Du kanske blir överraskad.

Jag började koda med AI för över två år sedan, när Cursor mest kunde autokomplettera och skriva avgränsade kodstycken. Då var det rätt att läsa varje rad. Verktyget kunde varken köra koden eller kontrollera sitt eget arbete, så det fick jag göra. Sedan dess har AI utvecklats enormt och verktygen vuxit förbi autokomplettering. Agenterna kan köra, testa och rätta sig själva, men vanan att övervaka sitter ofta kvar.

När resultatet inte håller är det sällan för att AI-modellen inte är tillräckligt smart. Dagens bästa modeller är intelligenta nog för det mesta av det arbete de flesta av oss gör, så länge de har verktygen för det. När du inte kan lita på agentens arbete är det systemet runt agenten du behöver laga.

Målet är att ta bort dig själv som flaskhals i agentens livscykel. Fem saker tar dig en bra bit på vägen:

  • Lokal miljö. Agenten ska själv kunna starta projektet lokalt, med alla beroenden och verktyg du använder.
  • Läsbara spår. Dina processer ska lämna loggar eller andra artefakter som agenten kan tolka.
  • Extern kontext. Ge agenten verktyg för att hämta information från ärendehantering, dokumentation och ändringshistorik.
  • Verifiering. Bygg verktyg som låter agenten verifiera sitt eget arbete.
  • Guardrails. Sätt gränser så att agenten kan göra samma saker som du, utan att riskera destruktiva eller dyra misstag.

När miljön är redo behöver du inte längre mata agenten med felmeddelanden och diagnostik. Den hämtar det själv och tar fram bevis för att lösningen fungerar. Istället för att du och agenten bollar fram och tillbaka sköter den båda rollerna. Den itererar tills felmeddelandena är borta och den kan bevisa att uppgiften är löst.

Börja med att låta agenten intervjua din kodbas

Det viktigaste att börja med är att agenten ska kunna verifiera sitt eget arbete. Det enklaste sättet dit är att be agenten intervjua din miljö, oftast en kodbas.

Låt agenten svara på följande och skriva ner svaren:

  • Yta: vad i produkten interagerar en användare faktiskt med? En webbapp, ett dataset, ett API, en mobilapp, en desktopapp, ett bibliotek?
  • Körning: hur körs tjänsten lokalt? Leta i intern dokumentation, package-scripts, Makefile och README-filer. Finns inget där, fråga människan hur tjänsten testas lokalt.
  • Styrning: hur kan en agent styra den lokala tjänsten programmatiskt? Finns det redan Playwright-tester, skript eller endpoints, återanvänd eller kapsla in dem. Finns inget, hitta ett sätt att styra tjänsten med kommandon och gör om dem till ett återanvändbart CLI som går att bygga ut.
  • Observation: vilka bevis går att fånga när tjänsten körs? Loggar, skärmdumpar, transkript, databasens tillstånd? Ju fler, desto bättre.
  • Isolering: kan flera instanser av tjänsten köras parallellt utan att skriva över eller förstöra varandras data? Om inte, dokumentera begränsningen tydligt.

Be sedan agenten göra om svaren till en återanvändbar skill med tillhörande verktyg, så att den kan verifiera sitt eget arbete.

När skillen är klar ger du agenten en uppgift som du redan kan svaret på. Be den lösa uppgiften och verifiera resultatet. Jämför med det kända svaret och be agenten visa bevis för att implementationen är korrekt.

Gick allt bra har du tagit ett stort steg mot mer självständiga agenter. Om inte, fråga vad som gick fel och vilka verktyg, vilken åtkomst eller vilken information som saknades. Ordna det som saknades och uppdatera skillen. Upprepa tills resultatet håller och det finns bevis som backar upp det.

Pålitligt först. Snabbt kommer sedan.

Fart är det du får när arbetet är pålitligt nog för att du ska slippa sitta barnvakt.

Med miljön på plats växer förtroendet snabbt. Du lämnar över fler uppgifter, och agenterna arbetar längre på egen hand eftersom de kan iterera tills jobbet är klart. Du behövs inte längre för att verifiera varje steg eller fylla på med kontext.

Då har du plötsligt tid över. Det är här produktivitetsvinsterna blir verkliga. Vad gör du med tiden?

  • Lyft blicken från koden. Agenten knackar koden. Du tänker igenom viktiga beslut och arbetar på systemet istället för detaljerna i det.
  • Kör fler agenter parallellt. En agent som inte behöver dig kan få sällskap av en till.
  • Förbättra miljön ytterligare. Varje förbättring gör att alla framtida agenter klarar mer och gör det bättre.
  • Luta dig tillbaka. En välförtjänt paus är också helt okej.

Oavsett vad du väljer ligger förbättringarna kvar. Miljön du byggde för att kunna lita på dina agenter försvinner inte när uppgiften är klar, och den kan användas av hela teamet. Vem som helst kan starta en egen agent i samma kodbas, och den kan verifiera sitt eget arbete utan att en människa behöver gripa in.

Tiden du sparar kan gå tillbaka in i miljön. Då ökar vinsten för varje uppgift.