Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U fundamentu leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw rejestruje informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten obieg odtwarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.
Sercem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu doradczego agenta. To on interpretuje polecenia użytkownika, dzieli złożone zadanie na drobniejsze podzadania i sugeruje kolejność ich wykonania. Środowisko modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy wymaga precyzyjnych danych spoza swojej pamięci treningowej.
Interesującym składnikiem architektury jest tak zwana pamięć operacyjna, w której agent trzyma kontekst bieżącego zadania. Dzięki niej nie traci wątku nawet wtedy, gdy procedura rozkłada się na wiele etapów i potrzebuje przeskakiwania między różnymi źródłami informacji. To właśnie ta umiejętność odróżnia agenta od prostego skryptu, który wykonuje jedynie z góry zapisaną listę poleceń.
Oddzielną kwestią pozostaje mechanizm ewaluacji własnych działań. Odpowiednio skonstruowany agent potrafi zidentyfikować, że otrzymany wynik odbiega od zamierzonego, i cofnąć się do poprzedniego etapu, by spróbować innej ścieżki. Taka samokorekta zbliża działanie maszyny do ludzkiego nawyku sprawdzania własnej pracy przed jej złożeniem.