Dziennik działań agenta AI — co zapisywać, żeby wiedzieć, co agent zrobił
Pracownik, który popełni błąd, potrafi wyjaśnić, co zrobił i dlaczego. Agent AI tego nie potrafi — chyba że każdy jego krok został zapisany. Dziennik działań to jedyny sposób, żeby po fakcie odpowiedzieć na pytania klienta, audytora czy własnego zespołu: na podstawie jakich informacji agent podjął decyzję, jakie narzędzia wywołał i z jakim skutkiem. Bez niego agent jest czarną skrzynką, a każda reklamacja kończy się zgadywaniem.
Krótka odpowiedź: dziennik agenta powinien zapisywać dla każdego zadania dane wejściowe, kolejne kroki z wywołanymi narzędziami i ich parametrami, wyniki tych wywołań, decyzję końcową oraz informację o udziale człowieka. Wpisy muszą być powiązane z konkretną sprawą, klientem i wersją instrukcji.
Dziennik służy trzem celom: wyjaśnianiu pojedynczych przypadków, mierzeniu jakości w czasie i rozliczalności wobec klientów oraz przepisów.
Po co prowadzić dziennik
W pierwszych tygodniach wdrożenia dziennik wydaje się dodatkiem technicznym. Jego wartość ujawnia się przy pierwszym problemie: klient twierdzi, że dostał błędną informację, handlowiec nie wie, dlaczego zapytanie trafiło do niego, a kierownik pyta, ile spraw agent faktycznie załatwił samodzielnie.
| Sytuacja | Pytanie | Co daje dziennik |
|---|---|---|
| Reklamacja klienta | Co agent odpowiedział i na jakiej podstawie? | Pełny przebieg z użytymi źródłami |
| Błąd w danych | Kto i kiedy zmienił rekord? | Wywołanie narzędzia z parametrami i czasem |
| Ocena wdrożenia | Ile spraw agent obsłużył i jak dobrze? | Statystyki z oznaczeniem wyników |
| Zmiana instrukcji | Czy nowa wersja działa lepiej? | Porównanie wyników przed i po |
| Kontrola lub audyt | Jak system przetwarza dane osobowe? | Udokumentowany przebieg operacji |
| Podejrzenie manipulacji | Czy ktoś próbował skłonić agenta do niedozwolonych działań? | Zapis odmów narzędzi i treści wejściowych |
Co zapisywać
Dziennik agenta różni się od zwykłych logów aplikacji tym, że musi odtworzyć tok rozumowania, a nie tylko zdarzenia techniczne. Minimalny zakres dla każdego zadania obejmuje kilka elementów.
- Identyfikator zadania łączący wszystkie kroki, oraz powiązanie ze sprawą, klientem lub zgłoszeniem.
- Źródło i treść wejścia — wiadomość, formularz, zdarzenie z systemu, które uruchomiło agenta.
- Wersja instrukcji i model użyte w zadaniu — bez tego nie da się porównać wyników po zmianach.
- Każde wywołanie narzędzia z nazwą, parametrami, wynikiem i czasem trwania.
- Odmowy narzędzi — próby działań zablokowanych przez uprawnienia lub walidację.
- Dokumenty lub fragmenty wiedzy, na których oparto odpowiedź.
- Decyzja końcowa — co agent zrobił, komu przekazał sprawę, jaką wiadomość wysłał.
- Udział człowieka — kto zatwierdził, zmienił lub odrzucił propozycję, i jak brzmiała wersja ostateczna.
- Zużycie — liczba kroków i przetworzonych tokenów, przydatne do kontroli kosztów.
Uwaga praktyczna: szczególnie cenne jest zapisywanie różnicy między propozycją agenta a wersją zatwierdzoną przez człowieka. Te poprawki to najlepszy materiał do ulepszania instrukcji — pokazują dokładnie, w czym agent myli się w realnej pracy.
Dziennik a dane osobowe
Pełny dziennik zawiera treści wiadomości, dane klientów i wyniki zapytań do systemów. To oznacza, że sam staje się zbiorem danych osobowych, który trzeba chronić tak samo jak system źródłowy.
- Okres przechowywania ustalony i egzekwowany automatycznie — szczegółowe wpisy krócej, zanonimizowane statystyki dłużej.
- Ograniczony dostęp — przegląd dziennika to uprawnienie dla określonych osób, a nie dla całego zespołu.
- Maskowanie danych wrażliwych tam, gdzie nie są potrzebne do analizy, na przykład numerów dokumentów.
- Brak haseł i kluczy w dzienniku — parametry narzędzi muszą być filtrowane przed zapisem.
- Uwzględnienie w dokumentacji zgodności i w odpowiedzi na żądanie usunięcia danych.
Szerzej o obowiązkach wynikających z przetwarzania danych przy wdrożeniach AI piszemy w tekście o AI a RODO.
Jak przeglądać dziennik
Dziennik, którego nikt nie czyta, chroni tylko w razie sporu. Żeby pomagał ulepszać agenta, potrzebny jest regularny, zorganizowany przegląd.
| Rodzaj przeglądu | Częstotliwość | Zakres |
|---|---|---|
| Losowa próbka spraw | Co tydzień | Kilkanaście zadań oceniane ręcznie |
| Sprawy z poprawkami człowieka | Co tydzień | Wszystkie przypadki odrzucenia lub zmiany propozycji |
| Odmowy narzędzi i przekroczenia limitów | Na bieżąco, z alertem | Każdy przypadek |
| Statystyki jakości | Co miesiąc | Trendy trafności, eskalacji, czasu obsługi |
| Porównanie wersji instrukcji | Po każdej zmianie | Wyniki przed i po |
Przegląd powinien kończyć się decyzjami: poprawką instrukcji, dodaniem przypadku do zestawu testowego, zmianą uprawnień albo przeniesieniem typu spraw do trybu samodzielnego lub z powrotem do zatwierdzania.
Czytelny widok dla ludzi
Surowe wpisy techniczne są nieczytelne dla osób spoza zespołu programistów. Tymczasem dziennik najczęściej przeglądają pracownicy obsługi, kierownicy i opiekunowie klientów. Warto zbudować prosty widok, który pokazuje przebieg zadania jak historię sprawy.
- Oś czasu zadania — kolejne kroki opisane zwykłym językiem.
- Wyszukiwanie po kliencie, numerze sprawy, dacie i rodzaju działania.
- Filtry — tylko sprawy eskalowane, tylko poprawione przez człowieka, tylko z odmowami.
- Ocena jednym kliknięciem — przeglądający oznacza sprawę jako poprawną lub błędną.
- Szczegóły techniczne na żądanie — pełne parametry dostępne, ale domyślnie zwinięte.
- Link z systemu źródłowego — z karty klienta w CRM można przejść do działań agenta w jego sprawach.
Rozwiązania techniczne
Dla małej lub średniej firmy nie jest potrzebna specjalistyczna platforma. Dziennik może być zwykłą tabelą w bazie danych aplikacji, w której każdy krok zadania jest osobnym wierszem powiązanym identyfikatorem. Ważniejsze od narzędzia są trzy właściwości.
- Zapis niezależny od powodzenia zadania — błąd w trakcie działania agenta nie może spowodować utraty wpisów z wcześniejszych kroków.
- Niezmienialność — wpisy nie są edytowane ani usuwane poza procesem ustalonej retencji.
- Struktura zamiast wolnego tekstu — pola z nazwą narzędzia, statusem i identyfikatorami umożliwiają statystyki.
Przy większej skali warto rozważyć narzędzia do obserwowania aplikacji opartych na modelach językowych, które oferują gotowe widoki przebiegu i porównania wersji. O kontroli zużycia na podstawie tych danych piszemy w materiale o kontroli kosztów modeli językowych.
Dziennik jako źródło decyzji
Najważniejsza rola dziennika ujawnia się po kilku miesiącach. Dane pokazują, w których typach spraw agent jest niezawodny, a w których regularnie potrzebuje poprawek. To podstawa do rozszerzania samodzielności agenta w sposób uzasadniony liczbami, a nie przeczuciem — i do ograniczania jej tam, gdzie jakość spadła. Dziennik wskazuje też sprawy, które agent przekazuje ludziom, co pozwala ocenić, czy zasady eskalacji są dobrze ustawione.
Przykład wpisu w praktyce
Wyobraźmy sobie agenta obsługującego zgłoszenia klientów sklepu internetowego. Klient pisze, że paczka nie dotarła. W dzienniku powstaje zadanie powiązane ze zgłoszeniem i kartą klienta. Pierwszy wpis zawiera treść wiadomości i wersję instrukcji. Kolejny — wywołanie narzędzia pobierającego zamówienia klienta, z wynikiem: jedno zamówienie w statusie „wysłane". Następny — sprawdzenie statusu przesyłki u przewoźnika, z informacją o opóźnieniu w sortowni. Agent przygotowuje odpowiedź z przewidywanym terminem dostawy, powołując się na dane przewoźnika. Ostatni wpis pokazuje, że pracownik zatwierdził wiadomość, dopisując zdanie z przeprosinami.
Dwa tygodnie później klient reklamuje, że dostał nieprawdziwą informację. Przeglądając dziennik, opiekun w minutę widzi, że agent przekazał dokładnie to, co podał przewoźnik, a opóźnienie wynikało z kolejnego zdarzenia po jego stronie. Rozmowa z klientem opiera się na faktach, a firma wie, że problem nie leży w agencie, tylko w jakości danych od przewoźnika.
Ten sam dziennik, analizowany zbiorczo, pokazuje też, że pracownicy regularnie dopisują przeprosiny w sprawach opóźnień. To jasna wskazówka, że instrukcję warto uzupełnić o taki element — i po zmianie sprawdzić, czy odsetek poprawek spadł.
Najczęstsze błędy
- Zapisywanie tylko odpowiedzi końcowej bez kroków pośrednich — nie da się ustalić, skąd agent wziął informację.
- Brak wersji instrukcji przy wpisach — po zmianach nie wiadomo, co działało lepiej.
- Dziennik tylko w logach serwera, usuwanych po kilku dniach i niedostępnych dla ludzi spoza IT.
- Zapisywanie kluczy dostępu razem z parametrami wywołań.
- Brak przeglądu — dane gromadzą się, ale nikt nie wyciąga z nich wniosków.
Od czego zacząć
Jeśli agent już działa bez porządnego dziennika, nie trzeba przebudowywać wszystkiego naraz. Na początek wystarczą trzy elementy: identyfikator zadania łączący kroki, zapis każdego wywołania narzędzia z parametrami i wynikiem oraz zapis decyzji końcowej wraz z udziałem człowieka. Już to pozwala odpowiedzieć na większość pytań przy reklamacjach. W kolejnym kroku warto dodać wersję instrukcji i źródła wiedzy, a następnie prosty widok dla pracowników. Równolegle trzeba ustalić okres przechowywania wpisów i zakres dostępu, żeby dziennik od początku był zgodny z zasadami ochrony danych. Po miesiącu takich zapisów zespół ma materiał do pierwszego rzetelnego przeglądu jakości agenta.
Podsumowanie
Dziennik działań zamienia agenta AI z czarnej skrzynki w system, którego działanie da się wyjaśnić, zmierzyć i poprawić. Powinien zapisywać wejście, kolejne kroki z wywołaniami narzędzi, źródła, decyzję końcową, udział człowieka oraz wersję instrukcji, a sam być chroniony jak każdy zbiór danych osobowych.
Projektuj dziennik razem z agentem, a nie po pierwszym incydencie. Dodanie zapisu do działającego systemu jest trudniejsze niż zaplanowanie go od początku, a brak danych z pierwszych tygodni to utrata najcenniejszego materiału do nauki. Jak dziennik wpisuje się w cały proces budowy agenta, opisujemy na stronie wdrożenie agenta AI, a o granicach tego, co agent może robić, w tekście o uprawnieniach agenta AI.
Najczęstsze pytania
Dane wejściowe zadania, wersję instrukcji i modelu, każde wywołanie narzędzia z parametrami i wynikiem, odmowy narzędzi, źródła wiedzy użyte w odpowiedzi, decyzję końcową oraz informację o tym, czy i jak człowiek zatwierdził lub poprawił propozycję agenta.
Zwykle tak, bo zapisuje treści wiadomości i dane klientów. Dlatego wymaga ustalonego okresu przechowywania, ograniczonego dostępu, maskowania danych wrażliwych, filtrowania haseł i kluczy oraz uwzględnienia w dokumentacji zgodności z przepisami o ochronie danych.
Losową próbkę spraw i przypadki poprawione przez człowieka warto przeglądać co tydzień, odmowy narzędzi i przekroczenia limitów na bieżąco dzięki alertom, statystyki jakości co miesiąc, a porównanie wyników po każdej zmianie instrukcji.
W małej lub średniej firmie nie. Wystarczy tabela w bazie danych z wpisami powiązanymi identyfikatorem zadania, zapisywanymi niezależnie od powodzenia zadania, niezmienialnymi i ustrukturyzowanymi. Specjalistyczne narzędzia opłacają się przy większej skali.
Analizując różnice między propozycjami agenta a wersjami zatwierdzonymi przez ludzi, dodając błędne przypadki do zestawu testowego, porównując wyniki kolejnych wersji instrukcji i na tej podstawie decydując, które typy spraw agent może obsługiwać samodzielnie.
Convert Studio realizuje projekty z tego obszaru dla firm w całej Polsce. Zobacz: AI i automatyzacja → · AI w firmie → · Agent AI → · Lokalizacje →
Bezpłatna wycena Twojego projektu
Opisz w kilku zdaniach, co chcesz zbudować — stronę, aplikację czy sklep. Odpowiadamy w ciągu 24 godzin roboczych konkretną propozycją zakresu i harmonogramu. Konsultacja i wycena są bezpłatne, bez zobowiązań.