Trzy nazwy miałem gotowe, zanim miałem jedną linijkę kodu. Alex, bo tak nazywa się mój asystent. Smerf Maruda, bo miał marudzić. ZEUS, bo miał mieć ostatnie słowo. Byłem tym pomysłem tak zajęty, że dopiero po dobrej godzinie rysowania strzałek zadałem pytanie, które powinno paść pierwsze: a może ktoś już to zbadał? Po co wymyślać koło od nowa?
Zbadał. I to dokładnie. Wzorzec, który projektowałem na kartce, ma w literaturze nazwę, kilkanaście prac i wynik, którego nie spodziewałem się przeczytać: w większości przypadków nie działa lepiej od jednego modelu, a czasem działa gorzej. Prowadzę agencję AI i automatyzacji dla firm 10 - 50 osób, a wszystko, co radzę klientom, najpierw sprawdzam na sobie. Ten tekst jest o wieczorze, w którym zamiast budować, czytałem, i o tym, dlaczego to był najlepiej wykorzystany wieczór tego lata. Jeśli ktoś właśnie sprzedaje Ci „system wieloagentowy", przeczytaj go przed podpisem.
Spis treści
- Dlaczego pomysł na trzech agentów wydaje się tak oczywisty?
- Co dokładnie mieli robić Alex, sceptyk i sędzia?
- Co mówią badania o debacie agentów?
- Dlaczego debata potrafi zepsuć poprawną odpowiedź?
- Ile kosztowałaby orkiestra w mojej firmie?
- Co z planu przeżyło konfrontację z literaturą?
- Kiedy drugi agent naprawdę ma sens?
- O co pytać dostawcę, który sprzedaje Ci pięciu agentów?
- Co zostało z kartki
- Słownik pojęć
Dlaczego pomysł na trzech agentów wydaje się tak oczywisty?
Bo tak działa każda instytucja, której ufamy. Sąd ma oskarżyciela, obrońcę i sędziego. Redakcja ma autora, redaktora i korektę. Księgowość ma zasadę czworga oczu. Jeśli jeden człowiek się myli, drugi go poprawi, a trzeci rozstrzygnie, kto miał rację. Przenosisz to na agentów AI i wychodzi architektura, która wygląda na dojrzałą, zanim jeszcze zadziała.
U mnie pomysł wziął się z konkretnego bólu. W sierpniu przepuściłem asystenta przez benchmark na 900 przebiegów i sędzia, czyli osobny model oceniający odpowiedzi, oznaczył 94 z nich jako halucynacje. Najbardziej bolesny przypadek: pytanie o cennik, odpowiedź z kwotą sprzed dwóch miesięcy, podana pewnie i ze źródłem. Pisałem o tym osobno, więc tu tylko przypomnę wniosek: agent nie zmyślał, tylko wiernie cytował dokument, który przestał obowiązywać.
Pierwsza reakcja była odruchowa. Skoro agent nie łapie własnych błędów, postawię obok drugiego, który będzie je łapał. A skoro dwaj mogą się pokłócić, trzeci rozstrzygnie. Rozwiązanie wyglądało elegancko, bo odpowiadało na pytanie „kto sprawdzi sprawdzającego" kolejnym sprawdzającym. Dopiero później zrozumiałem, że to nie jest odpowiedź. To odsunięcie pytania o jeden poziom wyżej, za dwa i pół raza większe pieniądze.
Co dokładnie mieli robić Alex, sceptyk i sędzia?
Żebyś wiedział, czego nie zbudowałem, opiszę plan tak, jak leżał na kartce 10 sierpnia wieczorem.
Alex to agent produkcyjny. Zbiera informacje, między innymi od Very, czyli mojego agenta wiedzy z dostępem do dokumentów firmy, i formułuje odpowiedź. Tak pracuje dziś i tak miał pracować dalej.
Sceptyk dostaje odpowiedź Alexa i kwestionuje wszystko, co nie jest zerojedynkowe. Nie fakty, bo fakty obaj braliby z tej samej Very. Rozumowanie. Przeskoki bez uzasadnienia, założenia bez pokrycia, wnioski z jednego przypadku. Jeśli sceptyk widzi to inaczej niż Alex, rozmawiają, w ciągach przyczynowo-skutkowych, aż dojdą do zgody albo do ściany.
ZEUS wchodzi dopiero przy ścianie. Gdy rozmowa się kończy bez wspólnego stanowiska, sędzia czyta obie strony i orzeka, co jest wynikiem pracy. Nie przy każdym zadaniu, tylko przy pacie.
Zasadność zamiast liczby rund
Jedna rzecz w tym planie była od początku inna niż w typowych projektach tego typu, i to ona okazała się później najcenniejsza. Nie chciałem ustalać z góry, ile rund debaty ma się odbyć. Zamiast tego przed każdą kolejną rundą system miał ocenić, czy w ogóle warto ją uruchamiać. Zapisałem to sobie jednym zdaniem: może nie trzeba określać ilości, tylko zasadność kolejnej. Wtedy wydawało mi się to drobiazgiem technicznym. Za chwilę wyjaśnię, dlaczego nie było.
Co mówią badania o debacie agentów?
Wzorzec nazywa się multi-agent debate, w skrócie MAD. Kilka modeli albo kilka instancji tego samego modelu dostaje to samo pytanie, każdy odpowiada, potem czytają odpowiedzi pozostałych i poprawiają swoje, przez kilka rund, aż do zgody albo do głosowania. Dokładnie to, co rysowałem, tylko bez imion. Kiedy poznasz nazwę zjawiska, literatura otwiera się sama. Spędziłem nad nią cały wieczór i wyszło z tego pięć ustaleń, które zmieniły plan.
Debata nie bije prostszych metod
Przegląd prac zebrany na blogu konferencji ICLR w 2025 roku stawia sprawę wprost: większość systemów debaty wieloagentowej nie przewyższa dwóch znanych od lat, tanich technik. Pierwsza to Chain-of-Thought, czyli poproszenie jednego modelu, żeby rozpisał swoje rozumowanie krok po kroku, zanim poda wynik. Druga to Self-Consistency, czyli zadanie tego samego pytania kilka razy jednemu modelowi i wzięcie odpowiedzi, która powtarza się najczęściej. Żadna z nich nie wymaga drugiego agenta ani orkiestracji. Obie kosztują ułamek tego, co debata.
Debata przy każdym zapytaniu pogarsza wynik
To był fragment, przy którym odłożyłem kartkę. Praca o inteligentnej debacie wieloagentowej, iMAD z końca 2025 roku, pokazuje, że uruchamianie debaty dla każdego pytania nie tylko kosztuje, ale obniża trafność. Mechanizm jest prosty i okrutny: w debacie obalane są również odpowiedzi poprawne. Model, który miał rację, ustępuje modelowi, który ma rację pozorną, bo brzmi pewniej. Więcej o tym w następnej sekcji.
Izolowana samokorekta wygrywa z nieukierunkowaną debatą
Praca z 2026 roku pod wymownym tytułem o koszcie konsensusu porównuje dwa podejścia: model poprawia sam siebie, bez zaglądania w cudze odpowiedzi, kontra modele debatują ze sobą. Samokorekta w izolacji wychodzi lepiej. Dla mnie to znaczyło, że mój etap drugi, o którym za chwilę, miał sens, a etap trzeci był pod znakiem zapytania.
Różne modele nie pomagają tak, jak się wydaje
Intuicja mówi, że dwa różne modele mają różne ślepe plamy, więc razem widzą więcej. Teoretycznie prawda. W praktyce praca o debacie między różnymi modelami pokazała, że w sześciu z ośmiu par zadań zespół różnych modeli wypadł gorzej niż najlepszy pojedynczy model z tego zespołu. Słabszy uczestnik nie dodawał perspektywy. Ściągał wynik w dół.
Komory echa powstają też między maszynami
I ostatnia, trochę niesamowita: modele debatujące ze sobą tworzą coś, co badacze nazwali komorą echa. Zbiegają do wspólnego stanowiska, utwierdzając się w nim nawzajem, a to, czy stanowisko jest prawdziwe, ma na ten proces mniejszy wpływ, niżbyśmy chcieli. Znasz to z zebrań zarządu. Trzy osoby, które kiwają głowami, nie są trzy razy bliżej prawdy niż jedna. Są trzy razy pewniejsze.
Dlaczego debata potrafi zepsuć poprawną odpowiedź?
Tu muszę wytłumaczyć coś, co dla osoby bez technicznego zaplecza brzmi dziwnie. Jak to możliwe, że drugi sprawdzający pogarsza wynik? Przecież w księgowości czworo oczu działa.
Działa, bo księgowa i jej koleżanka mają niezależne głowy. Druga osoba przy fakturze nie wie, co pomyślała pierwsza, dopóki nie porówna wyników. Model językowy w debacie dostaje cudzą odpowiedź jako część swojego pytania. I ma wbudowaną skłonność, którą każdy, kto pracował z tymi narzędziami, zna z codzienności: ulega. Napisz modelowi „jesteś pewien?", a w sporej części przypadków zmieni poprawną odpowiedź na błędną, tylko dlatego, że zapytałeś. Teraz wyobraź sobie, że pytającym nie jesteś Ty, tylko drugi model, który swoją błędną odpowiedź formułuje płynnie i z przekonaniem. Pierwszy ustępuje. Trzeci, sędzia, czyta dwie wersje i widzi, że obaj się już zgadzają. Orzeka zgodnie z nimi.
Analogia, która pomaga mi to tłumaczyć klientom: debata agentów to nie jest komisja ekspertów. To raczej grupa stażystów, którzy piszą test w jednej sali i mogą zaglądać sobie w kartki. Jeśli ten najpewniejszy siebie napisał źle, wynik całej sali będzie zły, a każdy z nich wyjdzie przekonany, że dobrze poszło. Stażyści uczyli się z tych samych podręczników, więc mają te same luki. Nawet gdy do sali wejdzie stażysta z innej szkoły, częściej dostosuje się do większości, niż ją przekona.
Jest jeszcze jeden powód, bardziej przyziemny, i to on ostatecznie zamknął temat w mojej firmie. Sceptyk, którego projektowałem, badał rozumowanie. A błąd z cennikiem nie był błędem rozumowania. Agent dostał z wyszukiwarki fragment dokumentu bez daty, więc nie miał skąd wiedzieć, że czyta stary cennik. Sceptyk, korzystający z tej samej wyszukiwarki, dostałby to samo. Opisałem już, jak naprawa jednej funkcji załatwiła to, czego trzech agentów by nie załatwiło. Tutaj dodam tylko wniosek ogólny: debata rozwiązuje spór o interpretację. Nie rozwiązuje braku informacji. A większość błędów, które widzę u agentów w małych firmach, to braki informacji, nie błędy logiki.
Ile kosztowałaby orkiestra w mojej firmie?
Policzyłem to na własnym ruchu, zanim literatura dała mi powód, żeby nie budować. Dobrze, że policzyłem, bo liczby same w sobie były wystarczającym argumentem.
Każde zadanie Alexa to dziś jedno wywołanie modelu plus zapytania do Very. Sceptyk, który dostaje odpowiedź Alexa razem z całym kontekstem, to drugie pełne wywołanie, z tą samą ilością danych na wejściu. Runda rozmowy między nimi to kolejne. Sędzia przy pacie to jeszcze jedno, z obiema wersjami w środku. Przy ostrożnym założeniu, że większość zadań kończy się po jednej wymianie, wychodziło mi mniej więcej dwa i pół raza więcej tokenów na każde zadanie. Nie na zadania trudne. Na każde. Także na „przypomnij klientowi o fakturze" i „sprawdź, czy mamy ten plik".
Tokeny to pieniądze, ale nie tylko. Każde dodatkowe wywołanie to też czas. Zadanie, które dziś trwa kilkanaście sekund, trwałoby pół minuty albo dłużej. Przy kilkudziesięciu zadaniach dziennie to nie jest problem. Przy kilkuset, a do tego zmierzam, asystent zaczynałby odpowiadać wolniej niż człowiek, którego miał odciążyć.
I najważniejsze: płaciłbym ten rachunek za ochronę przed klasą błędów, która według badań po dodaniu debaty nie maleje. Szczerze? Trochę mnie to zabolało, bo pomysł był mój i byłem z niego dumny przez całe dwa dni.
Co z planu przeżyło konfrontację z literaturą?
Nie wyrzuciłem kartki. Przepisałem ją w cztery etapy, od najtańszego do najdroższego, z zasadą, że do kolejnego przechodzę dopiero wtedy, gdy poprzedni przestaje wystarczać. Następnego dnia wydałem werdykt dla każdego z nich.
- Etap pierwszy, rejestr luk. Zostaje i działa. Każdy błąd agenta zapisuję jako regułę sprawdzającą, nie jako opis zdarzenia. Reguły wchodzą do promptu systemowego raz i kosztują zero tokenów na zadanie. Pisałem o nim osobno, bo to jedyny element planu, który przetrwał bez zmian i daje efekt od pierwszego dnia.
- Etap drugi, samokrytyka za bramką. Do wdrożenia, gdy zajdzie potrzeba. Ten sam model, przed oddaniem odpowiedzi, sprawdza ją sam, bez drugiego agenta i bez debaty. To jest ta izolowana samokorekta, która w badaniach wygrywa z debatą. Uruchamiana tylko dla zadań z określonej klasy, nie dla wszystkich.
- Etap trzeci, sceptyk jako osobny agent. Odłożony. Bada rozumowanie, a mój błąd nie był błędem rozumowania. Wrócę do niego, gdy pojawi się klasa zadań, w której problemem jest naprawdę logika wywodu. Dziś takiej klasy w mojej firmie nie ma.
- Etap czwarty, ZEUS. Nie buduję. Sędzia rozstrzyga spór, który przy zdrowej architekturze nie powinien powstać. A jeśli kiedyś powstanie, to z jednym twardym warunkiem: orzeka binarnie, tak albo nie. Zmierzyłem, jak zgodni są dwaj sędziowie AI i wyszło 0,79 przy pytaniu zerojedynkowym, a tylko 0,40 przy ocenie w skali. Sędzia, który ma orzekać „ile punktów", nie jest sędzią. Jest losowaniem.
Była też piąta decyzja, która nie była etapem, tylko naprawą: data dokumentu przy każdym fragmencie z wyszukiwarki. Jedna funkcja, wdrożona tego samego dnia. To ona załatwiła błąd, od którego wszystko się zaczęło.
Dlaczego Maruda został Popeyem
Dygresja, ale pouczająca. Sceptyk miał się nazywać Smerf Maruda. Sprawdziłem, jak Maruda działa w bajce: jego znak firmowy to odruchowe „ja nie lubię", wypowiadane, zanim pozna sprawę. Neguje z nawyku, nie z rozumowania. A model językowy czyta swoje imię i opis roli jako instrukcję. Agent nazwany Marudą miałby w prompcie wbudowaną podpowiedź, żeby marudzić zamiast myśleć. Zmieniłem imię na Popey, który jest uparty, ale argumentuje. Drobiazg? W pracy z modelami nie ma drobiazgów w promptach. Każde słowo, które tam stoi, kieruje zachowaniem. Nazwij agenta „Krytyk" i dostaniesz krytykę każdej odpowiedzi, także dobrej. Nazwij go „Weryfikator" i dostaniesz coś innego.
Kiedy drugi agent naprawdę ma sens?
Nie chcę, żebyś wyszedł z tego tekstu z przekonaniem, że dwa agenty to zawsze zły pomysł. Literatura mówi coś bardziej precyzyjnego i warto to oddać uczciwie.
Debata pomaga w zadaniach, w których problem leży w rozumowaniu, a nie w danych. Ocena ryzyka, gdzie trzeba zważyć sprzeczne argumenty. Rekomendacja strategiczna, gdzie nie ma jednej poprawnej odpowiedzi, tylko lepsze i gorsze uzasadnienia. Wybór między wariantami o niepewnych skutkach. Tam drugi głos, który celowo szuka słabości w wywodzie, może coś wnieść. W moich systemach takich zadań jest garstka i wszystkie trafiają do mnie, nie do automatu.
Debata nie pomaga przy faktach. Jaki jest aktualny cennik, czy ten klient ma zaległą fakturę, kiedy mija termin umowy. Tu nie ma czego debatować. Albo agent ma dostęp do właściwego, aktualnego dokumentu, albo nie ma. Dwaj agenci bez dostępu będą debatować równie długo i równie bezowocnie jak jeden.
I jest trzecia rzecz, przy której intuicja z mojej kartki okazała się trafna, co sprawiło mi więcej satysfakcji, niż wypada przyznać. Pamiętasz „zasadność zamiast liczby rund"? To jest dokładnie teza pracy iMAD. Zamiast debatować przy każdym pytaniu, system najpierw ocenia, czy to pytanie w ogóle wymaga debaty. Większość nie wymaga. Autorzy podają, że takie podejście obcina zużycie tokenów o 68 - 92 procent w porównaniu z debatą zawsze włączoną, bez utraty trafności. Gdyby orkiestra kiedyś u mnie powstała, budowałbym ją właśnie tak: bramka na wejściu, która mówi „to zadanie jest proste, odpowiedz i nie dyskutuj", i tylko czasem „tu warto się zatrzymać".
O co pytać dostawcę, który sprzedaje Ci pięciu agentów?
„System wieloagentowy" to w tym roku jedno z najchętniej używanych haseł w ofertach dla małych firm. Czasem słusznie, bo są procesy, które naturalnie dzielą się na role: jeden agent czyta maile, drugi wystawia dokumenty, trzeci pilnuje terminów. To nie jest debata, to podział pracy, i działa dobrze. Ale często pod tym hasłem kryje się właśnie to, co ja chciałem zbudować: kilka modeli, które sprawdzają się nawzajem, bo „tak jest bezpieczniej". Zanim za to zapłacisz, zadaj trzy pytania.
Pierwsze: czy ci agenci dzielą się pracą, czy sprawdzają się nawzajem? Podział pracy ma sens. Wzajemne sprawdzanie wymaga dowodu, że w Twoim przypadku działa, bo w ogólności według badań nie działa.
Drugie: jakie błędy ma łapać drugi agent i czy to są błędy rozumowania, czy braki danych? Jeśli dostawca mówi „agent czasem podaje nieaktualne informacje", to drugi agent tego nie naprawi. Naprawi to porządek w dokumentach i data przy każdym źródle. Taniej, pewniej, bez debaty.
Trzecie: ile tokenów i sekund kosztuje jedno zadanie z debatą w porównaniu z zadaniem bez niej? Jeśli dostawca nie umie podać tej liczby, nie mierzył. A jeśli nie mierzył, to skąd wie, że pomaga.
Pisałem już kiedyś o cichej katastrofie, którą nazywa się agent sprawl, czyli o mnożeniu agentów bez planu. Orkiestra sprawdzających to jej elegancka odmiana. Wygląda jak architektura, a jest kosztem.
Co zostało z kartki
Z trzech agentów został jeden, ten sam co wcześniej. Dostał lepsze dane, czyli datę przy każdym dokumencie. Dostał rejestr reguł, w którym osiada jego doświadczenie. I dostał plan rozbudowy w czterech etapach, z którego dwa pierwsze są tanie, a dwa ostatnie czekają na dowód, że są potrzebne.
Najwięcej jednak zostało mi z samego wieczoru. Nauczyłem się, że pytanie „czy ktoś to już zbadał" trzeba zadać przed rysowaniem strzałek, nie po. W sierpniu uratowało mnie dwa razy: raz przy orkiestrze, raz przy artykule naukowym, którego teza okazała się już opisana pod nazwą, której nie znałem. Za każdym razem oszczędność liczyła się w tygodniach pracy. Wprowadziłem to u siebie jako zasadę: zanim cokolwiek zbudujemy, godzina w literaturze, po angielsku, z szukaniem nazwy zjawiska, a nie tylko tezy.
Bo najdroższe systemy, jakie widziałem w małych firmach, nie były źle zbudowane. Były zbudowane dobrze, w odpowiedzi na problem, który miał prostsze rozwiązanie. Trzech agentów na kartce wyglądało poważnie. Jedna funkcja i godzina czytania zrobiły więcej.
Słownik pojęć
- Multi-agent debate (MAD) - wzorzec, w którym kilka modeli AI odpowiada na to samo pytanie, czyta odpowiedzi pozostałych i poprawia swoje przez kilka rund, aż do zgody albo głosowania. Badania pokazują, że rzadko wygrywa z prostszymi metodami.
- Chain-of-Thought - technika, w której prosisz jeden model, żeby rozpisał rozumowanie krok po kroku przed podaniem wyniku. Tania, bez drugiego agenta, często równie skuteczna jak debata.
- Self-Consistency - zadanie tego samego pytania kilka razy jednemu modelowi i wybranie odpowiedzi, która powtarza się najczęściej. Również bez debaty i orkiestracji.
- Samokorekta izolowana - model sprawdza własną odpowiedź przed oddaniem, bez zaglądania w odpowiedzi innych modeli. W badaniach wychodzi lepiej niż nieukierunkowana debata.
- iMAD - podejście, w którym system najpierw ocenia, czy dane pytanie w ogóle wymaga debaty, i uruchamia ją tylko wtedy. Obcina koszt o 68 - 92 procent bez utraty trafności.
- Token - jednostka, w której modele liczą tekst i w której płacisz za ich pracę. Mniej więcej trzy czwarte słowa po angielsku, po polsku zwykle mniej.
- Sędzia AI - osobny model, który ocenia odpowiedzi innego modelu. Wiarygodny przy pytaniach tak/nie, zawodny przy ocenach w skali.
- Rejestr luk - lista reguł wyciągniętych z błędów agenta, dodawana raz do jego instrukcji. Kosztuje zero tokenów na zadanie i działa od pierwszego dnia.
Masz agenta, który się myli? Zacznijmy od tego, co dostaje
Jeśli w Twojej firmie pracuje już asystent AI i myślisz o dobudowaniu drugiego, żeby pilnował pierwszego, napisz do mnie na [email protected]. W godzinę sprawdzimy, czy błędy, które widzisz, to błędy rozumowania, czy braki danych. W większości firm, które oglądałem, to drugie, a to naprawia się taniej niż orkiestrą. Powiem Ci też wprost, jeśli u Ciebie drugi agent ma sens, bo czasem ma.
Więcej o tym, jak wygląda współpraca ze mną, od pierwszej rozmowy po wdrożenie.
własnej firmie cybulski.ai JC


