Przez jedno sierpniowe popołudnie model językowy wystawił 900 ocen pracy mojego asystenta. Kosztowało mnie to mniej niż obiad dla dwóch osób i trwało krócej, niż sam przeczytałbym dwadzieścia odpowiedzi. Każda ocena miała uzasadnienie, punkty w skali od jednego do pięciu i dwa znaczniki tak/nie. Wyglądało poważnie. I właśnie wtedy zacząłem się bać, bo zorientowałem się, że nikt nie sprawdza sprawdzającego.
Posadziłem więc obok drugiego sędziego, na innym modelu, i kazałem mu ocenić tę samą próbkę na ślepo. Potem policzyłem, jak często obaj mówią to samo. Wynik ma dwie liczby: 0,79, gdy pytanie brzmi „czy w odpowiedzi jest błąd", i 0,40, gdy pytanie brzmi „ile punktów na pięć". Ten tekst jest o tym, co te dwie liczby znaczą dla właściciela firmy na 10 - 50 osób, który chce, żeby AI sprawdzało AI, zanim oferta albo mail wyjdą do klienta. Pomysł jest dobry. Trzeba tylko wiedzieć, o co sędziego wolno pytać, a o co nie.
Spis treści
- Po co mi sędzia, skoro mogłem przeczytać sam?
- Co mierzy kappa i dlaczego nie wystarczyła mi zwykła zgodność?
- Dlaczego 0,79 przy tak/nie, a tylko 0,40 przy skali?
- Cztery spory. Jak wyglądają kłótnie dwóch sędziów?
- Czy dwaj zgodni sędziowie mogą się zgodnie mylić?
- Co zmieniłem u siebie po tym pomiarze
- Jak użyć sędziego AI we własnej firmie, bez benchmarku
- Czego sędziemu nie oddam
- Słownik pojęć
Po co mi sędzia, skoro mogłem przeczytać sam?
Trzy tygodnie temu zmierzyłem własnego agenta: 60 zadań z prawdziwej pracy firmy, trzy warianty systemu, każde zadanie powtórzone pięć razy. Daje to 900 odpowiedzi do oceny. Przeczytanie ich samemu, z bazą wiedzy otwartą obok, żeby sprawdzać każdą liczbę i każde nazwisko, to tydzień wieczorów. Policzyłem i odpuściłem, zanim zacząłem.
Nie chodziło tylko o czas. Człowiek przy czterechsetnej odpowiedzi ocenia inaczej niż przy czterdziestej. Rano jest surowy, wieczorem wyrozumiały, a po dwóch godzinach przestaje zauważać, że agent znowu podał cenę sprzed dwóch miesięcy. Potrzebowałem kogoś, kto za każdym razem patrzy tak samo. I kogoś, kogo stać mnie na 900 razy.
Tak wygląda sędzia AI u mnie. Osobny model dostaje trzy rzeczy: treść zadania, złote punkty, czyli minimalny zestaw faktów, które poprawna odpowiedź musi zawierać, oraz odpowiedź agenta. Wypełnia rubrykę: poprawność, kompletność i użyteczność w skali od 1 do 5, a do tego dwa pytania tak/nie. Czy odpowiedź zawiera fakt sprzeczny z kluczem? Czy zawiera fakty spoza klucza, których nie da się tu potwierdzić? Na końcu dopisuje uzasadnienie w dwóch, trzech zdaniach.
Najprostsza analogia to sprawdzanie klasówek z kluczem odpowiedzi. Sprawdzający nie musi być fizykiem, musi umieć porównać to, co napisał uczeń, z tym, co stoi w kluczu. Klucz miałem tylko do połowy zadań, bo druga połowa to zwykłe maile i proste redakcje, przy których sędzia oceniał wykonanie, nie fakty. Ale w zadaniach o firmie, cennikach i klientach klucz był twardy: napisałem go sam, w sierpniu, fakt po fakcie.
Sędzia ocenił 900 odpowiedzi bez jednego błędu wykonania i za kilkadziesiąt złotych. Tani, szybki, zawsze w tej samej formie. Z jednym problemem, który rośnie proporcjonalnie do tego, jak bardzo wyniki wyglądają na poważne: skąd mam wiedzieć, że ocenia dobrze?
Co mierzy kappa i dlaczego nie wystarczyła mi zwykła zgodność?
Odpowiedź z literatury jest stara jak badania ankietowe: posadź drugiego oceniającego i sprawdź, czy mówi to samo. Zrobiłem to z drugim modelem, celowo z innej linii niż pierwszy sędzia, bo model oceniający własne wyjścia ma skłonność do ich faworyzowania. Drugi sędzia dostał tę samą rubrykę i próbkę 60 przypadków, po dziesięć z każdej kombinacji wariantu i typu zadania. Nie widział ocen pierwszego. Oceniał na ślepo.
Pierwsza liczba, jaką dostałem, brzmiała świetnie: w pytaniu o błąd faktograficzny obaj sędziowie zgodzili się w 93 procentach przypadków. Przez dwa dni byłem gotów to publikować. Potem zrobiłem rachunek, który powinienem był zrobić od razu.
Błędy faktograficzne były w próbce rzadkie. Pierwszy sędzia znalazł je w 13 z 60 odpowiedzi, drugi w 11. Jeśli obaj w większości przypadków mówią „nie ma błędu", to zgadzają się często niezależnie od tego, czy cokolwiek rozumieją. Dwóch kontrolerów jakości, którzy przybijają „OK" na wszystkim, ma zgodność 100 procent. I obaj są do niczego.
Kappa Cohena to współczynnik, który odejmuje od zgodności tę część, która wyszłaby przez sam przypadek. Zero oznacza, że sędziowie zgadzają się tak, jakby rzucali monetą. Jeden oznacza pełną zgodność. W praktyce wartości powyżej 0,6 uznaje się za znaczne, powyżej 0,8 za prawie doskonałe. W tym roku ukazała się zresztą praca, która na dużą skalę pokazała dokładnie to, co mnie przytrafiło się na małą: surowa zgodność między sędziami AI schlebia, kappa ściąga na ziemię.
Moje wyniki na 60 przypadkach, wymiar po wymiarze:
| co oceniał sędzia | zgodność surowa | kappa |
|---|---|---|
| błąd faktograficzny (tak/nie) | 93,3% | 0,79 |
| fakty spoza klucza (tak/nie) | 93,3% | 0,84 |
| użyteczność (1 - 5) | 83,3% | 0,74 |
| poprawność (1 - 5) | 55,0% | 0,40 |
Dwie pierwsze linie dały mi prawo oprzeć na sędzi główny wynik badania. Ostatnia linia nauczyła mnie najwięcej.
Dlaczego 0,79 przy tak/nie, a tylko 0,40 przy skali?
Przy poprawności w skali od 1 do 5 sędziowie zgodzili się tylko w 55 procentach przypadków, a po odjęciu przypadku zostało 0,40. Czytałem ich uzasadnienia obok siebie i prawie zawsze opisywały tę samą odpowiedź tymi samymi słowami. Jeden dawał cztery, drugi trzy. Granica między trójką a czwórką istnieje w głowie sędziego, nie w rubryce.
Zrób ten eksperyment u siebie. Daj dwóm osobom z zespołu tę samą ofertę i poproś o ocenę od 1 do 5. Potem zapytaj tylko: wysyłać czy nie? W drugim pytaniu zgodzą się prawie zawsze. W pierwszym będą się spierać o jedno oczko i oboje będą mieli rację. Skale porządkowe mają ten problem od dziesięcioleci i modele językowe go nie rozwiązały, tylko odziedziczyły.
Użyteczność wyszła ciekawie, bo 0,74 to więcej, niż spodziewałem się po skali. Myślę, że dlatego, że w praktyce to pytanie jest prawie binarne: albo odpowiedź nadaje się do użycia i dostaje piątkę, albo nie nadaje i dostaje coś niżej. Sędziowie zgadzali się na piątkach, a rozchodzili w dolnej części skali, gdzie trafiało mało przypadków.
Co to zmieniło w moich wynikach
Główny wynik mojego benchmarku, czyli to, że dostęp do bazy wiedzy poprawia odpowiedzi tam, gdzie wiedza jest potrzebna, a psuje je tam, gdzie nie jest, opiera się na dwóch rzeczach: na decyzji tak/nie o błędzie faktograficznym i na różnicy między wariantami, nie na bezwzględnej wartości oceny. Gdybym zbudował wniosek na średniej poprawności w skali, recenzent miałby prawo go rozszarpać przy kappie 0,40. Ta jedna tabela zdecydowała, które liczby z badania trafiły do artykułu, który złożyłem dwa tygodnie temu, a które zostały w pliku roboczym.
Cztery spory. Jak wyglądają kłótnie dwóch sędziów?
Na 60 przypadków sędziowie rozeszli się w pytaniu o błąd faktograficzny cztery razy. Przeczytałem wszystkie cztery z bazą otwartą obok i to była najlepiej wydana godzina w całym badaniu. Spory nie są szumem. Spory są mapą dziur w rubryce.
Pierwszy spór dotyczył opisu firmy klienta. Agent napisał dużo i szczegółowo o projektach, ale pominął kilka faktów z klucza, między innymi wielkość floty, i opisał ton komunikacji jako formalny, podczas gdy klucz mówił o tonie ciepłym. Jeden sędzia uznał to za błąd faktograficzny, bo ton się nie zgadza. Drugi uznał, że to pominięcie, nie sprzeczność. Oba uzasadnienia opisywały to samo zjawisko. Różniła je etykieta.
Drugi spór był dla mnie najważniejszy. Agent bez dostępu do bazy wiedzy odpowiedział uczciwie: nie mam tej informacji, oto kontakt do osoby, która ją ma. Jeden sędzia postawił znacznik błędu, bo odpowiedź nie zawierała żadnego faktu z klucza. Drugi odmówił, bo brak faktu to nie fałszywy fakt. Sędzia, który karze za uczciwe „nie wiem", uczy agenta blefować. Jeśli taka rubryka trafi do produkcji, po kilku tygodniach masz asystenta, który woli zmyślić, niż przyznać się do luki.
Trzeci spór to długa, w większości poprawna odpowiedź o jednym z naszych projektów, w której jeden sędzia wypatrzył szczegół sprzeczny z kluczem, a drugi go przeoczył. Długie odpowiedzi chowają błędy. Dwóch sędziów czyta uważniej niż jeden, dokładnie tak jak dwóch ludzi.
Czwarty spór dotyczył nazwiska i opowiem o nim osobno, bo to nie był spór o etykietę. To był sędzia, który się pomylił.
Wniosek z trzech pierwszych jest jeden i wstyd mi, że go nie przewidziałem: moja rubryka nie mówiła wprost, że pominięcie faktu nie jest halucynacją. Zakładałem, że to oczywiste. Dla dwóch różnych modeli oczywiste nie było, więc rozstrzygały to każdy po swojemu. Jedno brakujące zdanie w instrukcji odpowiadało za trzy z czterech sporów.
Czy dwaj zgodni sędziowie mogą się zgodnie mylić?
Tak. I to jest zdanie, które chciałbym, żebyś zapamiętał z tego tekstu, jeśli masz zapamiętać jedno.
Kappa mierzy powtarzalność, nie prawdę. Dwa termometry pokazujące tę samą temperaturę mogą być oba źle skalibrowane. Zgodność dowodzi, że sędziowie oceniają według tej samej reguły. Nie dowodzi, że reguła jest słuszna ani że obaj mają dostęp do tego, co słuszne.
Przypadek z nazwiskiem pokazał mi to boleśnie. Agent poprawnie napisał nazwisko jednej z moich klientek. Pierwszy sędzia uznał to za błąd i w uzasadnieniu z pełnym przekonaniem podał „prawidłową" pisownię, która była niepoprawna. Drugi sędzia napisał, że pisownia jest w porządku. Gdybym miał tylko jednego sędziego, ten przypadek wszedłby do statystyk jako halucynacja agenta, a tak naprawdę była to halucynacja sędziego. Mnie rozstrzygnięcie zajęło dwie sekundy, bo znam tę osobę od lat. Żaden model jej nie zna.
Są trzy miejsca, w których dwaj sędziowie mogą być zgodnie ślepi, i każde sprawdziłem osobno.
Pierwsze to klucz. Sędzia porównuje odpowiedź ze złotymi punktami, które napisałem w sierpniu. Jeśli w kluczu jest nieaktualna cena, obaj sędziowie zgodnie uznają aktualną odpowiedź za błędną. Tego dowiedziałem się na własnej skórze, gdy okazało się, że większość „halucynacji" mojego agenta to wierne cytaty ze starych dokumentów. Sędzia był bez winy, klucz też, a liczba i tak kłamała.
Drugie to faworyzowanie własnych wyjść. Praca, która w 2023 roku spopularyzowała metodę sędziego AI, od razu opisała jej skrzywienia: model ocenia łaskawiej odpowiedzi podobne do tych, które sam by napisał. Dlatego drugi sędzia był z innej linii modeli. Gdybym wziął ten sam, mierzyłbym zgodność systemu z samym sobą i ogłosił sukces.
Trzecie to długość. Sędziowie AI lubią dłuższe odpowiedzi, a mój wariant z bazą wiedzy pisze dłużej. Klucz jest tu obroną: sędzia ocenia, czy fakty się zgadzają, nie ile ich jest. Ale rubryka z pytaniem „oceń jakość od 1 do 5" bez klucza to zaproszenie do nagradzania gadulstwa.
Dopiero trzy rzeczy razem dały mi prawo opublikować liczby: wysoka kappa, cztery spory przeczytane przez człowieka i próbka sprawdzona w źródle. Każda z osobna byłaby pozorem rzetelności. Szczerze? Najbardziej zabolało mnie to, że przez dwa dni byłem gotów bronić 93 procent zgodności jako dowodu, że wszystko gra.
Co zmieniłem u siebie po tym pomiarze
Cztery rzeczy, w kolejności od najtańszej.
Dopisałem do rubryki dwa zdania, które powinny tam być od początku: brak faktu nie jest błędem faktograficznym, a przyznanie się do niewiedzy nie jest błędem w ogóle. Koszt: pięć minut. Efekt: trzy z czterech sporów przestają być sporami.
Każdy klucz dostaje datę. Nie „cennik usługi mailingowej", tylko „cennik obowiązujący 10 sierpnia 2026". Sędzia porównuje do klucza, więc klucz bez daty to sędzia, który z pełnym przekonaniem egzekwuje przeszłość. Tę lekcję opisałem przy okazji naprawy wyszukiwarki, która nie podawała dat dokumentów, i okazało się, że dotyczy nie tylko agenta, ale i tego, kto go ocenia.
Sędzia orzeka wyłącznie binarnie. W planie na wypadek, gdybym kiedyś jednak dobudował sceptyka i arbitra do mojego asystenta, arbiter nie wystawia ocen w skali. Mówi: spór rozstrzygam na korzyść pierwszej odpowiedzi albo drugiej. Koniec. Przy kappie 0,40 skala w ustach arbitra byłaby losowaniem z powagą sądu.
I zasada, która kosztuje najwięcej, choć w praktyce niewiele: żaden sędzia nie pracuje sam. Drugi model ocenia próbkę, a człowiek czyta tylko spory. Spory to kilka procent przypadków. Przy 60 ocenach to była godzina. Przy 900 byłoby to jedno popołudnie zamiast tygodnia wieczorów, od którego zacząłem ten tekst. To jest realna oszczędność sędziego AI: nie zastępuje czytania, tylko wskazuje, co czytać.
Jak użyć sędziego AI we własnej firmie, bez benchmarku
Nie potrzebujesz 900 przebiegów ani artykułu do recenzji. Jeśli w Twojej firmie AI pisze odpowiedzi do klientów, składa oferty albo opisuje dokumenty kosztowe, sędzia AI to bramka przed wysyłką. Tani model, który zanim człowiek kliknie „wyślij", sprawdza kilka rzeczy i mówi: przepuszczam albo zatrzymuję. Po moim pomiarze ustawiam go u klientów według pięciu zasad.
1. Pytaj tak/nie i daj klucz. Nie „oceń jakość maila od 1 do 5", tylko „czy w mailu jest cena inna niż w cenniku z 1 września?", „czy termin realizacji jest zgodny z umową?", „czy pojawia się nazwisko, którego nie ma w kartotece klienta?". Na pytania tak/nie z kluczem sędzia odpowiada tak powtarzalnie, jak dwaj kompetentni pracownicy. Na pytania o jakość w skali odpowiada jak jeden pracownik w różnych humorach. 2. Klucz ma datę i jest krótki. Sędzia nie dostaje całej bazy wiedzy, tylko kilka faktów, które mają się zgadzać, z datą ich ważności. Cała baza to zaproszenie, żeby sędzia znalazł starą wersję i uznał nową za błąd. 3. Inny model niż ten, który pisał. Jeśli ten sam model pisze i ocenia, mierzysz, czy lubi własny styl. Lubi. 4. Co dziesiąty werdykt czyta człowiek, a każdy spór zawsze. Spór to sytuacja, w której sędzia zatrzymał coś, co człowiek chciał wysłać, albo przepuścił coś, co człowiek zatrzymał. Te przypadki trzymam w osobnym pliku, bo każdy z nich to zdanie, którego brakuje w rubryce. 5. Mierz, ile sędzia zatrzymuje i ile z tego było słuszne. Jeśli zatrzymuje co trzecią wiadomość, a człowiek w dziewięciu na dziesięć przypadkach i tak wysyła, to nie jest bramka, tylko hałas, który ludzie nauczą się klikać bez czytania.
Gdzie to działa dobrze już dziś: wszędzie tam, gdzie błąd ma postać twardego faktu. Cena, data, nazwa produktu, numer umowy, kwota na fakturze, nazwisko w nagłówku. Gdzie działa źle: ton, uprzejmość, „czy to dobry mail". Tam skala od 1 do 5 wraca kuchennymi drzwiami i razem z nią wraca kappa 0,40.
Słyszę dwa mity, oba fałszywe. Pierwszy: AI oceniające AI to zamknięta pętla, nic niewarta, bo model nie może sprawdzić modelu. Mój pomiar mówi inaczej. Na pytania tak/nie z kluczem dwa różne modele są ze sobą zgodne na poziomie, który w badaniach ankietowych uznaje się za znaczny, i kosztują grosze za werdykt. Drugi mit, odwrotny: sędzia AI zastępuje kontrolę jakości. Nie. Sędzia filtruje. Decyduje człowiek, w sporach i w próbce, i to on definiuje, co w ogóle jest błędem.
Czego sędziemu nie oddam
Trzech rzeczy. Ostatniego kliknięcia przy wszystkim, co wychodzi na zewnątrz, bo sędzia jest obojętny na konsekwencje tak samo jak agent, którego ocenia. Wiedzy, której nie ma w kluczu, takiej jak poprawna pisownia nazwiska klientki, relacja między dwiema firmami albo to, że ten konkretny klient woli, żeby pisać do niego „przyjacielu". I definicji błędu. Rubryka to moje zdanie o tym, co jest w porządku, a co nie, spisane w kilku punktach. Model egzekwuje ją bardzo dokładnie, w tym jej luki.
Sędzia AI jest jak kontroler jakości z listą kontrolną w ręku. Sprawdza szybciej niż człowiek, nie męczy się i o czwartej po południu patrzy tak samo jak o dziewiątej rano. Jest dokładnie tak dobry, jak lista. A lista jest moja, z moimi dziurami, i to ja odpowiadam za to, co przez nie przeszło.
Trzy tygodnie temu myślałem, że sprawdzam agenta. Okazało się, że najpierw musiałem sprawdzić sprawdzającego, a potem siebie, bo to ja napisałem mu rubrykę z brakującym zdaniem. Na tym chyba polega wdrażanie AI w małej firmie. Nie na tym, żeby maszyna była nieomylna, tylko na tym, żeby wiedzieć, w którym miejscu zgodnie z nami się myli.
Słownik pojęć
- Sędzia AI (model w roli sędziego) - osobny model językowy, który ocenia odpowiedzi innego modelu według rubryki, zwykle z kluczem faktów. Tani i powtarzalny, ale ma systematyczne skrzywienia: faworyzuje odpowiedzi podobne do własnych i dłuższe.
- Złote punkty (klucz) - minimalny zestaw faktów, które poprawna odpowiedź musi zawierać. Sędzia porównuje odpowiedź z kluczem, więc klucz bez daty albo nieaktualny psuje każdy werdykt.
- Zgodność surowa - odsetek przypadków, w których dwaj oceniający dali tę samą ocenę. Zawyża wrażenie rzetelności, gdy jedna z ocen jest bardzo częsta.
- Kappa Cohena - współczynnik zgodności dwóch oceniających po odjęciu zgodności, która wyszłaby przez przypadek. 0 to poziom rzutu monetą, 1 to pełna zgodność; powyżej 0,6 uznaje się za znaczną. Mierzy powtarzalność ocen, nie ich trafność.
- Skala porządkowa - ocena typu 1 - 5, w której wiadomo, że 4 jest lepsze od 3, ale nie wiadomo, gdzie dokładnie przebiega granica. Na takich skalach oceniający rozchodzą się o jedno oczko, nawet gdy opisują to samo.
- Faworyzowanie własnych wyjść - skłonność modelu do wyższej oceny odpowiedzi w stylu, który sam by napisał. Powód, dla którego drugi sędzia powinien być z innej linii modeli niż pierwszy.
Zanim AI zacznie sprawdzać AI u Ciebie, spiszmy pytania
Jeśli AI pisze u Ciebie maile, oferty albo opisy dokumentów i zastanawiasz się, jak to sprawdzać bez czytania wszystkiego, napisz do mnie na [email protected]. Zaczniemy nie od modelu, tylko od listy pytań tak/nie, na które sędzia ma odpowiadać, i od klucza z datą, z którym ma je porównywać. To godzina pracy, która decyduje, czy bramka przed wysyłką będzie coś warta.
Więcej o tym, jak wygląda współpraca ze mną - od pierwszej rozmowy po wdrożenie.
własnej firmie cybulski.ai JC


