Jev kontra nasz system LLM + ML. Co pokazał test 7602 prognoz?
906 razy Jev przypisał 0% rezultatowi, który później wystąpił. To suma z dwóch kolejnych okresów i jeden z powodów, dla których po teście nie zastąpiliśmy nim obecnego rozwiązania.
Sebastian PawełczykProcesy biznesowe i wdrożenie
Opublikowano 4 min czytania

Spis treści (5)
Po pochwałach pod adresem Jev postanowiliśmy dać mu zadanie trudniejsze niż efektowna demonstracja. W jednym z naszych projektów prognozujemy przyszłe zdarzenia na podstawie wcześniejszych danych i zachowań. To bardzo specjalistyczne zastosowanie, w którym pracujemy na pełnym rozkładzie prawdopodobieństwa. Dla biznesu wartość takiej pracy pojawia się przed zdarzeniem: wtedy można jeszcze przygotować decyzję. Po fakcie każdy potrafi opowiedzieć, co się stało.
W projekcie korzystamy z własnego systemu łączącego LLM i machine learning. Mieliśmy zachowane prognozy, zestawy danych wejściowych i później poznane rezultaty. Dlatego sprawdziliśmy Jev na naszym zadaniu, zamiast oceniać go po obietnicach lub tempie odpowiedzi.
Jak porównaliśmy Jev z systemem LLM + machine learning?
Zebraliśmy dwa następujące po sobie, niepokrywające się okresy po 30 dni. Po kontroli rozliczeń w analizie zostały 7602 przypadki z trzema możliwymi rezultatami. Dla każdego przypadku porównaliśmy zapisane prawdopodobieństwa naszego systemu, surowe prawdopodobieństwa Jev oraz prostą mieszankę 50/50.
Jev oceniał te same przypadki na podstawie tego samego zachowanego zestawu cech, który odtworzyliśmy ze ścieżki danych obecnego systemu. Nie dostał późniejszego rezultatu, naszej prognozy ani cen rynkowych. Pytanie do Jev, zakres analizy, miary i wagi mieszanki ustaliliśmy przed obejrzeniem porównania.
Rezultat testu Jev: trafność była podobna, prawdopodobieństwa już nie
| Wariant | Trafność wskazanego rezultatu | Log loss ↓ | Brier score ↓ |
|---|---|---|---|
| Nasz system LLM + machine learning | 45,44% | 1,0518 | 0,6331 |
| Jev | 44,57% | 2,8875 | 0,8715 |
| Mieszanka 50/50 | 44,53% | 1,1774 | 0,7084 |
Jeśli sprawdzić tylko pierwszy wybór modelu, różnica wynosi 0,87 punktu procentowego. To może wyglądać jak remis. Przy prognozowaniu liczy się jednak także to, jakie prawdopodobieństwo model przypisuje każdej możliwości. Od tych liczb zależy, czy system podejmie decyzję automatycznie, czy przekaże ją człowiekowi.
Log loss mocno obciąża pewne pomyłki. Brier score ocenia cały rozkład prawdopodobieństwa, także dla możliwości niewybranych na pierwszym miejscu. W obu miarach nasz system uzyskał lepszy rezultat. Dodanie Jev w proporcji 50/50 również pogorszyło jakość prognoz względem obecnego rozwiązania.
Jev przyznawał swojemu pierwszemu wyborowi średnio około 80%, choć ten wybór sprawdzał się w około 45% przypadków. W 906 przypadkach rzeczywistemu rezultatowi przypisał dokładnie 0%. Sprawdziliśmy, czy wniosek bierze się wyłącznie z ostrej kary log loss za takie zera. Po złagodzeniu tej kary kierunek porównania się nie zmienił. Brier score, liczone na surowych prawdopodobieństwach, pokazało to samo.
Co zrobiliśmy z tym rezultatem?
TypeSafe opisuje Jev jako model do szybkich, uporządkowanych decyzji, który zwraca prawdopodobieństwa. To interesująca możliwość. W naszym zastosowaniu procent zwrócony przez model musi jednak odpowiadać rzeczywistej częstości zdarzeń na tyle dobrze, by można było użyć go w regule decyzyjnej.
Na podstawie tego testu nie zastępujemy obecnego systemu Jev. Prosta mieszanka również nie dała nam powodu do zmiany. To miarodajna podstawa do decyzji w tej konfiguracji i w tym bardzo specjalistycznym zastosowaniu. Decyzja dotyczy jakości prognoz w naszym projekcie.
Jedno bardzo specjalistyczne zastosowanie
Oba rozwiązania oceniliśmy na tych samych 7602 archiwalnych przypadkach. Jev otrzymał zachowane cechy odpowiadające wejściu obecnej ścieżki systemu. Rekordy powstały przed zdarzeniami. Archiwum nie zawiera osobnego czasu każdej dawnej inferencji ani niezmiennej historii wszystkich wejść, więc nie potwierdza zgodności dostępności każdej wartości co do chwili. Raport dotyczy porównania zachowanych prognoz i surowych prawdopodobieństw Jev.
Ten rezultat odnosi się do jednego bardzo specjalistycznego zadania, w którym każde zdarzenie ma trzy możliwe rezultaty. Jev testujemy także w innych zastosowaniach. O tym, co pokazują te porównania, napiszemy niebawem.
Tak pracujemy z nowymi modelami w AIowi.pl. Sprawdzamy je na problemie, który faktycznie mamy, i porównujemy miary ważne dla decyzji. Popularność technologii nie jest powodem do zmiany działającego systemu.
Pytania o test Jev
Czy Jev częściej wskazywał poprawny rezultat?
Nie. Trafność pierwszego wyboru wyniosła 44,57% dla Jev i 45,44% dla naszego systemu na tych samych 7602 przypadkach.
Dlaczego sama trafność nie wystarczyła do decyzji?
Ponieważ system wykorzystuje prawdopodobieństwa. Jev uzyskał log loss 2,8875 wobec 1,0518 dla obecnego rozwiązania. Niższa wartość oznacza lepszą jakość prognoz. Brier score potwierdziło ten kierunek.
Czy Jev dostał mniej danych niż obecny system?
W porównaniu użyliśmy tych samych zachowanych przypadków i zestawu cech odpowiadającego wejściu obecnej ścieżki. Jev nie otrzymał późniejszych rezultatów ani prognoz naszego systemu.
Czy ten test rozstrzyga, czy Jev nadaje się do innych zastosowań?
Rezultat dotyczy jednego bardzo specjalistycznego zadania, dwóch okresów i surowych prawdopodobieństw Jev. Testujemy model również w innych zastosowaniach i opiszemy je niebawem.
Źródła i metoda
- Dane i obliczenia własne AIowi.pl: okresy 30.07–28.08.2026 (3118 przypadków) oraz 29.08–27.09.2026 (4484 przypadki). Łączne metryki są średnimi ważonymi liczebnością obu niepokrywających się okresów.
- Materiały producenta: opis Jev i dokumentacja funkcji Choice.
Źródła
- TypeSafe: Introducing System One Models and Jev, TypeSafe
- Dokumentacja TypeSafe: Choice, TypeSafe
Autor
Procesy biznesowe i wdrożenie
Odpowiada za rozmowę z klientem, zrozumienie procesów, organizację wdrożenia, operacje i sprzedaż oraz przełożenie technologii na realny wynik firmy. Przedsiębiorca, który od ponad 20 lat buduje i rozwija firmy.
Profil i wszystkie artykuły