Globalna marka konsumencka
audytowalne klasy werdyktu, każda z cytatem-dowodem
Sytuacja
Dział komunikacji globalnej marki dostaje setki publikacji miesięcznie i musi wiedzieć, które wzmacniają, a które podważają jej strategiczny przekaz. Ręczna ocena jest wolna, subiektywna i nie do zaudytowania — a naiwne „czy LLM to lubi” halucynuje werdykty i nie potrafi ich uzasadnić.
Zadanie
Zbudować PoC pipeline’u agentowego, który sam pobiera publikacje z monitoringu mediów, ocenia każdą względem dokumentów strategii marki i produkuje raporty z werdyktami popartymi cytatem — zamiast nieprzejrzystych ocen.
Działanie
Zaprojektowałem deterministyczny, niezależny od dostawcy pipeline (LangGraph), który celowo oddziela ocenę LLM od punktacji i owija całość w produkcyjny serwis z bramkami QA — tak, żeby każdy werdykt był prześledzalny.
- Ekstraktor „brand playbook” (RAG): osobny agent czyta dokumenty strategii (PDF/DOCX) i destyluje je do 3–7 filarów (teza, słowa kluczowe, reguły do/nie-rób, wagi) — to jest rubryka oceny.
- Punktacja odporna na halucynacje: LLM zwraca tylko relacje per-filar (wspiera / neutralny / zaprzecza), a czysto pythonowy silnik liczy całkowity indeks i mapuje na werdykt lokalnie — model nie ustawia oceny.
- Samokorygująca pętla QA: weryfikacja cytatów co do słowa, spójność etykiety i wyniku, pokrycie filarów — z jednym automatycznym, ostrzejszym przebiegiem, gdy walidacja pada.
- Produkcyjny kształt: warstwa modeli wymienna między 3 dostawcami (OpenAI / Anthropic / Google), FastAPI + Celery + Postgres/Redis, szyfrowane sekrety, śledzenie kosztu tokenów, zaplanowane raporty dzienne i miesięczne.
Wynik
werdyktów bez cytatu-dowodu
liczy ocenę zamiast LLM (zero halucynacji werdyktu)
wymuszony próg pokrycia testami (71 plików)
wymienni dostawcy LLM