Realne projekty

Case studies
Wyniki, nie obietnice

Prawdziwe wdrożenia AI — konkretne projekty i konkretne liczby prosto z repozytoriów kodu. Klienci zanonimizowani, systemy realne: od proof of concept po produkcję. Wyniki, nie obietnice. Bez marketingowego bullshitu.

5

projekty AI: marka, śledztwa, medycyna, sprzedaż, sport

Agentic+RAG

wzorzec powtarzalny w wdrożeniach

80%

egzekwowany próg pokrycia testami

z repo

każda liczba pochodzi z prawdziwego kodu

CASE STUDIES

Projekty,
które dowożą

AGENTOWY + RAG

Globalna marka konsumencka

Dział komunikacji marki
Proof of concept
Agentowy pipeline + RAG
Kluczowy wynik
3+1

audytowalne klasy werdyktu, każda z cytatem-dowodem

S

Sytuacja

Dział komunikacji globalnej marki dostaje setki publikacji miesięcznie i musi wiedzieć, które wzmacniają, a które podważają jej strategiczny przekaz. Ręczna ocena jest wolna, subiektywna i nie do zaudytowania — a naiwne „czy LLM to lubi” halucynuje werdykty i nie potrafi ich uzasadnić.

T

Zadanie

Zbudować PoC pipeline’u agentowego, który sam pobiera publikacje z monitoringu mediów, ocenia każdą względem dokumentów strategii marki i produkuje raporty z werdyktami popartymi cytatem — zamiast nieprzejrzystych ocen.

A

Działanie

Zaprojektowałem deterministyczny, niezależny od dostawcy pipeline (LangGraph), który celowo oddziela ocenę LLM od punktacji i owija całość w produkcyjny serwis z bramkami QA — tak, żeby każdy werdykt był prześledzalny.

  • Ekstraktor „brand playbook” (RAG): osobny agent czyta dokumenty strategii (PDF/DOCX) i destyluje je do 3–7 filarów (teza, słowa kluczowe, reguły do/nie-rób, wagi) — to jest rubryka oceny.
  • Punktacja odporna na halucynacje: LLM zwraca tylko relacje per-filar (wspiera / neutralny / zaprzecza), a czysto pythonowy silnik liczy całkowity indeks i mapuje na werdykt lokalnie — model nie ustawia oceny.
  • Samokorygująca pętla QA: weryfikacja cytatów co do słowa, spójność etykiety i wyniku, pokrycie filarów — z jednym automatycznym, ostrzejszym przebiegiem, gdy walidacja pada.
  • Produkcyjny kształt: warstwa modeli wymienna między 3 dostawcami (OpenAI / Anthropic / Google), FastAPI + Celery + Postgres/Redis, szyfrowane sekrety, śledzenie kosztu tokenów, zaplanowane raporty dzienne i miesięczne.
R

Wynik

0

werdyktów bez cytatu-dowodu

Kod

liczy ocenę zamiast LLM (zero halucynacji werdyktu)

80%

wymuszony próg pokrycia testami (71 plików)

3

wymienni dostawcy LLM

AI + RAG · ŚLEDZTWA

Studio analiz śledczych

Analitycy śledczy
Frontend + UX AI
RAG + wizualizacje
Kluczowy wynik
6

typów wizualizacji dowodowej generowanych z wyjść LLM

S

Sytuacja

Studio analiz śledczych tonęło w terabajtach mieszanych dowodów z urządzeń (dokumenty, czaty, maile, zdjęcia, audio, logi GPS/BTS). Analitycy ręcznie przeglądali dane z telefonów — wolno i bez możliwości korelacji między źródłami.

T

Zadanie

Zaprojektować i zbudować interfejs śledczego: jedno miejsce pracy na sprawę — od założenia sprawy, przez upload i śledzenie ingestu, po czat AI z cytatami do dowodów i bogate wizualizacje — odpięty od backendu, który dopiero powstawał.

A

Działanie

Zbudowałem aplikację jako ściśle typowany SPA (React 19 + TS) z warstwą usług niezależną od backendu — żeby UI dało się rozwijać i pokazywać na realistycznych mockach, a potem przełączyć na żywe API bez zmiany kodu.

  • Warstwa API dual-mode: przełącznik między mockami (MSW) a żywym backendem, z normalizacją snake_case (Django/DRF) do camelCase domeny — UI rozwijane niezależnie od gotowości backendu.
  • Czat RAG oparty na dowodach: każda odpowiedź AI niesie inline cytaty prowadzące do konkretnego pliku źródłowego, plus flow „otaguj cytaty → wygeneruj raport sprawy”.
  • Pluggable system wizualizacji (rejestr + renderer) zamieniający wyjścia narzędzi LLM w oś czasu, mapę, wykres, graf powiązań, heatmapę i podgląd danych.
  • Geoprzestrzenny eksplorator (Leaflet): klastrowanie, heatmapa czasu przebywania, animowane odtwarzanie tras, warstwa anomalii — zsynchronizowany z osią czasu; plus wejście głosowe/TTS i audytowe logowanie interakcji (chain-of-custody).
R

Wynik

6

typów wizualizacji śledczej z wyjść LLM

100%

odpowiedzi AI z cytatem do źródła

Dual-mode

mock lub żywe API bez zmiany kodu

17

plików testów (Vitest + RTL, MSW)

AUTOMATYZACJA LLM · DANE

Dystrybutor sprzętu medycznego

Dział ofertowania
Produkcja
LLM + pipeline danych
Kluczowy wynik
17-kol.

kanoniczny schemat z dowolnego arkusza przetargowego

S

Sytuacja

Dystrybutor sprzętu medycznego dostaje arkusze przetargowe z dziesiątek źródeł — każdy z własnymi nagłówkami, układem, jednostkami i formatem (.xls, .ods). Ten sam sens (ilość, cena jedn., nr katalogowy, producent) kryje się pod wieloma różnymi polskimi nagłówkami. Zespół ręcznie przepisywał każdy skoroszyt do jednego formatu — wolno i z błędami.

T

Zadanie

Zbudować pipeline, który niezawodnie znajduje właściwą tabelę w dowolnym skoroszycie, mapuje jego nagłówki na kanoniczny schemat, normalizuje referencje/jednostki/opakowania i wypluwa czysty, ostylowany arkusz plus czytelny ślad audytowy — uruchamialny przez nietechniczny zespół na Windows, bez dotykania kodu.

A

Działanie

Zbudowałem to jako modułowy pakiet z jasnym, etapowym pipeline’em (wykryj → mapuj → zastosuj → wzbogać → przepakuj), trzymając LLM wąsko przy jednym zadaniu, w którym jest dobry (semantyczna interpretacja nagłówków), a resztę robiąc deterministycznie w kodzie.

  • Własny, bez-zależnościowy parser XLSX z heurystykami wykrywania tabel (scalone nagłówki, poszarpane wiersze, podsumowania, stopki), walidowany złotymi snapshotami — szybko i powtarzalnie.
  • Ściśle ograniczony etap mapowania LLM: prompt dostaje tylko wiersz nagłówka + jeden przykładowy wiersz i wymusza JSON z oceną pewności per kolumna i wyborem z 5 akcji (copy / regex / analyze / convert / insert).
  • Stylizacja wg pewności: komórki poniżej progu (50/80%) kolorowane i z polskim komentarzem recenzenta (źródło, cel, pewność, uzasadnienie) — człowiek widzi dokładnie, co sprawdzić.
  • Deterministyczny post-processing: wzbogacenie o producenta ze śladem audytu, rozmyte dopasowanie nr katalogowego (rapidfuzz), zachowanie zer wiodących, przeliczenie opakowań; cache LLM w SQLite + tracker kosztu; spakowane jako aplikacja Windows uruchamiana dwuklikiem.
R

Wynik

Produkcja

pipeline działa u klienta

5

konfigurowalne akcje mapowania kolumn

37

plikowy baseline regresyjny (4 zbiory)

2-klik

aplikacja Windows bez instalacji Pythona

AGENTOWA SPRZEDAŻ

Firma odzieży reklamowej B2B

Sprzedaż B2B mailem
Research + fundament MVP
Agent + ewaluacja
Kluczowy wynik
100%

trafność routingu decyzji na benchmarku 146 wątków

S

Sytuacja

Firma sprzedaje odzież z nadrukiem przez sklep i zespół B2B, wyceniając mailem. Każde zapytanie to ręczne godzenie go z rozproszonym katalogiem (~309 000 SKU dostawców w 6 katalogach, bez wspólnego schematu), złożonym cennikiem zdobień (sitodruk, haft, DTF — wg ilości, pola i kolorów) i CRM-em ~12 800 deali. Tylko ~6% z 5 781 wątków mailowych było w ogóle powiązane z dealem — kontekst rozsypany, wycena wolna i niespójna.

T

Zadanie

Zostałem wzięty jako AI developer, żeby prześwietlić operację sprzedaży end-to-end i zbudować fundament pod MVP autonomicznego agenta mailowego: uporządkować CRM i historię maili, udowodnić, co LLM potrafi niezawodnie wyciągnąć i wycenić, i zaprojektować architekturę produkcyjną przed budową.

A

Działanie

Potraktowałem to najpierw jako problem danych i ewaluacji: zbudować pipeline’y i twardy benchmark, żeby zdjąć ryzyko z agenta zanim powstanie jego produkcyjny rdzeń.

  • Pipeline danych: sync encji CRM + pobranie i normalizacja 5 781 wątków mailowych, wzbogacenie (klasyfikacja tematów, etykiety wiadomości, dopięcie wątku do deala) i analiza czasu odpowiedzi, zaangażowania i trendów produktowych.
  • Warstwa danych treningowych (LLM) pod ścisłymi schematami JSON z budżetem kosztu per wywołanie — playbook sprzedażowy: wzorce wygranych i przegranych oraz obsługa obiekcji.
  • Benchmark agenta na 146 wątkach (batchowy runner + agregacja KPI): routing trybu decyzji, jakość ekstrakcji, wykrywanie brakujących krytycznych danych, porównywalność ceny AI vs CRM — plus konkretne rekomendacje guardraili.
  • Specyfikacja produkcji: maszyna stanów LangGraph (4 → 13 stanów), serwery narzędzi MCP (sklep / CRM / wycena), warstwa FastAPI i human-in-the-loop — na zgodnym z RODO, hostowanym w UE Gemini (Vertex AI); dyscyplina inżynierska za bramką 80% pokrycia.
R

Wynik

146/146

wątków bez błędu parsowania (100% trafność routingu)

7,75/10

średnia jakość ekstrakcji (100% wykrycia braków krytycznych)

~34 s

na wątek (146 wątków w ~15 min)

5781

wątków + ~12,8 tys. deali + ~309 tys. SKU uporządkowane

SPATIAL AI / ML

Startup analityki sportowej (piłka nożna)

Analityka przestrzenna
R&D: najpierw walidacja
Spatial ML
Kluczowy wynik
> 0.70

twardy próg go/no-go przed jakąkolwiek budową platformy

S

Sytuacja

Kluby z górnej półki kupują dane trackingowe z kamer (wszystkie 22 osoby w ruchu) — ale w drugich ligach Europy Środkowo-Wschodniej, Bałkanów i Skandynawii takich danych nie da się kupić za żadne pieniądze. Skauci i agencje mają tam tylko tanie dane zdarzeniowe (log akcji przy piłce), więc są ślepi na warstwę przestrzenną — a lukę pogłębiło wygaszenie popularnego darmowego źródła zaawansowanych statystyk na początku 2026.

T

Zadanie

Zaprojektować rdzeń ML, który z samych tanich danych zdarzeniowych rekonstruuje brakujący obraz przestrzenny (off-ball) — i, przed jakąkolwiek budową platformy, tanio potwierdzić albo zabić główny zakład: że agregatowe metryki przestrzenne z eventów układają zawodników w tej samej kolejności co prawdziwy tracking.

A

Działanie

Poprowadziłem to jako engagement „najpierw walidacja”: zamroziłem jedną metrykę make-or-break, zbudowałem wokół niej uruchamialny harness ewaluacyjny i podpiąłem każde euro budżetu pod tę bramkę — zanim powstał jakikolwiek kod produktu.

  • Rozłożenie modelu na trzy warstwy, z których uczy się tylko jedna: wartość posiadania (xG/xT/VAEP rekalibrowane per liga na otwartych danych CC-BY), deterministyczna warstwa fizyki (pitch control / pressing / line-breaking bez danych treningowych) i nisko-parametrowy imputer ról/formacji rekonstruujący ~21 pozycji off-ball, kalibrowany na 17 sparowanych meczach.
  • Niezmienialny „wzorzec” (yardstick) implementujący bramkę go/no-go: korelacja rang Spearmana per-zawodnik (nigdy per-drużyna — agregaty drużynowe ukrywają błąd, za którego uniknięcie płaci kupujący), pulowana po 17 legalnie czystych meczach, na 4 metrykach + ich średniej, z progiem > 0.70.
  • Utwardzenie ewaluatora: strażnik wycieku (zapieczętowany sentinel trackingu podnoszący wyjątek przy próbie odczytu ground truth), deterministyczne ziarno i self-checki (oracle = 1.0, strażnik trip, dwa przebiegi zgodne), zależności lekkie (numpy + stdlib).
  • Autoresearch „ratchet”: trzy pliki o ścisłej własności (niezmienny wzorzec, edytowalny plik modelu, kierunki badań pisane przez człowieka); każdy eksperyment edytuje jeden plik, jest scoreowany względem zamrożonego wzorca i zapisywany w gicie tylko przy poprawie > 0.005 — ~12 eksperymentów/h; plus 15-hipotezowy, falsyfikowalny backlog i wpisana w guardraile polityka legalnie czystych danych.
R

Wynik

> 0.70

próg go/no-go (Spearman per-zawodnik) na 17 meczach

3 warstwy

architektura modelu — uczona tylko jedna

~12/h

eksperymentów w automatycznym ratchecie

#1 / 219

pomysł wybrany ze strukturalnego przeglądu

NASTĘPNY KROK

Chcesz wyniki
jak te?

30 minut rozmowy. Bez zobowiązań. Dowiesz się, czy mam sensowny sposób na rozwiązanie Twojego problemu.