Plan eksperymentu
Kontrola kosztów agentów
Sprawdzić, jak monitorować koszt, jakość i zachowanie modeli w praktyce.
R&D
Sprawdzam proste założenia przed rozbudową rozwiązania. Poniżej możesz odtworzyć pomiar wyszukiwania i zobaczyć również nieudane przypadki.
Eksperyment własny · wyszukiwanie bez modelu AI
Pomiar: . Odtworzony z kodu 9 września 2026.
Mały autorski zestaw, bez niezależnego zbioru testowego. Wynik dotyczy pierwszego znalezionego fragmentu lub poprawnego braku wyniku; nie mierzy jakości odpowiedzi AI.
Nie znaleziono fragmentu. Oczekiwane źródło: rag-source-simulation.
Nie znaleziono fragmentu. Oczekiwane źródło: rag-source-report.
W tych dwóch parafrazach podobieństwo słów nie wystarczyło. Kolejny krok to porównanie z wyszukiwaniem semantycznym na osobnych pytaniach. Takiego porównania jeszcze nie wykonano.
Hipoteza: wspólne słowa wystarczą do wskazania źródła również po przeformułowaniu pytania. Punktem odniesienia jest prosty algorytm leksykalny, bez embeddingów i generowania odpowiedzi.
Zbiór: trzy publiczne fragmenty Protolume o symulacji, raporcie i formularzu. Autor przygotował 12 pytań oraz oczekiwane identyfikatory. Ten sam niewielki materiał posłużył do opracowania algorytmu i obserwacji jego zachowania.
Ustawienia: normalizacja liter i polskich znaków, jawna lista pomijanych słów i początków wyrazów. Próg pokrycia słów pytania: 40%; maksymalnie dwa wyniki. Ranking według liczby wspólnych słów, remis według identyfikatora.
Ocena: pierwszy identyfikator musi być zgodny z oczekiwanym; dla pytania spoza zakresu oczekiwany jest pusty wynik. Nie jest to Recall@k ani ocena odpowiedzi modelu.
Wywołania modelu: 0. Czas, praca i koszt infrastruktury nie były mierzone. Brak wywołań modelu nie oznacza zerowego kosztu całego eksperymentu.
Pobierz i rozpakuj paczkę. W Pythonie 3.11 lub nowszym uruchom python run.py --output rerun.json. Nie wymaga kluczy, sieci ani dodatkowych bibliotek.
Porównaj wyniki z raportem JSON, pomijając datę uruchomienia i dodane pole wersji źródeł. Paczka zawiera pytania, korpus, algorytm i skrypt oceny z wersji 9bbe8d5.
Nie sprawdzono generowania odpowiedzi, sprzeczności, instrukcji w dokumentach ani jakości na danych klienta. Ten pomiar nie potwierdza skuteczności RAG w produkcji.
Dalsze kierunki
Poniższe tematy są planami. Nie przedstawiają zakończonych wdrożeń ani potwierdzonych wyników.
Plan eksperymentu
Sprawdzić, jak monitorować koszt, jakość i zachowanie modeli w praktyce.
Plan eksperymentu
Wypracować wzorce oceny odpowiedzi oraz jakości indeksów wiedzy.
Plan eksperymentu
Sprawdzić, jak zarządzać zadaniami i zatwierdzeniami przez komunikatory.
Plan eksperymentu
Uprościć walidację odpowiedzi i proponować lepsze wzorce orkiestracji.