R&D

Eksperyment z wynikiem, kodem i ograniczeniami

Sprawdzam proste założenia przed rozbudową rozwiązania. Poniżej możesz odtworzyć pomiar wyszukiwania i zobaczyć również nieudane przypadki.

Eksperyment własny · wyszukiwanie bez modelu AI

Czy wspólne słowa wystarczą do znalezienia źródła?

Pomiar: . Odtworzony z kodu 9 września 2026.

Przypadki zgodne z oczekiwaniem
10 / 12
Pytania z oczekiwanym źródłem
7 / 9
Poprawny brak wyniku poza zakresem
3 / 3

Mały autorski zestaw, bez niezależnego zbioru testowego. Wynik dotyczy pierwszego znalezionego fragmentu lub poprawnego braku wyniku; nie mierzy jakości odpowiedzi AI.

Co nie zadziałało

  • Czy te odpowiedzi generuje sztuczna inteligencja?

    Nie znaleziono fragmentu. Oczekiwane źródło: rag-source-simulation.

  • Czy pokazujecie prawdziwy sukces przedsiębiorstwa?

    Nie znaleziono fragmentu. Oczekiwane źródło: rag-source-report.

W tych dwóch parafrazach podobieństwo słów nie wystarczyło. Kolejny krok to porównanie z wyszukiwaniem semantycznym na osobnych pytaniach. Takiego porównania jeszcze nie wykonano.

Hipoteza, dane i ustawienia wyszukiwania

Hipoteza: wspólne słowa wystarczą do wskazania źródła również po przeformułowaniu pytania. Punktem odniesienia jest prosty algorytm leksykalny, bez embeddingów i generowania odpowiedzi.

Zbiór: trzy publiczne fragmenty Protolume o symulacji, raporcie i formularzu. Autor przygotował 12 pytań oraz oczekiwane identyfikatory. Ten sam niewielki materiał posłużył do opracowania algorytmu i obserwacji jego zachowania.

Ustawienia: normalizacja liter i polskich znaków, jawna lista pomijanych słów i początków wyrazów. Próg pokrycia słów pytania: 40%; maksymalnie dwa wyniki. Ranking według liczby wspólnych słów, remis według identyfikatora.

Ocena: pierwszy identyfikator musi być zgodny z oczekiwanym; dla pytania spoza zakresu oczekiwany jest pusty wynik. Nie jest to Recall@k ani ocena odpowiedzi modelu.

Wywołania modelu: 0. Czas, praca i koszt infrastruktury nie były mierzone. Brak wywołań modelu nie oznacza zerowego kosztu całego eksperymentu.

Odtwórz pomiar i sprawdź jego ograniczenia

Pobierz i rozpakuj paczkę. W Pythonie 3.11 lub nowszym uruchom python run.py --output rerun.json. Nie wymaga kluczy, sieci ani dodatkowych bibliotek.

Porównaj wyniki z raportem JSON, pomijając datę uruchomienia i dodane pole wersji źródeł. Paczka zawiera pytania, korpus, algorytm i skrypt oceny z wersji 9bbe8d5.

Nie sprawdzono generowania odpowiedzi, sprzeczności, instrukcji w dokumentach ani jakości na danych klienta. Ten pomiar nie potwierdza skuteczności RAG w produkcji.

Dalsze kierunki

Pytania do kolejnych eksperymentów

Poniższe tematy są planami. Nie przedstawiają zakończonych wdrożeń ani potwierdzonych wyników.

Plan eksperymentu

Kontrola kosztów agentów

Sprawdzić, jak monitorować koszt, jakość i zachowanie modeli w praktyce.

Plan eksperymentu

Ewaluacja RAG

Wypracować wzorce oceny odpowiedzi oraz jakości indeksów wiedzy.

Plan eksperymentu

Orkiestracja przez komunikatory

Sprawdzić, jak zarządzać zadaniami i zatwierdzeniami przez komunikatory.

Plan eksperymentu

Automatyczna ocena odpowiedzi

Uprościć walidację odpowiedzi i proponować lepsze wzorce orkiestracji.