Karol Leszczyński Build & Develop

Cytado — przypisy, które przechodzą sprawdzenie.

Własny produkt: podajesz temat, dostajesz zweryfikowane źródła z cytatem, numerem strony odczytanym z wydruku i linkiem do publikacji — gotowe do wklejenia razem ze sformatowaną bibliografią. Poniżej, skąd się wziął i co przy nim było najtrudniejsze.

2 262
zweryfikowane źródła oddane użytkownikom
6,3
źródła średnio na jedno zapytanie
159 814
stron z numerem odczytanym z druku
10
baz źródłowych, w tym orzeczenia sądów

Problem

Zmyślony przypis kosztuje więcej niż żaden.

Praca bez źródeł jest po prostu niekompletna. Praca ze źródłami, których nie da się odnaleźć, podważa wszystko, co jest obok — łącznie z tymi fragmentami, które były w porządku.

  1. 01

    Przypis to obietnica, którą ktoś sprawdzi

    Promotor, recenzent, redaktor. Wystarczy jedna pozycja, której nie da się odnaleźć, żeby pod znakiem zapytania stanęła cała reszta pracy.

  2. 02

    Modele językowe wymyślają źródła

    I robią to przekonująco: prawdziwie brzmiący tytuł, istniejące nazwisko, czasopismo, które faktycznie wychodzi, rok, który się zgadza. Nie istnieje tylko sam artykuł.

  3. 03

    Numer strony bywa zmyślony osobno

    Nawet gdy publikacja jest prawdziwa, podana strona często nie ma nic wspólnego z cytowanym fragmentem. To druga warstwa tego samego problemu i trudniejsza do wychwycenia.

  4. 04

    Sprawdzenie trwa dłużej niż napisanie

    Odnalezienie każdej pozycji, otwarcie pliku, znalezienie zdania i porównanie numeru strony zajmuje więcej czasu, niż zajęło wygenerowanie całego akapitu.

Rozwiązanie

Odwrócić kolejność: najpierw dokument, potem zdanie.

Typowe narzędzie generuje tekst i dokleja do niego przypisy. Tutaj jest odwrotnie — najpierw pobierana jest publikacja, dopiero z niej bierze się cytat, a przypis powstaje na końcu, z rzeczy, które już zostały przeczytane.

Najpierw plik, potem zdanie

Kolejność jest odwrócona wobec typowego narzędzia AI. Publikacja zostaje najpierw pobrana i przeczytana w całości, a przypis powstaje dopiero z tego, co w niej faktycznie stoi.

Numer strony odczytany z druku

Nie kolejny arkusz w pliku, tylko liczba wydrukowana na stronie — ta, którą sprawdzający zobaczy w papierowym wydaniu. Udało się ją odczytać na 159 814 z 178 545 stron.

Każda pozycja wskazuje plik i miejsce

Przypis prowadzi do konkretnego dokumentu i konkretnej strony, więc sprawdzający dochodzi do źródła w kilkanaście sekund. Przy weryfikacji cudzej bibliografii narzędzie oznacza pozycje jako potwierdzone albo niepotwierdzone — nigdy nie wyrokuje, że coś jest fałszywe.

Działa tam, gdzie piszesz

Panel, dodatek do przeglądarki, wtyczka do Worda i Google Docs, wtyczka WordPressa oraz serwer MCP, przez który z tego samego korpusu korzysta asystent AI.

Z produktu

Jak to wygląda w praktyce.

Trzy widoki. Pierwszy pokazuje wynik, drugi — co się dzieje, kiedy czegoś nie da się potwierdzić, trzeci — ten sam korpus użyty wewnątrz asystenta AI.

Cytado — Przypis, który da się sprawdzić
Przypis, który da się sprawdzić Cytat wzięty z pobranego pliku, numer strony z druku, gotowy zapis bibliograficzny i link do publikacji. Etykieta obok tytułu mówi wprost, że numeracja pochodzi z wydruku.
Cytado — Weryfikacja cudzej bibliografii
Weryfikacja cudzej bibliografii Każda pozycja sprawdzana w bazach naukowych. Trzy potwierdzone, jedna oznaczona jako niepotwierdzona — bez wyrokowania, że jest fałszywa, bo tego narzędzie nie może wiedzieć.
Cytado — Ten sam korpus wewnątrz asystenta AI
Ten sam korpus wewnątrz asystenta AI Serwer MCP podpięty do Claude: model pisze akapit, a twierdzenia osadza w prawdziwych publikacjach z numerami stron. Bez przeklejania czegokolwiek ręcznie.

Co było trudne

Cztery rzeczy, które zajęły najwięcej czasu.

  • Odczytanie numeru wydrukowanego na stronie W pliku PDF strona ma swój numer porządkowy, ale sprawdzający patrzy na liczbę wydrukowaną w stopce albo nagłówku — a te rozjeżdżają się o kilkanaście pozycji przez strony tytułowe, spisy treści i wkładki. Do tego numeracja bywa rzymska, łamana albo zaczyna się od nowa w każdym rozdziale. Bez tego przypis prowadziłby w złe miejsce, czyli byłby gorszy niż jego brak.
  • Odsianie fragmentów, które tylko wyglądają na trafne Wyszukiwanie po podobieństwie zwraca sporo tekstu, który na pierwszy rzut oka pasuje do tematu, a po przeczytaniu okazuje się o czymś innym. Osobny etap ocenia każdy znaleziony fragment pod kątem tego, czy faktycznie potwierdza tezę — w bazie jest już ponad pięćdziesiąt tysięcy takich ocen. Dzięki temu na jedno zapytanie wraca średnio sześć źródeł, ale takich, które da się obronić.
  • Dziesięć baz, każda z własnymi zasadami Crossref, OpenAlex, Semantic Scholar, DOAJ, Europe PMC, CORE, DOAB, Biblioteka Nauki i SAOS z orzeczeniami sądów. Różne formaty, różne limity, różna dostępność pełnych tekstów. Trzeba było sprowadzić to do jednego kształtu i pogodzić się z tym, że część publikacji pozostanie poza zasięgiem.
  • Jeden korpus, sześć różnych wejść Aplikacja, przeglądarka, Word, Google Docs, WordPress i serwer MCP. Każde ma inne ograniczenia i inny sposób autoryzacji, a wszystkie muszą oddawać dokładnie ten sam przypis — inaczej ten sam cytat wyglądałby inaczej w zależności od tego, gdzie się go wstawiło.

Co z tego dla Ciebie

Wdrożenie AI, które można postawić przed audytem.

W większości firm problem z modelem językowym nie polega na tym, że odpowiada za wolno albo za drogo, tylko że nie wiadomo, skąd wzięła się odpowiedź. Cytado jest dowodem, że da się to zbudować inaczej: każde zdanie wskazuje dokument i miejsce w nim, a system ma prawo powiedzieć, że nie wie.

Jeśli u Ciebie ktoś musi ręcznie sprawdzać, czy odpowiedź ma pokrycie w dokumentach — umowach, procedurach, dokumentacji technicznej — to ten sam schemat da się przenieść. Napisz, jak to dziś wygląda.

Powiązane usługi

Czym się zajmuję poza własnymi produktami.

Cytado to wdrożenie AI osadzone w prawdziwych dokumentach. Poniżej pozostałe rzeczy, które robię dla firm, razem z ceną wyjściową.

Rozmowa

Potrzebujesz odpowiedzi, które wskazują źródło?

Opisz, na jakich dokumentach pracujecie i kto dziś sprawdza, czy odpowiedź ma w nich pokrycie. Odpiszę, czy da się to osadzić tak, żeby każde zdanie wskazywało miejsce w pliku, i ile mniej więcej kosztowałoby wywołanie.