5. 1.5. Dlaczego model może generować informacje nieprawdziwe?

Generowane treści mogą być niezgodne z materiałem źródłowym, dostarczonym kontekstem lub możliwą do zweryfikowania wiedzą o świecie. W literaturze zjawisko to najczęściej określa się jako „halucynacje AI” (Ji i in. 2023), choć termin może niepotrzebnie antropomorfizować technologię, dlatego w tym kursie będziemy posługiwać się bardziej precyzyjnymi określeniami błąd faktograficzny, fabrykacja informacji, wygenerowanie nieistniejącego źródła, treść niezgodna z danymi lub nieuzasadnione twierdzenie.

Błędy mogą powstawać między innymi dlatego, że:

  • model generuje tekst na podstawie zależności statystycznych, a nie mechanizmu gwarantującego prawdziwość,
  • dane treningowe zawierają błędy, uproszczenia, uprzedzenia lub sprzeczne informacje,
  • w danych brakuje potrzebnych informacji,
  • informacje są nieaktualne,
  • polecenie jest nieprecyzyjne lub pozbawione istotnego kontekstu,
  • model uzupełnia brakujące elementy wzorcem, który pasuje językowo, ale nie odpowiada rzeczywistości,
  • model nie ma dostępu do wskazanego dokumentu, choć generowana odpowiedź może stwarzać inne wrażenie,
  • zadanie wykracza poza możliwości modelu lub dostępnych narzędzi,
  • rezultat zostaje zniekształcony na kolejnych etapach generowania.

Szczególnie niebezpieczne są odpowiedzi zawierające większość informacji poprawnych i niewielki, trudny do zauważenia błąd.


Przykład

Model generuje kod, który uruchamia się bez błędu, zwraca wynik, wygląda na poprawnie napisany, ale nie uwzględnia warunku brzegowego lub wykorzystuje niewłaściwą jednostkę. Ale poprawność składniowa kodu nie oznacza poprawności rozwiązania problemu.