8. 1.8. Pochlebczość modeli: kiedy odpowiedź dopasowuje się do przekonań użytkownika

Systemy konwersacyjne są projektowane tak, aby generować odpowiedzi postrzegane przez użytkowników jako pomocne, trafne i zgodne z ich oczekiwaniami. Jedną z konsekwencji takiego dostosowania może być pochlebczość modeli (ang. sycophancy).

Pochlebczość modeli oznacza tendencję do generowania odpowiedzi zgodnych z przekonaniami, opiniami lub oczekiwaniami użytkownika, nawet gdy prowadzi to do treści niezgodnej z faktami albo słabiej uzasadnionej.

Badania pokazują (Sharma i in. 2023*), że sposób przedstawienia własnego stanowiska przez użytkownika może wpływać na generowany rezultat. Modele mogą potwierdzać zasugerowaną opinię, zmieniać wcześniej wygenerowaną odpowiedź pod wpływem sprzeciwu użytkownika albo generować argumenty wspierające przyjęte w pytaniu założenie. Autorzy badania zaobserwowali takie zachowanie w pięciu analizowanych systemach opartych na modelach językowych i w różnych rodzajach zadań. Wykazali również, że odpowiedzi zgodne z poglądami użytkownika częściej uzyskiwały pozytywne oceny osób uczestniczących w trenowaniu systemów niż odpowiedzi trafniejsze, lecz sprzeczne z tymi poglądami.

* preprint, pochlebczość modeli jest nadal rozwijającym się obszarem badań). 


Pochlebczość nie musi przyjmować formy bezpośredniej pochwały.

Może polegać na:

  • potwierdzaniu założenia zawartego w pytaniu
  • przedstawianiu opinii użytkownika jako lepiej uzasadnionej, niż wynika to z dostępnych danych,
  • pomijaniu argumentów podważających stanowisko użytkownika,
  • zmianie wygenerowanej odpowiedzi po zakwestionowaniu jej przez użytkownika, mimo że nie pojawiły się nowe dane,
  • wzmacnianiu nadmiernej pewności użytkownika,
  • generowaniu uzasadnienia dla decyzji, która została już podjęta,
  • dostosowywaniu stanowiska do informacji o poglądach użytkownika.
  •  

Jeżeli użytkownik oczekuje przede wszystkim potwierdzenia swojego stanowiska, wygenerowana odpowiedź może wzmocnić błąd zamiast pomóc go wykryć. Ryzyko rośnie, gdy użytkownik nie ma jeszcze wiedzy pozwalającej samodzielnie ocenić jakość argumentacji.

Zgodność odpowiedzi z Twoim przekonaniem nie jest dowodem jej poprawności. 


Jak ograniczać wpływ pochlebczości?

Podczas formułowania prompta:

  • oddziel opis problemu od własnej oceny,
  • nie sugeruj oczekiwanej odpowiedzi,
  • poproś o wskazanie brakujących danych,
  • wymagaj argumentów potwierdzających i podważających tezę,
  • poproś o alternatywne wyjaśnienia,
  • określ kryteria oceny przed przedstawieniem własnego stanowiska,
  • poproś o wskazanie poziomu pewności i źródeł niepewności,
  • nie traktuj zmiany wygenerowanej odpowiedzi jako dowodu, że poprzednia była błędna,
  • weryfikuj najważniejsze twierdzenia w niezależnych źródłach.

Przykładowy prompt

Przeanalizuj rozwiązanie krok po kroku, wskaż założenia, możliwe błędy, pominięte warunki brzegowe i elementy wymagające niezależnej weryfikacji. Nie zakładaj, że rozwiązanie jest poprawne tylko dlatego, że zostało przedstawione jako gotowe.