Badacze z Icahn School of Medicine at Mount Sinai sprawdzili, czy krótka instrukcja bezpieczeństwa zmienia odpowiedzi dużych modeli językowych w scenariuszach klinicznych. Przeanalizowali 20 modeli, 501 wariantów 50 przygotowanych sytuacji oraz 100 przypadków opartych na zanonimizowanych kartach wypisowych.

Łącznie powstało 10 096 800 odpowiedzi. Bez dodatkowego przypomnienia o konieczności weryfikacji i eskalacji ryzykownych decyzji 16,6 proc. odpowiedzi zaklasyfikowano jako potencjalnie szkodliwe. Po dodaniu krótkiej instrukcji odsetek spadł do 10,1 proc.

Poprawę odnotowano w 19 z 20 badanych modeli. Jednocześnie ponad jedna dziesiąta odpowiedzi po zastosowaniu zabezpieczenia nadal mieściła się w kategorii ryzyka. Wynik pokazuje więc częściową redukcję problemu, a nie jego rozwiązanie.

Scenariusze obejmowały między innymi sytuacje, w których polecenie mogło skłaniać model do pominięcia badania kontrolnego, przerwania leczenia albo wykonania instrukcji sprzecznej z bezpiecznym postępowaniem. Celem nie było sprawdzenie całej jakości diagnoz, lecz odporności na jawnie niebezpieczne lub presyjne polecenia.

Autorzy podają, że około 1,18 mln z ponad 10 mln wygenerowanych wyborów uznano za potencjalnie szkodliwe w całym eksperymencie. Badanie wykazało też zróżnicowaną powtarzalność odpowiedzi między modelami, co utrudnia traktowanie pojedynczej dobrej odpowiedzi jako dowodu stabilnego bezpieczeństwa.

Praca ma charakter testu porównawczego i — jak zaznaczają autorzy — nie szacuje rzeczywistego ryzyka w już wdrożonych systemach klinicznych. Warunki laboratoryjne, sposób konstrukcji scenariuszy oraz definicja bezpiecznej odpowiedzi wpływają na wynik.

Najważniejszy praktyczny wniosek jest ograniczony: dodatkowa instrukcja może być użyteczną warstwą ochronną, ale nie zastępuje kwalifikowanego personelu, walidacji systemu, monitorowania błędów ani odpowiedzialności medycznej. Użytkownik nie powinien na podstawie tego badania traktować chatbota jako samodzielnego lekarza.