Ta strona używa plików cookies, aby zapewnić najlepszą jakość korzystania z naszego serwisu oraz do celów analitycznych. Klikając "Akceptuję", wyrażasz zgodę na używanie wszystkich plików cookies. Możesz również odrzucić zgodę, co spowoduje zablokowanie plików cookies analitycznych. Więcej informacji znajdziesz w naszej Polityce Prywatności.
Chatboty AI inaczej niż ludzie rozstrzygają dylematy medyczne
Chatboty AI inaczej niż ludzie ważyły cechy pacjentów potrzebujących nerki.
Modele często skupiały się na jednym atrybucie zamiast równoważyć kilka okoliczności.
AI prawie nie korzystała z opcji rzutu monetą, która pozwalała wyrazić niezdecydowanie.
Badanie oparto na scenariuszach hipotetycznych, a nie na rzeczywistych decyzjach klinicznych.
Sponsorowane
Odkryj rewolucyjną metodę nauki języków
Sprawdź jak w 30 dni opanować podstawy dowolnego języka obcego bez wychodzenia z domu.
Sztuczna inteligencja może pomagać w porządkowaniu informacji i formułowaniu rekomendacji, ale nowe badanie zespołu z Penn State pokazuje, że jej sposób rozstrzygania trudnych dylematów może wyraźnie różnić się od ludzkiego. W hipotetycznym scenariuszu dotyczącym przeszczepu nerki badane chatboty często opierały wybór na jednej cesze pacjenta, zamiast równoważyć kilka okoliczności. Jednocześnie modele niemal zawsze wskazywały konkretnego odbiorcę narządu, nawet gdy nie było jednej oczywiście prawidłowej odpowiedzi.
Dylemat z jedną dostępną nerką
Naukowcy wykorzystali sytuację, w której kilku pacjentów potrzebuje tej samej nerki, lecz dostępny jest tylko jeden narząd. To przykład problemu ograniczonego zasobu, przywoływany wcześniej przez laureata Nagrody Nobla Alvina Rotha w kontekście sposobów projektowania reguł przydziału. Autorzy nowej pracy nie analizowali jednak wyłącznie technicznego mechanizmu rozdzielania narządu. Chcieli sprawdzić, jak w takim wyborze ujawniają się wartości moralne oraz czy odpowiedzi AI są podobne do ocen formułowanych przez ludzi. Znaczenie tego pytania wykracza poza transplantologię. Podobne problemy mogą pojawiać się wszędzie tam, gdzie trzeba zdecydować, kto otrzyma ograniczone świadczenie, miejsce lub inną ważną możliwość.
Porównano odpowiedzi kilku chatbotów AI z wynikami wcześniejszych badań, w których takie same scenariusze oceniali ludzie.
Hipotetycznych pacjentów opisano między innymi za pomocą wieku, liczby osób na utrzymaniu, stanu zdrowia i nawyków związanych z piciem.
W części testów analizowano pojedynczą cechę, a w części zestawiano kilka cech, aby sprawdzić, jak model waży sprzeczne informacje.
Słownik artykułu
Pojęcia, które warto znać
Krótkie objaśnienia terminów występujących w tekście. Każde hasło prowadzi do szerszej definicji i przykładów użycia.
Badacze dodali także możliwość rzutu monetą, traktując ją jako sposób na wyrażenie niezdecydowania w sytuacji bez jasnego rozwiązania.
Jak przeprowadzono porównanie AI i ludzi
Zespół skorzystał z istniejących zbiorów danych pochodzących z opublikowanych badań nad przydziałem nerek. Wcześniej setki uczestników bez określonego przygotowania medycznego odpowiadały na pytania dotyczące tych samych typów wyborów. Naukowcy zadali podobne pytania kilku chatbotom, a następnie zestawili decyzje modeli z wcześniejszymi ocenami ludzkimi. W jednym wariancie izolowano pojedynczy atrybut, na przykład wiek albo stan zdrowia. W innym łączono kilka informacji, aby sprawdzić, czy model potrafi uwzględnić ich łączny, czasem konkurencyjny charakter. Osobny test obejmował opcję rzutu monetą. Nie chodziło o to, aby losowanie było medycznie uzasadnioną metodą przydziału narządu, lecz o sprawdzenie, czy system rozpozna sytuację, w której żadna z dostępnych odpowiedzi nie ma wyraźnej przewagi moralnej.
Modele skupiały się na pojedynczych cechach
Według Hadi Hosseiniego, profesora nadzwyczajnego informatyki, systemów inteligentnych i ekonomii w Penn State, jednym z głównych wyników było częste rozchodzenie się odpowiedzi AI z ludzkimi wartościami w sposobie oceniania cech pacjentów. Badane chatboty miały koncentrować się na jednym czynniku, zamiast zestawiać wiele okoliczności. Jako przykład badacze wskazali nawyki związane z piciem. Oznacza to, że model mógł nadać temu atrybutowi dominujące znaczenie, choć ludzie w podobnych dylematach uwzględniali szerszy zestaw informacji. Taki sposób odpowiedzi upraszcza problem, który z założenia nie ma prostego rozwiązania. W rzeczywistej medycynie wybór dotyczący narządu do przeszczepu nie jest zwykłym porównaniem dwóch krótkich opisów. Wymagałby uwzględnienia obowiązujących zasad, oceny klinicznej, procedur kwalifikacji oraz odpowiedzialności osób i instytucji podejmujących decyzję. Badanie nie proponuje więc kryterium, według którego pacjenci powinni być szeregowani. Pokazuje natomiast, że sposób działania modelu może nie odpowiadać temu, jak ludzie rozumieją równoważenie wielu względów.
Pewność AI tam, gdzie ludzie widzą niejednoznaczność
Drugą różnicą było niezdecydowanie. Ludzie w obliczu konfliktu wartości częściej dopuszczali możliwość, że nie ma jednej poprawnej odpowiedzi. Chatboty niemal nigdy nie wybierały opcji rzutu monetą, nawet gdy badacze wyraźnie ją udostępnili. Zamiast tego przeważnie wskazywały jednego z pacjentów i formułowały odpowiedź z dużą pewnością. Hosseini ocenił, że ludzkie niezdecydowanie może częściowo wynikać z niechęci do przyjęcia pełnej odpowiedzialności za rozstrzygnięcie. Niezależnie od przyczyny sama różnica ma znaczenie praktyczne. W sytuacji moralnej niejednoznaczności stanowczo brzmiąca odpowiedź może sprawiać wrażenie, że istnieje obiektywnie lepszy wybór, choć system wcale nie wykazał, że potrafi taką przewagę uzasadnić. Płynność językowa i zdecydowany ton nie są dowodem poprawności decyzji. Mogą natomiast wpływać na to, jak użytkownik oceni rekomendację i jak dużym zaufaniem ją obdarzy.
Dlaczego wynik jest ważny dla medycyny
Autorzy podkreślają, że decyzje dotyczące przydziału narządów bezpośrednio wpływają na to, kto może otrzymać szansę na przeżycie. Z tego powodu rola AI w takich procesach nie powinna być oceniana wyłącznie przez pryzmat szybkości, wygody albo podobieństwa odpowiedzi do ludzkich odpowiedzi. Trzeba także sprawdzić, jakie cechy system uznaje za istotne, czy potrafi ujawnić niepewność i czy człowiek może zrozumieć podstawę rekomendacji. Hadi Hosseini zaznaczył, że badanie nie ma zachęcać do zastępowania profesjonalnego osądu AI w decyzjach medycznych ani w innych sytuacjach wysokiej stawki. Jego zdaniem, wraz ze wzrostem wykorzystania systemów AI przez osoby, organizacje i firmy, coraz ważniejsze staje się poznanie ich zachowania. Dotyczy to także przypadków, w których człowiek formalnie podejmuje ostateczną decyzję, ale wcześniej otrzymuje sugestię wygenerowaną przez model.
Współautor pracy John Dickerson, dyrektor generalny Mozilla.ai, zwrócił uwagę, że przy rozdzielaniu ograniczonego zasobu nie zawsze istnieje jedna obiektywnie prawidłowa odpowiedź. Ludzie mogą rozpoznać tę niejednoznaczność i włączać ją do procesu poprzez debatę oraz ustalanie reguł. Modele AI często przedstawiają natomiast jedno rozstrzygnięcie bez podobnego sygnału wahania. Z tego powodu naukowcy wskazują na potrzebę dalszych badań i zarządzania rozwojem takich systemów z udziałem ustawodawców, regulatorów oraz innych zainteresowanych stron. Pytanie nie sprowadza się tylko do tego, czy AI potrafi udzielić odpowiedzi na moralny dylemat. Równie ważne jest to, czy sposób działania systemu pozostaje zgodny z wartościami, zasadami i procedurami przyjętymi przez ludzi.
Praca została przedstawiona w czerwcu 2026 roku podczas konferencji Association for Computing Machinery Fairness, Accountability and Transparency, znanej jako FAccT, a następnie opublikowana w materiałach konferencyjnych. Jej pełny tytuł brzmi „Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values”. Autorami byli badacze z Penn State, w tym Hadi Hosseini, Samarth Khanna i Leona Pierce, we współpracy z Johnem Dickersonem. Badanie opisuje hipotetyczne wybory i porównuje je z wynikami wcześniejszych eksperymentów z udziałem ludzi. Nie jest zatem oceną skuteczności AI w leczeniu, kwalifikowaniu konkretnych pacjentów ani prowadzeniu rzeczywistych procedur transplantacyjnych. Wnioski dotyczą przede wszystkim sposobu, w jaki modele reagują na moralne konflikty i jak pewnie prezentują swoje odpowiedzi. Publikację można znaleźć w materiałach ACM pod numerem DOI 10.1145/3805689.3806437.