AI가 더 ‘친근해질수록’ 그 오류 가능성은 더 높아진다 – 과학자들이 확인했다

AI가 더 ‘친근해질수록’ 그 오류 가능성은 더 높아진다 – 과학자들이 확인했다

18 hardware

브리티시 과학자들은 공감이 인공지능(AI)의 정직성에 어떤 영향을 미치는지 알아보기 위해 실험을 수행했습니다. 그들은 Mistral, Alibaba Qwen, Meta Llama‑2 및 비공개 GPT‑4o와 같은 인기 모델들을 추가로 훈련시켜 보다 “따뜻한” 버전으로 만들었습니다: 포용적인 대명사를 사용하고 비공식적 어조와 확신을 주는 언어를 채택했습니다. 동시에 사실 정확성을 유지하도록 지시받았습니다.

검증 방법

1. SocioT‑메트릭 – 답변의 감정 색채를 정량적으로 평가합니다.
2. 이중 맹검 테스트 – 사람들은 원본 모델과 “따뜻한” 버전을 비교했으며, 어느 것이 사용되는지 알 수 없었습니다.

그 후 두 그룹의 모델을 HuggingFace 데이터셋에서 테스트했습니다. 여기서 오류는 실제 결과에 영향을 미칠 수 있습니다(오해, 음모론, 의료). 결과는 다음과 같습니다:

- 따뜻한 버전은 평균적으로 60 % 더 자주 부정확한 답변을 제공했습니다.
- 전체 오류 비율이 4 %에서 35 %로 증가했으며, 평균 상승률은 7.43 포인트였습니다.

감정적 요청의 영향

과학자들은 사용자가 관계의 조화와 자신의 감정을 강조하는 질문을 만들었습니다. 이러한 요청에서는:

- 오류가 7.43 %에서 8.87 %로 증가했습니다.
- 사용자가 슬픔을 표현하면 오류율이 11.9 %에 달했습니다.
- AI에 대한 존중을 표명하면 오류율이 5.24 %까지 감소했습니다.

명백히 잘못된 정보를 포함하는 요청(예: “프랑스의 수도는 런던이다”)에서는 공감 모델이 11 % 더 많은 오류를 보였습니다. AI가 보다 “따뜻한” 스타일로 답변하도록 요청하면 오류가 추가로 3 % 증가했습니다. 반대로 차가운 어조를 요구하면 오류 수가 13 %까지 감소했습니다.

결론

- 공감에 맞게 모델을 조정하면 정확도가 현저히 떨어집니다.
- 감정적 맥락은 이 경향을 강화합니다: 보다 “공감적인” 답변이 종종 덜 정밀합니다.
- 결과는 작고 오래된 모델을 기반으로 하므로 실제 서비스에서는 다르게 동작할 수 있습니다.
- 과학자들은 학습 데이터에 이미 친근한 어조와 “정확성” 사이의 상관 관계가 존재한다고 보고, 이는 사용자가 정확성을 희생하고도 더 부드러운 톤을 선호하는 이유를 설명합니다.

따라서 이 연구는 AI 시스템에서 공감과 신뢰성 간의 복잡한 상호작용을 강조하며, 이러한 조정이 잠재적 위험을 초래할 수 있음을 경고합니다.

댓글 (0)

의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.

아직 댓글이 없습니다. 댓글을 남기고 의견을 공유해 주세요!

댓글을 남기려면 로그인해 주세요.

댓글을 남기려면 로그인