마이크로소프트 연구원들은 AI 모델이 아직 복잡한 문제를 해결할 수 없다고 주장합니다

마이크로소프트 연구원들은 AI 모델이 아직 복잡한 문제를 해결할 수 없다고 주장합니다

18 hardware

마이크로소프트 연구원들은 복잡한 다중 단계 작업을 수행할 때 현대 대형 언어 모델(LLM)의 한계를 밝혀냈습니다.

Microsoft Research의 실험에서 가장 진보된 AI 모델조차도 장기적이고 다단계 과정을 맡길 때 심각한 오류를 범한다는 것을 확인했습니다. 테스트 대상 시스템인 Gemini 3.1 Pro, Claude 4.6 Opus 및 GPT 5.4는 평균적으로 자율 처리 후 문서 내용의 약 25%를 잃었습니다.

테스트 내용
* 벤치마크 DELEGATE‑52
필립 라바나(Phillip Labana), 토비아스 슈나벨(Tobias Schnabel) 및 제니퍼 네빌(Jennifer Nevill)이 만든 이 테스트는 프로그래밍, 악보 작성에서 결정학(crystallography)에 이르기까지 52개 전문 분야의 업무 흐름을 모델링합니다.

* 평가 기준
모델은 20회 처리 사이클 후 문서 무결성을 얼마나 유지하는지에 따라 평가되었습니다. “준비성” 임계값은 98%로 설정되었으며, 결과가 이보다 낮으면 작업이 실패한 것으로 간주했습니다.

핵심 결론
분야별 최고 성과
프로그래밍 – 가장 강력한 지표
자연어 처리 – 가장 덜 신뢰할 수 있는 모델

* 품질 저하
문서 조합의 80% 이상에서 품질이 80% 이하로 떨어졌습니다. 최고의 모델(Gemini 3.1 Pro)은 52개 분야 중 단 11개에서만 준비성 기준을 충족했습니다.

* 점프형 오류
손실은 점진적으로 일어나지 않고 “점프” 형태였습니다: 한 사이클 내에 모델이 정확도 10%~30%를 잃을 수 있었습니다. 더 진보된 모델(Gemini 3.1 Pro, Claude 4.6, GPT 5.4)은 작은 오류를 피하려고 하여 나중 단계로 미루고 상호작용 횟수를 줄였습니다.

* 에이전트 관리
에이전트 모드에서 도구를 사용해도 결과가 향상되지 않았습니다: 사이클 말미에 품질은 약 6% 정도 감소했습니다.

사용자에게 의미하는 바
과학자들은 사용자들이 AI 시스템에 권한을 위임할 때 여전히 신중하게 감독해야 한다고 강조합니다. 현재 모델은 좁은 영역에서만 자율적으로 작동할 수 있습니다.

그럼에도 불구하고 벤치마크 작성자는 눈에 띄는 진전을 언급했습니다: OpenAI 모델군이 16개월 동안 성능을 14.7%에서 71.5%로 향상시켰습니다. 이는 LLM이 계속 발전하고 있음을 확인하지만, 아직 복잡한 다중 단계 작업에서는 제한적임을 보여줍니다

댓글 (0)

의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.

아직 댓글이 없습니다. 댓글을 남기고 의견을 공유해 주세요!

댓글을 남기려면 로그인해 주세요.

댓글을 남기려면 로그인