마이크로소프트 연구원들은 AI 모델이 아직 복잡한 문제를 해결할 수 없다고 주장합니다
마이크로소프트 연구원들은 복잡한 다중 단계 작업을 수행할 때 현대 대형 언어 모델(LLM)의 한계를 밝혀냈습니다.
Microsoft Research의 실험에서 가장 진보된 AI 모델조차도 장기적이고 다단계 과정을 맡길 때 심각한 오류를 범한다는 것을 확인했습니다. 테스트 대상 시스템인 Gemini 3.1 Pro, Claude 4.6 Opus 및 GPT 5.4는 평균적으로 자율 처리 후 문서 내용의 약 25%를 잃었습니다.
테스트 내용
* 벤치마크 DELEGATE‑52
필립 라바나(Phillip Labana), 토비아스 슈나벨(Tobias Schnabel) 및 제니퍼 네빌(Jennifer Nevill)이 만든 이 테스트는 프로그래밍, 악보 작성에서 결정학(crystallography)에 이르기까지 52개 전문 분야의 업무 흐름을 모델링합니다.
* 평가 기준
모델은 20회 처리 사이클 후 문서 무결성을 얼마나 유지하는지에 따라 평가되었습니다. “준비성” 임계값은 98%로 설정되었으며, 결과가 이보다 낮으면 작업이 실패한 것으로 간주했습니다.
핵심 결론
분야별 최고 성과
프로그래밍 – 가장 강력한 지표
자연어 처리 – 가장 덜 신뢰할 수 있는 모델
* 품질 저하
문서 조합의 80% 이상에서 품질이 80% 이하로 떨어졌습니다. 최고의 모델(Gemini 3.1 Pro)은 52개 분야 중 단 11개에서만 준비성 기준을 충족했습니다.
* 점프형 오류
손실은 점진적으로 일어나지 않고 “점프” 형태였습니다: 한 사이클 내에 모델이 정확도 10%~30%를 잃을 수 있었습니다. 더 진보된 모델(Gemini 3.1 Pro, Claude 4.6, GPT 5.4)은 작은 오류를 피하려고 하여 나중 단계로 미루고 상호작용 횟수를 줄였습니다.
* 에이전트 관리
에이전트 모드에서 도구를 사용해도 결과가 향상되지 않았습니다: 사이클 말미에 품질은 약 6% 정도 감소했습니다.
사용자에게 의미하는 바
과학자들은 사용자들이 AI 시스템에 권한을 위임할 때 여전히 신중하게 감독해야 한다고 강조합니다. 현재 모델은 좁은 영역에서만 자율적으로 작동할 수 있습니다.
그럼에도 불구하고 벤치마크 작성자는 눈에 띄는 진전을 언급했습니다: OpenAI 모델군이 16개월 동안 성능을 14.7%에서 71.5%로 향상시켰습니다. 이는 LLM이 계속 발전하고 있음을 확인하지만, 아직 복잡한 다중 단계 작업에서는 제한적임을 보여줍니다
댓글 (0)
의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.
댓글을 남기려면 로그인