마이크로소프트, AI 시스템의 현실적 평가와 '예상 밖 실패' 분석
마이크로소프트 연구팀은 대규모 언어 모델(LLM)이 다중 턴 대화 및 장기 작업에서 겪는 성능 저하와 '예상 밖 실패'를 분석하고, 실제 사용자 환경에 맞는 평가 방법과 개선 방안을 제시한다.
핵심 요약
- LLM은 다중 턴 대화에서 성능이 크게 저하되며, 장기 작업에서 오류가 누적될 수 있다.
- 기존 벤치마크는 실제 사용자 상호작용의 복잡성을 반영하지 못한다.
- 사용자는 AI에 100% 위임하기보다 검증과 함께 활용하고 상세한 피드백을 제공해야 한다.
- 마이크로소프트는 실제 데이터 분석을 통해 모델 개선을 위한 통찰력을 얻는다.
- 1사용자 행동 분석
- 2현실적 평가 설계
- 3모델 성능 저하 발견
- 4알고리즘 개선 및 사용자 가이드
AI 평가의 중요성
마이크로소프트 연구팀의 파트너 연구 관리자이자 퍼듀 대학교 컴퓨터 과학 및 통계학과 교수인 제니퍼 네빌(Jennifer Neville)은 대규모 언어 모델(LLM)을 포함한 AI 시스템이 실제 작업 환경에서 겪는 '예상 밖 실패(surprising failures)'와 그 원인을 분석하고, 이를 개선하기 위한 평가 방법론을 제시한다. 네빌 팀은 AI 시스템의 행동 경계를 현실적인 작업 환경에서 연구하며, 사용자가 실제 워크플로우에서 겪는 경험을 바탕으로 모델 성능을 향상하는 데 중점을 둔다. 기존의 기계 학습 및 AI 평가 방식은 실제 사용 환경에 비해 단순한 벤치마크에 의존하는 경향이 있어, 실제 사용 시 발생하는 복잡한 문제들을 포착하지 못한다.
네빌 팀은 시스템에 무엇을 기대하는지 질문하고, 다중 턴(multiturn) 대화, 협업 환경, 장기 작업(long-horizon tasks) 등 실제 사용 환경을 반영한 실용적인 평가를 설계한다. 이러한 평가를 통해 성능 격차나 문제점들을 파악하고, 이를 바탕으로 시스템을 이론적 또는 알고리즘적으로 개선할 필요가 있는 부분을 식별한다. 궁극적으로는 더 나은 알고리즘, 모델, 추정 방법을 개발하여 모델의 성능을 향상하는 것을 목표로 한다.
다중 턴 및 장기 작업 문제
네빌 팀의 연구는 LLM이 다중 턴 대화에서 길을 잃거나, 에이전트 기반 지식 작업 시 문서 내용을 손상할 수 있음을 보여준다. 다중 턴 대화 연구에서는 공개된 단일 턴(single-turn) 벤치마크 데이터셋을 활용하여, 사용자가 여러 턴에 걸쳐 지시 사항을 점진적으로 명확히 하는 상황을 시뮬레이션했다. 그 결과, 단일 턴 시나리오에서 매우 높게 나타났던 모델 성능이 다중 턴 환경에서는 크게 저하되는 현상을 발견했다. 이는 모델 개발자들이 단일 턴 성능에 최적화되어 있기 때문에 발생하는 예상 밖의 결과이다. 관련 연구로는 2025년 5월에 발표될 예정인 'LLMs Get Lost In Multi-Turn Conversation' 논문이 있다.
이러한 문제에 대한 실용적인 해결책으로, 모델이 다중 턴 대화에서 혼란을 겪을 경우 대화를 중단하고 초기화한 뒤, 모든 정보를 포함한 단일 턴 지시를 다시 제공하는 방법을 제안한다. 또한, 에이전트가 문서를 반복적으로 편집하는 장기 워크플로우 환경에서는 오류가 누적되어 AI를 더욱 혼란스럽게 만들 수 있음을 확인했다. 에이전트가 사용자의 의도를 추적하고, 현재 상태, 관련 정보, 변경 사항 등을 이해하는 것이 복잡한 작업에서 중요한 과제로 남아 있다. 이와 관련된 연구로는 2026년 4월에 발표될 예정인 'LLMs Corrupt Your Documents When You Delegate' 논문이 있다.
사용자 행동 분석과 데이터 활용
마이크로소프트는 내부적으로 제품 그룹과 협력하여 대규모 소비자 로그를 분석, 사용자들이 겪는 주요 실패 및 성공 패턴을 파악한다. 이러한 분석은 연구팀의 많은 작업에 대한 통찰력과 동기를 제공한다. 데이터 분석은 사용자 개인 정보를 보호하는 방식으로 이루어진다. 연구팀은 실제 사용자 데이터를 직접 보지 않고, 제한된 환경에서 데이터를 처리하여 실패 또는 성공 패턴과 같은 고수준의 통찰력을 추출한다. 이는 모델 개선을 위한 알고리즘 개발에 활용된다.
검색 엔진이 처음 등장했을 때 사용자들이 효과적인 정보 검색 방법을 학습해야 했던 것처럼, 현재의 채팅 기반 AI 시스템에서도 사용자들의 새로운 학습이 필요하다고 본다. 성공적인 사용자 행동 패턴을 분석하여 사용자에게 시스템 활용법을 추천하거나 교육하는 데 활용할 수 있다. 또한, 사용자가 제공하는 상세한 피드백(예: '싫어요'와 함께 제공하는 구체적인 설명)도 모델 업데이트에 중요한 역할을 한다.
개발자와 사용자를 위한 제언
현재 AI 시스템은 많은 유용한 기능을 제공하지만, 사용자는 100% 성공을 기대해서는 안 된다. AI가 제공하는 답변을 항상 확인하고, 만약 답변이 부정확하다고 판단되면 모델이 해당 작업을 전혀 수행할 수 없다고 단정하기보다 다른 방식으로 질문하거나 다시 시도해야 한다. AI 시스템은 아직 100% 위임할 준비가 되어 있지 않으므로, 인간의 감독과 검증을 통해 워크플로우에 통합하는 것이 효과적이다.
사용자가 모델과 상호작용할 때 문제가 발생하면, 무엇이 잘못되었는지, 무엇을 기대했는지, 그리고 대신 무엇을 얻었는지에 대한 상세한 피드백을 제공하는 것이 모델 개선에 매우 유용하다. 이러한 피드백은 모델을 사용자가 원하는 방향으로 훈련하는 데 기여한다. 연구팀은 AI 연구의 빠른 발전 속도를 고려할 때, 현재의 난제들이 예상보다 훨씬 빠르게 해결될 수 있다고 전망한다.
AI 아키텍처의 미래와 연구 방향
AI 연구 커뮤니티는 현재 트랜스포머(transformer) 아키텍처가 AI 시스템의 근본적인 모델로서 적합한지에 대한 질문을 던지고 있다. 트랜스포머의 계산 방식에는 알려진 한계가 있으며, 이러한 한계 중 상당수는 모델 주변의 에이전트 하네스(agentic harnesses)와 백엔드에서 이루어지는 추론을 통해 해결될 수 있다. 그러나 근본적으로 다른 아키텍처가 필요한지에 대한 논의도 활발하다. 향후 AI 연구는 대체 아키텍처와 모델의 빠른 발전뿐만 아니라, 기존 모델을 둘러싼 정교한 래퍼(wrapper) 개발에 초점을 맞출 것으로 예상된다.
또한, 모델이 작업하는 세계를 현재보다 훨씬 더 실질적인 방식으로 이해하도록 하는 장기적인 상호작용에 대한 연구가 중요해질 것이다. 네빌은 인간과 AI가 팀을 이루어 함께 혁신하고 목표를 달성하는 작업 환경을 구현하는 것이 자신의 연구 목표라고 밝힌다. 과거 2000년대 초반에는 AI가 바둑을 두는 데 50~100년이 걸릴 것이라고 예상했지만, 현재는 이미 해결된 문제인 것처럼, 현재의 AI 난제들도 예상보다 훨씬 빠르게 해결될 수 있다고 전망한다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Microsoft Research · Chad Atalla, Jennifer Neville
What AI gets wrong and what failure teaches us
원문 발행: 2026-10-07 01:19:06
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 2026년 개발자 설문조사 결과 발표: AI 활용 및 업무 환경 변화 동향 · Stack Overflow Blog · 2026-10-06
- TII, 아랍에미리트 방언과 문화 맥락에 특화된 언어 모델 Falcon-Emirati-7B 공개 · Hugging Face Blog · 2026-10-06
- 깃허브와 마이크로소프트, AI 코드 리뷰 벤치마크 '리뷰벤치' 공개 · GitHub Blog · 2026-10-06
- 마이크로소프트와 허깅페이스, AI 에이전트 평가 프레임워크 '씽킹박스' 공개 · Hugging Face Blog · 2026-10-04
- Amazon Quick과 Adjudicated Query 패턴으로 대규모 규정 준수 검사 자동화 · AWS Machine Learning Blog · 2026-10-03
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.