Devin.KR
데빈의 AI 기술 뉴스룸

엔비디아 니모 릴레이로 AI 에이전트 하네스 동작과 비효율 추적 분석

엔비디아 니모 릴레이는 AI 에이전트의 모델·도구 호출, 지연 시간, 토큰 사용량을 구조화된 추적 데이터로 기록해 단순 성공 여부 뒤에 숨겨진 비효율과 오류 복구 과정을 분석하도록 돕는다.

데빈 · AI 기술 에디터 · 4분 읽기

핵심 요약

  • 에이전트 최종 성공 여부만으로는 도구 재시도와 토큰 낭비 등 숨은 비효율 파악이 어렵다.
  • 니모 릴레이는 ATOF, ATIF, 오픈텔레메트리 3가지 형식으로 실행 수명주기를 기록한다.
  • 결과 검증기와 추적 데이터를 결합하면 하네스 개선 전후의 성능과 지연 시간 트레이드오프를 정밀 평가할 수 있다.
  1. 1작업 실행 및 수명주기 감지
  2. 2이벤트 스트림·궤적 데이터 생성
  3. 3오픈텔레메트리 스팬 내보내기
  4. 4검증 결과와 추적 데이터 비교 분석
한눈에 보는 흐름 · Devin.KR 이 기사 내용을 바탕으로 정리한 도식입니다.

에이전트 관측의 필요성

인공지능 에이전트는 주어진 작업을 완료하더라도 비효율적인 경로를 거칠 위험이 있다. 검색 실패로 인한 중복 질의나 파일 읽기 잘림에 따른 재호출이 발생해도 최종 응답이 정상적이면 이러한 불필요한 과정은 겉으로 드러나지 않는다. 그러나 이 과정에서 지연 시간이 늘어나고 토큰 소모가 급증하며 잠재적 실패 확률도 함께 커진다.

개발자가 에이전트 동작을 개선하려면 단순한 작업 성공 여부뿐만 아니라 어떤 방식으로 완료했는지를 구체적으로 확인해야 한다. 성공 여부 확인만으로는 도구 오류에서 어떻게 복구했는지, 조기 중단이 일어났는지, 불필요한 추가 모델 호출이 왜 발생했는지 설명할 수 없다.

니모 릴레이와 3가지 추적 형식

엔비디아 니모 릴레이(NeMo Relay)는 개발자가 모델과 도구 실행을 통일된 방식으로 관측하고 제어할 수 있도록 지원하는 프레임워크다. 에이전트 하네스인 허메스 에이전트(Hermes Agent)는 니모 릴레이를 내장하여 세션, 턴, 모델 호출, 도구 호출을 계층적 범위로 관리하고 수명주기 이벤트를 시간과 상하 관계에 맞춰 기록한다.

니모 릴레이의 관측 데이터는 작업 흐름에 맞춰 3가지 형식으로 제공된다. 에이전트 궤적 관측 형식(ATOF)은 범위 시작과 종료를 식별자와 타임스탬프로 기록한 로그이며, 개별 이벤트와 타이밍, 부모-자식 관계 감사를 지원한다. 에이전트 궤적 교환 형식(ATIF)은 수명주기 이벤트를 조합해 단계별 상호작용과 도구 호출을 정리한 구조다.

또한 오픈텔레메트리(OpenTelemetry) 및 오픈인퍼런스(OpenInference) 규격을 통해 에이전트, 거대언어모델, 도구 스팬을 라벨링한다. 이를 피닉스(Phoenix)나 랭스미스(LangSmith) 같은 호환 플랫폼으로 전송하면 모델과 도구 호출, 소요 시간, 토큰 사용량, 오류를 시각적으로 추적할 수 있다.

도구 연동 실험과 추적 검증

격리된 런타임 환경에서 허메스 에이전트와 니모 릴레이를 연동하는 실험은 두 가지 단계로 검증된다. 첫 번째 실험은 네트워크가 차단된 도커 격리 환경에서 터미널 도구로 정해진 값을 출력하는 단순 작업이다. 이 작업은 모델 호출과 도구 실행이 정상적으로 이뤄졌는지 확인하고 두 가지 추적 로그의 생성을 검증하는 데 목적이 있다.

두 번째 실험은 콘퍼런스 단서를 읽고 웹 검색과 공식 출처 검증을 거쳐 보고서를 작성하는 다중 도구 연구 작업이다. 파일 읽기, 웹 검색, 웹 추출, 파일 쓰기 호출이 순차적으로 실행되는 동안 니모 릴레이는 로컬에 로그를 남기면서 동시에 피닉스로 오픈텔레메트리 스팬을 전송한다. 이를 통해 개발자는 최초 파일 읽기부터 최종 응답까지의 도구 호출 및 토큰 사용 흐름을 투명하게 파악할 수 있다.

하네스 변경 평가와 벤치마크 사례

하네스 변경을 정밀 평가하려면 고정된 작업과 자동 검증기를 두고 단일 변경 사항 외의 모든 조건을 동일하게 유지한 상태에서 반복 측정을 진행해야 한다. 노우스 리서치(Nous Research)가 진행한 툴퍼프(ToolPerf) 벤치마크는 실제 세션의 도구 스키마 감사와 실패 패턴을 바탕으로 9개 과제를 구축하고 108회 실행을 비교 평가했다.

평가 결과 모델에 따라 하네스 수정의 영향이 상반되게 나타났다. 클로드 소넷 4.5(Claude Sonnet 4.5)는 수정 전후 작업 성공률과 턴 수에 유의미한 차이가 없었으나, 큐원3 코더 30B(Qwen3 Coder 30B)는 성공 과제가 늘어난 대신 평균 모델 호출, 도구 호출, 지연 시간이 증가했다. 실패로 중단되던 명령 차단 과제에서 복구 로직이 작동하면서 완료율이 오른 반면, 대소문자 무시 검색 과제에서는 불필요한 탐색이 늘어나 턴 수가 증가하는 회귀가 확인됐다.

적용 조건과 보안 유의점

니모 릴레이 기반의 추적 체계를 운영하기 위해서는 맥OS(macOS) 또는 리눅스 운영체제와 깃(Git), 컬(curl), 도커 환경이 갖춰져야 한다. 모델 호출을 위해서는 관련 애플리케이션 프로그래밍 인터페이스(API) 인증 키가 필요하며, 컨테이너 기반 샌드박스를 구성해 도구 실행 권한과 네트워크 접근을 제한해야 한다.

추적 로그를 외부 시스템이나 다른 조직과 공유할 때는 데이터 보안에 주의해야 한다. 생성된 추적 데이터에는 프롬프트 본문뿐만 아니라 모델의 원본 응답, 도구 인자, 실행 결과 데이터, 로컬 파일 경로 등 민감한 애플리케이션 정보가 그대로 포함될 수 있으므로 공유 전 사전 검토가 필수적이다.

데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.

출처 · 원문 확인

NVIDIA Developer Blog · William Markito Oliveira

Tracing Agent Harness Behavior with NVIDIA NeMo Relay

원문 발행: 2026-10-01 01:00:00

원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.

댓글 0

아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.

댓글을 남기려면 로그인이 필요합니다.

← 전체 소식 개발 도구 둘러보기