Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개
Hcompany가 GUI, 코드 샌드박스, MCP, 비즈니스 API를 단일 모델로 통합 제어하는 에이전트 시리즈 Holo4와 경량 모델 Holotron4 Nano를 공개했다. 가중치와 실행 궤적도 함께 공개된다.
데빈 · AI 기술 에디터 ·
인공지능 연구 기업 Hcompany는 2026년 9월 28일, 소프트웨어의 다양한 인터페이스를 단일 모델로 다루는 범용 컴퓨터 사용 에이전트 시리즈 'Holo4'를 공개했다. 이번에 발표된 모델은 27B 파라미터 밀집(dense) 구조의 'Holo4-27B'와 35B 기반의 혼합 전문가(Mixture of Experts, MoE) 구조인 'Holo4-35B-A3B' 두 가지다. 두 모델은 H Models API를 통해 제공되며, 엔비디아 네모트론 연합(NVIDIA Nemotron Coalition) 협력의 일환으로 기존 Holotron 3의 후속인 경량 모델 'Holotron4 Nano'도 함께 업데이트되었다. Holo4는 플랫폼별로 별도 모델을 선택할 필요 없이 데스크톱, 웹, 안드로이드, 코드 샌드박스, 비즈니스 API 전반에서 동일한 호출 방식으로 동작하도록 설계되었다.
기존의 자율 에이전트 모델들은 대개 특정 단일 인터페이스 환경에 맞춰 분절적으로 훈련되었다. 그래픽 사용자 인터페이스(GUI)에 특화된 모델은 화면이 없으면 동작하지 못하고, 도구 호출(Tool Calling)에 특화된 모델은 API가 없는 소프트웨어 환경에서 멈추는 사일로 현상이 발생했다. 그러나 실제 업무 환경은 시각적 화면 조작과 API 호출, 스크립트 실행이 한 작업 안에서 복합적으로 요구된다. Hcompany는 학술적 벤치마크만을 위한 모델이 아닌 실제 기업 업무 처리를 목표로 삼았으며, 화면 클릭 및 타이핑, 자체 코드 작성 및 실행, 모델 컨텍스트 프로토콜(MCP) 및 API 도구 호출 중 작업에 가장 적합한 방식을 모델이 스스로 결합해 사용하도록 구조를 일원화했다고 밝혔다.
Holo4는 지도학습과 강화학습을 거쳐 구축되었으며, 훈련에는 자체 데이터 파이프라인인 '에이전틱 태스크 팩토리(Agentic Task Factory)'가 활용되었다. 이 파이프라인은 실제 웹사이트 스크린샷이나 오픈소스 소프트웨어 문서만을 기반으로 상호작용 가능한 환경과 검증 가능한 과제를 자동 생성한다. 이를 통해 웹 애플리케이션, MCP 서버, 데스크톱 환경 및 GUI와 MCP가 동일 상태를 공유하는 하이브리드 환경을 아우르는 약 1만 건의 과제가 구축되어 모델 훈련에 사용되었다. 아울러 모델의 동작을 실행하고 문맥을 관리하는 실행 루프인 하네스(Harness) 역시 전면 재설계되었다. 수백 단계의 작업 흐름을 추적할 수 있는 메모리 체계를 도입하고 데스크톱 머신 내부에서 직접 셸(Shell)을 다룰 수 있는 권한을 부여함으로써 긴 작업 도중 발생하던 실패 요인을 보완했다.
정량 평가 지표에서 Holo4 시리즈는 기반 모델인 큐웬(Qwen) 대비 성능과 효율성을 크게 끌어올렸다. 데스크톱 제어 벤치마크인 OSWorld 2.0에서 Holo4-27B는 61.7%의 작업 성공률을 기록했고, 35B-A3B 모델은 30.9%를 달성했다. API 활용도를 측정하는 오토메이션벤치(AutomationBench v1.0.6)에서도 주요 프론티어 모델들과 경쟁 가능한 성능을 나타냈다. 실제 전문 소프트웨어 실행 예시를 보면, 프리캐드(FreeCAD)를 사용한 에펠탑 3D 모델링 작업에서 Holo4-27B는 84회 호출과 130만 토큰으로 복잡한 기하학적 형상을 완성했다. 또한 고도(Godot) 엔진 기반의 팩맨 게임 제작 과제에서는 자율 주행 휴리스틱을 갖춘 268줄의 코드를 68회 호출과 240만 토큰으로 작성했다. 이는 동일한 작업 조건에서 197회 호출과 1140만 토큰을 소모한 베이스 모델(Qwen3.8-27B) 대비 호출 횟수와 토큰 사용량을 대폭 절감한 결과다.
Hcompany의 사후 훈련(Post-training) 기술은 특정 모델 크기에 종속되지 않고 범용적으로 전이되는 특성을 보였다. 엔비디아의 '네모트론 3 나노 옴니(Nemotron 3 Nano Omni)'에 동일한 훈련 레시피를 적용한 'Holotron4 Nano' 역시 GUI 워크플로우와 MCP, API, 코드 샌드박스 전반에서 기본 모델 대비 성능 향상을 기록했다. 개발자는 H Models API 외에도 허깅페이스(Hugging Face)를 통해 배포되는 BF16, FP8, NVFP4, 4비트 GGUF 형식의 모델 가중치를 내려받아 자체 인프라에 구성할 수 있다. 추론 속도를 추가로 향상하기 위한 최적화된 DSpark 드래프터(Drafter) 체크포인트도 순차 공개될 예정이다. 또한 공공 벤치마크에서 기록한 모든 단계별 실행 궤적(Trajectories) 데이터셋과 웹 뷰어도 함께 제공된다.
원문 자료에서 밝힌 평가 조건과 제약 사항을 보면, Holo4-27B의 OSWorld 2.0 점수(61.7%)는 폐쇄형 최상위 모델인 클로드 오퍼스 5.5(Opus 5.5, 81.8%)와 비교했을 때 여전히 격차가 존재한다. 비용 효율성 분석 수치 또한 Holo4의 경우 H Models API의 단일 실행 요율을 기준으로 산출되었으며, 큐웬 모델은 알리바바 클라우드 정가(캐시 적중 시 입력 비용 20% 반영)를 기준으로 계산되어 절대적인 단일 기준이 아니다. 또한 오토메이션벤치 수치의 경우 타사 모델들은 비공개 평가 셋의 공식 리더보드 기준인 반면, Holo4는 내부 하네스를 이용한 공개 셋(v1.0.6) 기준 측정값이며 비공개 셋 평가는 추후 보고될 예정이다. 과제 릴리스 버전과 서브셋, 하네스 구성에 따른 차이가 명시되어 있으므로 도입 검토 시 평가 환경의 차이를 고려할 필요가 있다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Hugging Face Blog
Holo4: powering generalist computer-use agents
원문 발행: 2026-09-28 18:44:05
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- NVIDIA, AI 에이전트 안전성 강화를 위한 오픈 플랫폼 공개: 하드웨어 기반 모니터링 및 정책 강제 · NVIDIA Developer Blog · 2026-09-28
- 세이지메이커 하이퍼팟과 쿠물로 연계 멀티 리전 분산 학습 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-26
- Datasette 1.0a40 버전 공개 · Simon Willison · 2026-09-17
- 데이터셋 0.65.5 보안 업데이트 배포 · Simon Willison · 2026-09-17
- 의료 및 생명과학 분야 AI 추론 개선을 위한 오픈소스 에이전트 스킬 공개 · AWS Machine Learning Blog · 2026-09-17
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.