본문 바로가기
인공지능

인공지능 인기 에이전트 : Hermes Agent

by 망고노트 2026. 9. 19.
728x90
반응형

Hermes Agent는 Nous Research에서 개발한 오픈소스 AI 에이전트 프레임워크입니다. 단순 챗봇을 넘어 시스템 터미널 제어, 파일 수정, 웹 브라우저 자동화, 장기 메모리 관리, 메신저(Telegram, Discord 등) 연동을 지원합니다.

공식 사이트 및 저장소

지원 환경 및 사전 준비

  • 지원 OS: macOS, Linux, Windows (WSL2 환경 필수)
  • 기본 요구사항: Python 3.11 이상 (자동 설치 스크립트 제공) 및 AI Provider 계정/API Key (Anthropic, OpenAI, OpenRouter, Google Gemini 또는 로컬 vLLM/Ollama)

설치 및 초기 설정

1. 한 줄 설치 스크립트 실행

터미널(macOS/Linux) 또는 WSL2 터미널(Windows)을 열고 아래 명령어를 실행합니다.

Bash
 
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash

설치가 완료된 후 쉘 환경 설정을 새로 고칩니다.

Bash
 
source ~/.zshrc   # macOS (zsh)
# 또는
source ~/.bashrc  # Linux / WSL2 (bash)

2. AI 모델 Provider 연결

설치 후 사용할 AI 모델 및 API 키를 설정합니다. 대화형 마법사 명령어를 입력하세요.

Bash
 
hermes model
  • OpenRouter: 다양한 모델을 API 키 기반으로 과금하여 사용하려는 경우 추천
  • Anthropic / OpenAI: 서비스 구독 계정(OAuth 로그인) 또는 개인 API 키 등록
  • Custom Endpoint: 로컬 GPU 서버의 vLLM, Ollama 등 사용 시 지정

기본 사용법

1. 세션 실행

명령어기능
hermes 기본 CLI 모드 실행
hermes --tui 터미널 기반 그래픽 인터페이스(TUI)로 실행 (권장)
hermes --continue 이전 대화 세션 불러오기
hermes chat -q "질문" 일회성 질문 단발 처리 후 종료
 

2. 세션 내부 주요 슬래시 명령어

hermes 프롬프트 입력창 안에서 /를 입력하여 사용합니다.

  • /help: 전체 도움말 확인
  • /tools: 사용 가능한 도구 목록 및 권한 확인
  • /model: AI 모델 즉시 변경
  • /skills: 설치 및 활성화된 스킬 목록 조회

3. 주요 관리 명령어

Bash
 
hermes update         # 최신 버전으로 업데이트
hermes doctor         # 문제 진단 및 환경 점검
hermes setup gateway  # Telegram, Discord 등 메신저 연동 설정

주의 사항: Hermes Agent는 사용자의 터미널 명령 실행 및 파일 변경 권한을 가집니다. 처음에는 별도의 테스트 폴더(예: ~/hermes-test) 내 작업으로 제한하거나, 검증된 도구 위주로 실행하는 것을 권장합니다.

 

 

Hermes Agent는 미국의 오픈소스 전문 프런티어 AI 연구소인 Nous Research(나우스 리서치)에서 개발했습니다.

개발 주체: Nous Research

  • 설립자: 제프리 케스넬(Jeffrey Quesnelle)과 카란 말호트라(Karan Malhotra) 등이 2023년에 공동 설립한 미국 뉴욕 기반의 오픈소스 AI 리서치 랩입니다.
  • 주요 성과: 빅테크 중심의 폐쇄형 모델에 맞서 독자적인 오픈소스 LLM을 개발해 왔으며, 대표적인 오픈소스 모델 시리즈인 Hermes (Hermes 2, Hermes 3 등)로 글로벌 AI 개발자 커뮤니티에서 이름을 알렸습니다.

공신력 평가

결론부터 말씀드리면, AI 업계 및 오픈소스 커뮤니티에서 상당한 공신력과 기술력을 인정받고 있습니다.

  1. 오픈소스 AI 진영의 대표 연구 그룹
    • Meta의 Llama 시리즈 등을 기반으로 미세조정(Fine-Tuning) 및 동맹 형태의 오픈소스 모델을 출시해 오며 Hugging Face, GitHub 등 글로벌 개발자 플랫폼에서 지속적으로 상위 평가를 받아온 핵심 랩입니다.
  2. 기관 투자 유치 및 검증
    • 대형 투자 기관(VC)으로부터 6,500만 달러(한화 약 850억~900억 원) 이상의 투자금을 유치하며 독자적인 파운데이션 모델 및 자율 에이전트 연구 역량을 증명했습니다.
  3. 독자적인 기술 프레임워크 제공
    • 단순한 API 연결용 껍데기가 아니라, 특수 강화학습 프레임워크(Atropos) 및 세션 메모리/도구 학습 엔진 등 에이전트 분야의 최신 연구 기술을 실제 실행형 코드로 구현해 기술력을 높게 평가받고 있습니다.

상용 서비스(SaaS) 형태의 완성형 기업용 소프트웨어라기보다는 최신 기술 트렌드를 주도하는 최상위 오픈소스 랩의 검증된 프레임워크로 이해하시면 됩니다.

 

 

Hermes Agent와 주요 경쟁 AI 에이전트 프레임워크를 다각도로 비교한 표입니다. 목적과 개발 환경에 맞는 에이전트를 선택하실 수 있습니다.

비교 항목 Hermes Agent AutoGPT CrewAI Claude Computer Use
개발 주체 Nous Research AutoGPT Open Source Team CrewAI Inc. Anthropic
핵심 목적 로컬 터미널/OS 제어 및 개인 맞춤형 에이전트 환경 자율 목표 수행 연구 및 비전형 자율 에이전트 다중 에이전트(Multi-Agent) 팀 협업 워크플로우 구축 화면 GUI 직접 동작 및 브라우저/컴퓨터 조작 자동화
주요 특징 • CLI/TUI 기반 인터페이스

• 메신저(Telegram, Discord) 연동 지원

• 장기 메모리 및 스킬 익스텐션 시스템
• 단일 목표 입력 후 자율 수행

• Web UI 및 블록 기반 플로우 빌더 지원

• 풍부한 커뮤니티 플러그인
• 역할(Role) 및 작업(Task) 분담 기반 구동

• 코드 중심(Python) 및 No-Code 지원

• 기업용 모니터링/거버넌스 제공
• 화면 스크린샷 인식 및 클릭/키보드 입력

• Anthropic 모델 API 직접 연동

• 클라우드 환경 실행 가능
지원 모델 OpenRouter, OpenAI, Anthropic, 로컬 LLM (vLLM, Ollama) 등 자유 선택 OpenAI (GPT-4o 등 기본), API 지원 모델 LangChain 기반 지원 모델 전체 (OpenAI, Claude, Ollama 등) Anthropic Claude 모델 전용 (Claude 3.5 Sonnet 등)
추천 대상 개인 터미널 환경 자동화 및 커스텀 LLM을 연동하고 싶은 개발자 자율 실행 에이전트의 동작 구조를 실험하려는 개발자 복잡한 비즈니스 로직 및 협업 시스템을 구축하려는 기업/팀 웹 페이지 조작 및 실제 컴퓨터 화면 자동화 작업이 필요한 사용자
공식 웹사이트 hermes-agent.org 바로가기 agpt.co 바로가기 crewai.com 바로가기 anthropic.com 바로가기
저장소 / 문서 Hermes GitHub AutoGPT GitHub CrewAI Docs Claude Computer Use Docs
  • 터미널 제어 및 높은 자유도를 원한다면 Hermes Agent
  • 여러 AI가 역할을 나누어 작업하는 시스템을 원한다면 CrewAI
  • 실제 컴퓨터 화면을 클릭하며 작업하는 자동화를 원한다면 Claude Computer Use가 가장 적합합니다.

Claude Computer Use는 Anthropic이 개발한 기능으로, 모델이 사람처럼 컴퓨터 화면을 보고(마우스 이동, 클릭, 텍스트 입력, 스크롤 등) 데스크톱 및 웹 환경을 제어할 수 있도록 돕는 API 기능입니다.

1. 사용 조건 및 환경 요구사항

Claude가 사용자의 실제 컴퓨터를 조작하려면 환경 구성과 보안적 조건이 필수적입니다.

  • 지원 모델: Claude 3.5 Sonnet 이상의 최신 모델 (API를 통해서만 호출 가능)
  • 계정 및 API Key: Anthropic Console 계정 발급 및 결제 프로필 등록 (API 이용 요금 발생)
  • 안전한 실행 환경 (Sandbox):
    • 보안 위험(실제 로컬 파일 훼손, 프롬프트 인젝션을 통한 악의적 행동 등) 방지를 위해 Docker 컨테이너, 가상 머신(VM), 또는 별도의 가상 브라우저 환경에서 실행하는 것이 권장됩니다.
    • 샌드박스 내부에는 마우스/키보드 제어를 실행하고 스크린샷을 찍어주는 툴(예: Python pyautogui, xdotool 등)이 탑재되어야 합니다.

2. API 설정 및 구현

API 설정은 Claude에게 컴퓨터 조작용 스페셜 도구(Tool)를 정의해 주고 대화를 주고받는 방식으로 이루어집니다.

API 요청 예시 (Python SDK 기준)

API 요청 시 tools 파라미터에 Anthropic이 미리 정의해 둔 computer 도구를 포함하고, Beta 헤더를 활성화해야 합니다.

Python
 
import anthropic

client = anthropic.Anthropic(api_key="YOUR_ANTHROPIC_API_KEY")

# 1. Claude에게 작업 요청
response = client.beta.messages.create(
    model="claude-3-5-sonnet-20241022",
    max_tokens=1024,
    tools=[
        {
            "type": "computer_20241022",       # 컴퓨터 조작 전용 툴
            "name": "computer",
            "display_width_px": 1024,          # 스크린샷 해상도 가로
            "display_height_px": 768,          # 스크린샷 해상도 세로
            "display_number": 0
        },
        {
            "type": "bash_20241022",           # (선택) Bash 명령어 실행 툴
            "name": "bash"
        }
    ],
    messages=[
        {"role": "user", "content": "구글 페이지로 이동해서 'Python 에이전트'를 검색해줘."}
    ],
    betas=["computer-use-2024-10-22"]          # Beta 기능 활성화
)

3. 실제 동작 방식 (Agent Loop)

Computer Use는 모델과 사용자(시스템) 간의 반복적인 피드백 루프(Agent Loop)로 작동합니다.

[사용자 요청] ──> [Claude: 좌표 계산 후 클릭/입력 명령] ──> [클라이언트 실행 및 스크린샷 전송] ──> [Claude: 화면 확인 후 다음 행동 결정]
  1. 사용자 요청 전달: "브라우저를 열고 특정 웹사이트의 회원가입 폼을 작성해줘"와 같은 명령을 전달합니다.
  2. Claude의 상황 판단 및 좌표 계산:
    • 모델은 이전 스크린샷을 분석하여 목표 버튼이나 입력창의 상대 좌표값(x, y pixel)을 계산합니다.
    • API 응답으로 마우스 이동, 클릭(left_click), 키보드 입력(type) 등의 행동 명령을 반환합니다.
  3. 클라이언트(시스템)의 실행:
    • 코드(Python 에이전트 스크립트)가 Claude의 명령을 받아 샌드박스 환경 내부에서 실제로 마우스를 움직이거나 텍스트를 입력합니다.
    • 작업 완료 후 새로운 화면 스크린샷을 캡처합니다.
  4. 결과 전송 및 피드백:
    • 캡처한 스크린샷을 다시 Claude API에 tool_result 형태로 전달합니다.
  5. 목표 달성 시까지 반복:
    • Claude는 새 스크린샷을 보고 동작이 잘 수행되었는지 검증 후 다음 단계를 진행하며, 성공할 때까지 위 과정을 반복합니다.

한계점 및 주의사항

  • 픽셀 기반 제어: 좌표 기반으로 작동하기 때문에 화면 해상도가 달라지거나 렌더링 방식이 변경되면 클릭 좌표 오차가 생길 수 있습니다.
  • 속도 및 토큰 소비: 한 단계를 진행할 때마다 고해상도 스크린샷 이미지 데이터를 API로 전송하므로 토큰 소비량이 크고 진행 속도가 다소 완만합니다.
  • 보안 위험: 웹 브라우저 조작 중 악의적인 팝업이나 텍스트(Prompt Injection)를 만나면 모델이 오작동할 위험이 있으므로, 민감한 개인정보나 금융 계정이 로그인된 환경에서는 직접 실행을 자제해야 합니다.

 

Anthropic에서는 보안상 유저의 실제 컴퓨터 대신 독립된 가상 Linux 데스크톱(X11 + VNC)을 실행하여 Claude가 작업을 수행할 수 있도록 Docker 기반의 공식 데모 환경(anthropic-quickstarts)을 제공합니다.

사전 준비사항

  1. Docker Desktop 설치 및 실행: Docker 공식 홈페이지에서 OS에 맞는 Docker Desktop을 설치 후 앱을 실행해 둡니다.
  2. Anthropic API Key 발급: Anthropic Console에서 API 키를 발급받고 결제 수단을 등록하여 크레딧을 준비합니다.

1. 기본 실행 방법 (이미지 바로 실행)

터미널(macOS/Linux) 또는 PowerShell(Windows)을 열고 아래 순서대로 명령어를 실행합니다.

macOS / Linux

Bash
 
# 1. 환경 설정 폴더 생성
mkdir -p $HOME/.anthropic

# 2. API Key 변수 설정
export ANTHROPIC_API_KEY="sk-ant-your-actual-api-key"

# 3. Docker 컨테이너 실행
docker run \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -v $HOME/.anthropic:/home/computeruse/.anthropic \
  -p 5900:5900 \
  -p 8501:8501 \
  -p 6080:6080 \
  -p 8080:8080 \
  -it ghcr.io/anthropics/anthropic-quickstarts:computer-use-demo-latest

Windows (PowerShell)

PowerShell
 
# 1. 환경 설정 폴더 생성
mkdir -p $HOME/.anthropic

# 2. API Key 변수 설정
$env:ANTHROPIC_API_KEY="sk-ant-your-actual-api-key"

# 3. Docker 컨테이너 실행
docker run `
  -e ANTHROPIC_API_KEY=$env:ANTHROPIC_API_KEY `
  -v $HOME/.anthropic:/home/computeruse/.anthropic `
  -p 5900:5900 `
  -p 8501:8501 `
  -p 6080:6080 `
  -p 8080:8080 `
  -it ghcr.io/anthropics/anthropic-quickstarts:computer-use-demo-latest

2. 포트 및 접속 방법

컨테이너가 정상 구동되면 웹 브라우저를 켜고 접속합니다.

  • 통합 웹 UI 접속: http://localhost:8080
    • 접속하면 화면 좌측에는 Claude 채팅창, 우측에는 Claude가 직접 움직이는 가상 데스크톱 화면이 나옵니다.
  • 주요 오픈 포트 설명:
    • 8080: Streamlit 대화창과 VNC 데스크톱 화면이 합쳐진 통합 인터페이스
    • 6080: noVNC 전용 데스크톱 뷰어
    • 5900: VNC 클라이언트 접속용 포트

3. 소스코드 수정 및 로컬 빌드 (선택 사항)

데모 코드를 직접 수정하거나 로컬에서 직접 빌드하고 싶다면 GitHub 저장소를 클론하여 실행합니다.

Bash
 
# 저장소 클론
git clone https://github.com/anthropics/anthropic-quickstarts.git
cd anthropic-quickstarts/computer-use-demo

# 로컬 Docker 이미지 빌드
docker build -t computer-use-demo:local .

# 빌드한 로컬 이미지로 실행
docker run \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -v $HOME/.anthropic:/home/computeruse/.anthropic \
  -p 8080:8080 \
  -it computer-use-demo:local

팁 및 권장 설정

  • 권장 해상도 지정: Claude는 표준 XGA 해상도(1024x768) 환경에서 인식 오차가 가장 적습니다. 해상도를 고정하려면 docker run-e WIDTH=1024 -e HEIGHT=768 옵션을 추가하세요.
  • 비용 관리: Claude Computer Use는 조작 1회당 화면 스크린샷 이미지 토큰을 계속 송수신하므로, 일반 텍스트 대화보다 API 크레딧 소모가 빠릅니다.

 

OpenAI와 Google은 각각 독자적인 에이전틱(Agentic) AI 기술과 제품군을 공개하며 웹 브라우저 제어 및 비즈니스 워크플로우 자동화 분야에서 경쟁하고 있습니다.

OpenAI 및 Google 대표 AI Agent 비교

구분OpenAIGoogle
핵심 에이전트 제품 Operator / ChatGPT agent Project Jarvis / Gemini Agent Platform
기반 모델 GPT-4o Vision 및 에이전트 특화 모델 Gemini 2.0 / 2.5 시리즈
핵심 구동 방식 웹 브라우저 화면 인식(CUA: Computer-Using Agent) 및 폼 입력, 결제, 데이터 수집 자율 수행 크롬(Chrome) 브라우저 기반 GUI 직접 조작 및 구글 생태계(Workspace 등) 연동 자동화
주요 목표 및 기능 • 웹 기반 반복 작업(장보기, 예약, 보고서 작성 등) 자동화

• 사용자의 복잡한 추론 요구사항을 스스로 분할하여 수행
• 크롬 내 검색, 쇼핑, 항공권 예매 등 사용자 대행

• Google Workspace 문서/이메일 간 멀티태스킹 자동 처리
접근 제어 및 대상 ChatGPT Pro 및 Enterprise 사용자 대상 단계적 제공 Chrome 브라우저 및 Gemini Enterprise 생태계 탑재
 

1. OpenAI의 에이전트 전략

  • 개인용 웹 에이전트 (Operator / ChatGPT Agent): 웹 화면의 텍스트와 버튼 위치를 직접 시각적으로 파악(Vision)한 뒤, 마우스 클릭과 키보드 입력을 통해 여행 예약, 데이터 수집, 웹 폼 입력 등의 과업을 사람 대신 끝까지 완수합니다.
  • Wikipedia
  • 개발자용 에이전트 API: 개발자가 직접 에이전트 워크플로우를 구현할 수 있도록 도구 호출(Tool Calling)과 멀티스텝 추론 기능을 API 수준에서 지원합니다.
  • GitHub

2. Google의 에이전트 전략

  • Project Jarvis (크롬 제어 에이전트): 크롬 브라우저를 기반으로 사용자의 리서치, 제품 구매, 정보 수집 등을 화면 인식 단위로 자율 수행하는 소비자 중심 에이전트입니다.
  • YouTube
  • Gemini Enterprise Agent Platform: 구글 워크스페이스(Gmail, Docs, Calendar 등) 및 기업용 데이터 시스템과 깊게 연동되어, 이메일 요약부터 파일 생성, 다단계 업무 승인 절차까지 대규모 엔터프라이즈 환경 자동화를 지원합니다.
  • explainx.ai

두 회사 모두 기존의 "질문해 답을 얻는 챗봇"에서 "사용자를 대신해 실제 디지털 행동을 실행하는 에이전트"로 AI 패러다임을 전환해 나가고 있습니다.

Google Jarvis AI Agent Preview

구글의 프로젝트 자비스(Project Jarvis)가 어떻게 제미나이를 이용해 크롬 웹 브라우저를 직접 제어하고 작업을 수행하는지 시각적으로 이해하는 데 도움이 됩니다.

AI Magazine

 

 

OpenAI Codex는 OpenAI가 개발한 코딩 특화 AI 모델로, 자연어를 코드로 변환하거나 코드를 분석·수정하는 성능을 갖춘 모델입니다.

핵심 특징

  • 자연어-코드 변환: "파이썬으로 웹 크롤러 작성해줘"와 같이 한국어나 영어로 명령하면 실제 작동하는 프로그래밍 코드를 생성합니다.
  • GitHub Copilot의 원천 모델: 초기 GitHub Copilot이 바로 이 Codex 모델을 기반으로 구동되었으며, 개발 생산성 혁신의 계기가 되었습니다.
  • 다양한 언어 지원: Python, JavaScript, TypeScript, Ruby, Go, C++ 등 다양한 프로그래밍 언어를 이해합니다.

Codex 모델의 현재 상황 및 발전

  1. 독립 모델 API 중단: 독립된 code-davinci-002 등의 API 형태 모델 서비스는 마감되었습니다.
  2. GPT-4o / GPT-4 Turbo로의 통합: 별도의 모델로 구동되는 대신, 훨씬 더 강력한 범용 대형 언어 모델(GPT-4o, GPT-4 Turbo 등) 및 코드 해석기(Advanced Data Analysis) 시스템 내부로 통합·기능 강화가 이루어졌습니다.
  3. 에이전트 스택 활용: 코딩 자동화 프레임워크나 IDE 어시스턴트(Copilot, Cursor 등) 내부에서 코딩 관련 작업을 자율 수행하는 엔진 역할을 담당하고 있습니다.

 

GitHub Copilot Agent ModeCursor Agent는 개발자가 자연어로 고차원 목표만 제시하면, AI가 전체 코드베이스를 다각도로 분석하여 여러 파일을 동시에 수정하고 터미널 명령(테스트, 빌드 등)까지 실행하는 자율 개발 에이전트입니다.

1. 주요 작동 방식 (Architecture)

에이전트는 사용자의 질문에 단순히 코드를 대답하는 것을 넘어 '계획 ➔ 탐색 ➔ 코드 수정 ➔ 검증(터미널)' 순환 루프(ReAct Pattern)를 돕습니다.

[개발자 지시] 
      │
      ▼
1. Planning (계획 수립)  ──> 필요한 작업 단계 분할
      │
2. Context Analysis     ──> 코드베이스 탐색 (AST, 임베딩, @ symbol 등)
      │
3. Code Edit           ──> 여러 관련 파일 동시 작성 및 리팩토링
      │
4. Verification        ──> 터미널 명령어 실행 (빌드/테스트) 및 에러 발생 시 재수정
  • 코드베이스 맥락 파악 (Context Retrieval): 전체 프로젝트의 파일 구조, 타입 정의, 종속성을 읽어 들어갑니다.
  • 터미널 자동화 및 도구 연동: 에어로 테스트나 린트(Lint) 명령어를 터미널에서 구동하여 결과(Error)를 확인하고 다시 코드를 보완합니다.
  • MCP (Model Context Protocol) 지원: Cursor 등은 외부 DB나 GitHub Issue, Figma 디자인 시스템과 직접 통신하는 도구(MCP Tool)를 붙여 연동 범위를 확장할 수 있습니다.

2. 에이전트 모드 설정 및 사용 방법

① GitHub Copilot (Agent Mode)

VS Code 또는 Visual Studio 환경에서 단순 채팅 모드 대신 Agent Mode를 켜서 사용합니다.

  • 설정 방법:
    1. VS Code / Visual Studio를 최신 버전으로 업데이트하고 GitHub CopilotGitHub Copilot Chat 확장 프로그램을 설치합니다.
    2. 설정(Settings / Tools > Options)에서 Copilot > Agent ModeEnable Planning 항목을 활성화합니다.
    3. 프로젝트 루트에 .github/copilot-instructions.md 파일을 작성하면, 에이전트가 코드를 작성할 때 따라야 할 프로젝트 규칙(예: "TypeScript 사용", "테스트 코드는 Jest 작성")을 사전 지정할 수 있습니다.
  • 사용 방법:
    • 채팅창 모드 드롭다운에서 Agent 모드를 선택합니다.
    • 입력 예시: "Next.js API 라우트에 사용자 인증 로직을 추가하고 패키지 설치 및 테스트 실행까지 완료해줘"

② Cursor (Agent Mode / Composer)

Cursor는 Composer (Cmd + I / Ctrl + I) 패널을 기반으로 자율 실행 에이전트를 제공합니다.

  • 설정 방법:
    1. Cursor Settings (Cmd + ,) > Features:
      • Chat / Composer: Agent 모드 선택 및 Auto-run mode (터미널 자동 실행) 옵션을 설정합니다.
      • Rules for AI: .cursorrules 파일이나 설정의 Rules 탭에 프로젝트 기본 코딩 컨벤션을 입력합니다.
    2. MCP Server 연동 (선택): Cursor Settings > Tools & Integrations에서 PostgreSQL, GitHub 등 MCP 도구를 추가하면 에이전트가 외부 데이터베이스 스키마까지 자동 조회할 수 있습니다.
  • 사용 방법:
    • 단축키 Cmd + I (Mac) 또는 Ctrl + I (Win)를 눌러 에이전트 창을 실행합니다.
    • @ 기호로 특정 파일, Docs 또는 Terminal 맥락을 첨부하여 지시합니다.
    • 입력 예시: "@schema.prisma 의 스키마를 참고해서 CRUD API 엔드포인트를 작성하고 관련된 컴포넌트까지 한 번에 생성해줘"

3. 주요 설정 차이점 요약

설정 항목 GitHub Copilot Agent Mode Cursor Agent (Composer)
기반 환경 VS Code / Visual Studio 확장 프로그램 Cursor IDE (VS Code 기반 독립 포크 IDE)
단축키 / UI Copilot Chat 드롭다운 ➔ Agent 지정 Cmd + I (Composer 패널) / Agent 모드
규칙 파일 .github/copilot-instructions.md .cursorrules
안전장치 터미널 명령 승인 팝업 (설정에서 승인 허용 목록 관리) Auto-run / YOLO 모드 (승인 없이 터미널 실행, 보호 규칙 지원)

 

 

Nous Research의 Hermes Agent'로컬 터미널/OS 제어', '개발자 중심 CLI 환경', '다양한 프론트엔드/메신저 연동'이 핵심인 오픈소스 에이전트 프레임워크입니다.

OpenAI의 제품군 중 Hermes Agent와 목적과 형태에 따라 일치하는 제품은 다음과 같습니다.

1. 가장 가장 정확히 일치하는 제품: Codex CLI (OpenAI Codex)

Hermes Agent의 터미널 자동화 및 개발자 도구 제어 관점에서 1:1로 대응되는 제품입니다.

  • 공통점: 로컬 컴퓨터 터미널(CLI) 환경에서 동작하며, 사용자의 명령을 받아 파일 작성·수정, 터미널 명령어 실행, 테스트 자동화 등을 수행합니다.
  • 설치 방식: Hermes가 curl ... | bash로 터미널에 설치되듯, Codex CLI도 curl -fsSL [https://chatgpt.com/codex/install.sh](https://chatgpt.com/codex/install.sh) | sh 명령어로 로컬 터미널에 직접 설치해 사용합니다.
  • 차이점: Hermes Agent는 다양한 오픈소스 모델이나 외부 API(OpenRouter 등)를 자유롭게 연결할 수 있는 오픈소스 프레임워크인 반면, Codex CLI는 OpenAI의 모델(o3, codex-1 등) 및 ChatGPT 계정에 최적화되어 있습니다.

2. 컴퓨터 화면/GUI 조작 관점: ChatGPT Agent (구 Operator)

Hermes Agent가 웹 브라우저 조작 기능을 포함하고 있듯이, 실제 컴퓨터 UI나 웹 화면을 보고 직접 제어하는 에이전트입니다.

  • 개념: OpenAI가 개발한 CUA(Computer-Using Agent) 기술 기반 제품으로, 사용자가 지시한 목표에 따라 마우스 클릭, 텍스트 입력, 브라우징을 스스로 판단해 수행합니다.
  • 현재 상태: 초기에는 Operator라는 별도 서비스로 발표되었으나, 이후 ChatGPT Agent 내부로 통합되었습니다.

3. 자체 에이전트 구축 관점: OpenAI Agents SDK

Hermes Agent처럼 나만의 에이전트를 직접 개발하고 도구(Tool)를 연동하려는 개발자를 위한 제품입니다.

  • 특징: Python 기반으로 도구 호출(Tool Calling), 멀티 에이전트 오케스트레이션, 세션 관리를 가능하게 해주는 OpenAI의 공식 에이전트 개발 프레임워크입니다.

요약 및 추천

  • "터미널 기반 코딩 및 OS 자동화" 기능을 찾으신다면 👉 Codex CLI
  • "웹 브라우저를 직접 움직이는 자율 수행" 기능을 찾으신다면 👉 ChatGPT Agent

 

Google 역시 Gemini 모델을 기반으로 개인 사용자용 서비스부터 개발자/기업용 프레임워크까지 다각적인 AI 에이전트 라인업을 제공하고 있습니다.

1. 일반 사용자용: Project Jarvis & Google Search AI Mode

  • Project Jarvis (Chrome 에이전트): 구글 크롬 브라우저를 기반으로 작동하는 컴퓨터 제어 에이전트입니다. 사용자의 지시에 따라 브라우저 화면을 직접 인식하여 쇼핑몰 결제, 항공권 예매, 정보 수집 등의 작업을 자율적으로 대행합니다.
  • Google Search 정보 에이전트 / AI Mode: 단순 검색 결과를 보여주는 것을 넘어, 사용자가 설정한 연속 과제(예: "이사 지역 조건 감시", "상품 가격 하락 추적")를 백그라운드에서 지속적으로 수행합니다.

2. 개발자 및 코드 작성용: Gemini Code Assist & Google Antigravity

  • Gemini Code Assist & Jules: 개발자의 코드베이스 전체를 분석하여 코드 자동 수정, 테스트 코드 작성, 리팩토링, 디버깅을 지시받아 자율 처리하는 코드 에이전트입니다.
  • Google Antigravity: 개발자가 멀티스텝 에이전트를 조율하고, 외부 데이터베이스나 API 도구(Tool)를 연동하여 복잡한 자율 워크플로우를 구축할 수 있도록 지원하는 에이전트 개발 플랫폼입니다.

3. 기업/엔터프라이즈용: Gemini Enterprise Agent Platform

  • Workspace 에이전트: Gmail, Docs, Sheets, Drive 등 Google Workspace 제품군과 직접 연결되어 문서 요약, 이메일 답장 작성, 데이터 분석 및 보고서 작성을 자동 처리합니다.
  • Agent Platform & ADK: 기업이 고객 서비스, 데이터 분석, 보안 관리 등에 필요한 전용 에이전트를 구축할 수 있도록 돕는 오픈소스 SDK(Agent Development Kit) 및 통합 서버 관리 환경을 제공합니다.

요약

  • Hermes Agent / Codex CLI처럼 터미널이나 코딩 자동화 중심 ➔ Gemini Code Assist / Google Antigravity
  • Claude Computer Use / Operator처럼 웹 화면 동작 제어 중심 ➔ Project Jarvis

 

Google이 서비스하는 대표 에이전트 제품인 Project JarvisGemini Code Assist의 핵심 작동 방식과 실무 활용법입니다.

1. Project Jarvis (웹·컴퓨터 자동화 에이전트)

Chrome 브라우저를 기반으로 작동하며, 사용자의 지시를 받아 웹 화면을 직접 인식(Vision)하고 행동하는 Computer-Using Agent(CUA)입니다.

작동 방식

  • Visual Grounding: Gemini 2.0/2.5 비전 모델을 사용하여 브라우저 화면의 텍스트, 버튼, 입력 폼의 위치 좌표를 분석합니다.
  • 자율 브라우징: 사람처럼 탭 이동, 텍스트 입력, 마우스 클릭, 스크롤 등의 작업을 연쇄적으로 실행합니다.
  • Agent Loop (상황 검증): 클릭할 때마다 변화된 새 스크린샷을 찍어 목표가 달성되었는지 스스로 검증하며 다음 단계를 결정합니다.

주요 활용법

  • 웹 리서치 및 정보 요약: "특정 3개 항공사의 서울-파리 최저가 항공권을 비교해 보고서로 작성해줘"와 같은 다단계 검색 자동화.
  • 반복적인 Web UI 작업: 쇼핑몰 상품 구매 단계 수행, 웹 기반 CMS 폼 채우기, 반복적인 데이터 수집.

2. Gemini Code Assist (소프트웨어 개발 에이전트)

VS Code, JetBrains, Google Cloud Shell 등 IDE와 GitHub PR에 통합되어 코드 작성부터 터미널 제어, 코드 리뷰까지 자율 수행하는 개발 전용 에이전트입니다.

작동 방식

  • 1M+ 대용량 컨텍스트 및 로컬 코드베이스 인덱싱: 전체 프로젝트 구조, 파일 간 종속성, 타입 정의를 파악해 프로젝트 스타일에 맞는 최적의 코드를 작성합니다.
  • Agentic Chat & CLI (Hermes/Cursor 형태): 단순히 코드를 생성하는 것을 넘어 Git 브랜치 생성, 여러 파일 동시 수정, 터미널 명령어(테스트/빌드) 실행을 자율적으로 순환 수행합니다.
  • GitHub PR 에이전트: GitHub Pull Request가 생성되면 AI가 자동으로 할당되어 즉시 코드 리뷰, 개선안 제시, PR 요약을 남깁니다.

주요 활용법

  • 다중 파일 리팩토링: "DB 스키마 변경에 따라 API 엔드포인트와 프론트엔드 타입 정의를 한 번에 수정해줘"
  • 터미널 CLI 기반 자동화 (Gemini CLI): 터미널 환경에서 natural language로 명령어 자동 생성 및 오류 해결
  • 자동 단위 테스트 구축: 선택한 함수나 클래스에 대해 Edge Case를 고려한 테스트 코드 자동 작성

요약하자면:

일반 웹/일상 업무 제어에는 Project Jarvis, 개발 및 코드베이스 제어에는 Gemini Code Assist가 구글의 핵심 에이전트 라인업입니다.

구글이 웹 브라우저를 스스로 조작하는 에이전트 기술을 시각적으로 확인하고 싶다면 아래 참고 영상을 확인해 보세요.

Project Jarvis powered by Gemini

구글의 Project Jarvis가 제미나이 모델을 기반으로 크롬 브라우저를 직접 제어하고 웹 과제를 자동화하는 개념과 데모를 보여주는 영상입니다.

 

 

 

Google Antigravity는 구글이 선보인 차세대 AI 개발 플랫폼(Agentic Development Platform)입니다.

 

단순한 코드 자동 완성(Autocomplete)을 넘어, 여러 AI 에이전트가 사용자의 지시에 따라 계획 수립 ➔ 코드 수정 ➔ 터미널 테스트/빌드 ➔ 브라우저 동작 검증을 자율적·비동기적으로 수행하도록 관리(Orchestration)하는 에이전트 중심 개발 환경입니다.

VS Code 기반의 독립 앱/IDE 환경과 CLI/SDK 및 멀티 에이전트 관리를 위한 전용 패널을 제공합니다.

1. 설치 절차

사전 조건

  • 지원 OS: macOS, Windows (64-bit), Linux
  • 계정 및 브라우저: 구글 계정(개인 Gmail 또는 Google Workspace) 및 Google Chrome 브라우저 설치 필요

설치 과정

  1. 다운로드: 공식 웹사이트(antigravity.google)에 접속하여 운영체제에 맞는 설치 프로그램을 다운로드합니다.
  2. 앱 설치:
    • 독립 앱(Antigravity Standalone/IDE): 다운로드한 설치 파일을 실행하여 설치를 완료합니다.
    • 기존 IDE 연동 (선택): 기존에 사용 중인 VS Code, JetBrains 계열 또는 Zed 에디터가 있다면 'Antigravity Extension' 확장 프로그램을 설치하여 연결할 수도 있습니다.
  3. 계정 로그인 및 초기화:
    • 설치 완료 후 앱을 실행하고 Continue with Google을 눌러 구글 계정으로 인증합니다.
    • 개인 계정의 경우 무료 제공 쿼터 범위 내에서 사용할 수 있습니다.

2. 핵심 구조 및 화면 구성

Antigravity는 크게 두 가지 핵심 워크스페이스(View)로 나누어집니다.

  • Editor View (에디터 뷰): VS Code 기반의 익숙한 에디터 화면으로, 챗 패널과 함께 에이전트에게 동기식(Direct) 작업을 지시하고 코드를 확인하는 공간입니다.
  • Manager View (매니저 뷰): 여러 에이전트 패널을 띄워놓고 비동기식(Background)으로 작업을 일임하는 제어 센터입니다. 한 에이전트에 버그 수정을 시켜놓고, 메인 에디터에서 다른 작업을 계속 진행할 수 있습니다.

3. 기본 사용법 및 에이전트 실행 과정

단계 1: 프로젝트 로드 및 작업 지시

  • 앱에서 작업할 프로젝트 폴더를 엽니다.
  • 프롬프트 입력창에 원하는 작업을 자연어로 지시합니다.
  • 예시: "인증 모듈 관련 버그를 수정하고, 터미널에서 npm test를 돌려 검증한 뒤 결과를 알려줘."

단계 2: 에이전트 자율 수행 (Loop)

지시를 받은 에이전트는 사용자의 개입 없이 아래 단계를 스스로 반복합니다.

  1. Task Plan 생성: 작업 실행 전 단계별 작업 계획을 먼저 정리합니다.
  2. 코드 수정: 프로젝트 내 여러 파일을 탐색하고 코드를 새로 작성/수정합니다.
  3. 터미널 실행: 필요한 패키지를 설치하거나 빌드 및 테스트 명령어를 구동합니다.
  4. 웹 브라우저 검증: 내장 브라우저를 켜서 렌더링 화면을 직접 보고 기능 동작 여부를 캡처/확인합니다.

단계 3: 검증 결과(Artifacts) 확인 및 수정 지시

에이전트는 단순히 작업 완료 텍스트만 띄우는 것이 아니라 결과물(Artifacts) 형태(작성된 작업 목록, 구현 계획서, 실행 스크린샷, 브라우저 녹화 영상 등)로 검증 자료를 제공합니다.

  • 검증 결과물이 마음에 들지 않으면 스크린샷 위에 구글 문서처럼 직접 마우스로 선택 후 피드백 코멘트를 달아 재작업을 지시할 수 있습니다.

4. 실무 활용 팁

  • CLI / SDK 활용: 프로젝트 빌드 파이프라인(CI/CD)이나 로컬 터미널 스크립트 기반 작업이 많은 경우 함께 제공되는 Antigravity CLI를 통해 터미널 내에서 직접 에이전트를 호출할 수도 있습니다.
  • 기본 모델 선택: 구글 Gemini (Gemini 3 Pro / 3 Flash 계열)뿐만 아니라 설정에 따라 Claude Sonnet 등 다양한 AI 모델과 연동하여 작업 성격에 맞게 전환하여 사용할 수 있습니다.
728x90
반응형

 

이 글이 도움이 되셨다면
🔔 구독❤️ 좋아요 꾸우욱 눌러 주세요!🙏

그리고 💖커피 ☕, 💚차 🍵, 💛맥주 🍺, ❤️와인 🍷 중 마음에 드시는 한 잔으로 💰 후원해 주시면 큰 힘이 됩니다.

👇 지금 바로 아래 🔘버튼을 꾸욱 눌러 📣 응원해 주세요! 👇