요즘 회의에서 "그거 에이전트로 하면 되지 않아요?"라는 말을 정말 자주 듣는다. 그런데 막상 "그래서 운영에 올라간 게 몇 개냐"고 물으면 대답이 애매해진다. 우리만 그런 건지 궁금해서 분석기관 리포트들을 원문 기준으로 다시 찾아봤다. 결과부터 말하면, 다들 비슷한 데서 막혀 있다.
숫자로 보면 "쓰는 곳"과 "굴리는 곳"은 다르다
제일 먼저 본 건 맥킨지의 State of AI다. 2025년 11월에 나온 리포트(2025년 6~7월, 1,993명 대상 설문)를 보면 응답자의 88%가 최소 한 개 업무 기능에서 AI를 정기적으로 쓴다고 했다. 여기까진 예상대로다. 그런데 에이전트로 좁히면 이야기가 달라진다. 조직 어딘가에서 에이전트 시스템을 스케일링 중이라는 응답은 23%, 실험 단계라는 응답이 39%였다. 개별 업무 기능 단위로 보면 스케일링 중이라는 비율이 어느 기능에서도 10%를 넘지 않았다.
올해 8월에 나온 2026년판(2026년 5~6월, 1,719명)에서는 조금 움직임이 보인다. 연 매출 10억 달러 이상 대기업에서 에이전트를 스케일링 중이라는 응답이 27%에서 40%로 뛰었다. 반면 그보다 작은 조직은 22%로 제자리였다. AI가 EBIT에 기여했다는 응답도 37%로 전년과 거의 같았다. 쓰는 곳은 늘었는데 돈이 되는 곳은 그대로라는 얘기다.
개인적으로 흥미로웠던 건 따로 있다. 응답자의 32%가 에이전틱 코딩 도구로 직접 만들 수 있어서 소프트웨어 구매를 하나 이상 접었다고 답했다. 에이전트가 개발팀의 "만들까 살까" 판단 자체를 바꾸고 있다는 신호로 읽혔다.
PwC가 2025년 5월 미국 고위 임원 300명에게 물은 설문에서는 79%가 이미 회사에서 에이전트를 도입하고 있다고 답했고, 도입한 곳 중 66%가 생산성 측면에서 측정 가능한 가치를 보고 있다고 했다. 다만 이건 임원 인식 조사라 "도입"의 정의가 꽤 넓다고 보는 게 맞을 것 같다. 맥킨지 숫자와 나란히 놓으면 온도 차가 확실히 느껴진다.
가트너의 경고: 40%는 접힌다
낙관론만 있는 건 아니다. 가트너는 2025년 6월 에이전틱 AI 프로젝트의 40% 이상이 2027년 말까지 취소될 거라고 예측했다. 이유로 든 건 늘어나는 비용, 불분명한 비즈니스 가치, 부족한 리스크 통제다. 같은 발표에서 수천 개 에이전틱 AI 벤더 중 실제로 에이전트라고 부를 만한 곳은 약 130개 정도라고 봤고, 기존 챗봇이나 RPA에 이름만 바꿔 다는 걸 "agent washing"이라고 불렀다.
그렇다고 가트너가 에이전트 자체를 부정하는 건 아니다. 2028년까지 일상 업무 의사결정의 최소 15%가 에이전트로 자율 처리되고, 엔터프라이즈 소프트웨어의 33%가 에이전틱 AI를 포함할 거라는 전망을 같이 냈다. 2025년 8월에는 2026년 말까지 엔터프라이즈 앱의 40%가 특정 작업용 에이전트를 탑재할 거라고도 했다(2025년 5% 미만에서). 솔직히 이 두 발표를 같이 보면 "에이전트는 제품 안으로 들어오는데, 회사가 직접 벌인 프로젝트는 상당수 망한다"로 요약된다. 나는 이게 꽤 현실적인 그림이라고 본다.
멀티 에이전트와 슈퍼바이저 패턴이 뜨는 이유
데이터브릭스가 2026년 1월에 낸 State of AI Agents는 자사 플랫폼을 쓰는 2만 개 이상 조직의 사용 데이터를 기반으로 한다. 여기서 멀티 에이전트 워크플로가 4개월도 안 되는 기간에 327% 늘었다는 수치가 나온다. 2025년 7월에 내놓은 Supervisor Agent는 2025년 10월 기준 Agent Bricks 사용량의 37%를 차지해 1위 유스케이스가 됐다고 한다. 회사 자체 플랫폼 데이터라 걸러 들을 필요는 있지만, 방향성은 다른 곳에서 보는 것과 일치한다.
슈퍼바이저 패턴은 구조가 단순하다. 상위 에이전트가 목표를 받아 하위 작업으로 쪼개고, 검색이나 SQL, 문서 처리 같은 전문 에이전트에 넘긴 뒤 결과를 합친다. 엔터프라이즈에서 이게 잘 먹히는 건 조직도랑 닮았기 때문인 것 같다. 팀마다 자기 데이터와 권한을 가진 에이전트를 따로 만들고, 위에서 묶기만 하면 되니까 책임 경계가 명확해진다.
다만 공짜는 아니다. Anthropic이 2025년 6월 공개한 멀티 에이전트 리서치 시스템 글을 보면, 리드 에이전트와 서브 에이전트 조합이 단일 에이전트보다 내부 평가에서 90.2% 좋은 성능을 냈지만 토큰은 일반 채팅의 약 15배를 썼다. 모든 에이전트가 같은 컨텍스트를 공유해야 하거나 작업 간 의존성이 많은 경우, 예를 들어 대부분의 코딩 작업에는 잘 맞지 않는다고도 적혀 있다. 가트너가 취소 이유로 비용을 첫 번째로 꼽은 게 괜히 그런 게 아니다.
| 구분 | 단일 에이전트 | 슈퍼바이저(멀티) 에이전트 |
|---|---|---|
| 잘 맞는 일 | 순차적이고 컨텍스트가 하나로 이어지는 작업 | 병렬로 나눌 수 있는 조사·분석, 부서별 도구가 다른 업무 |
| 비용 | 상대적으로 예측 가능 | 토큰 사용량이 크게 늘어남 |
| 디버깅 | 호출 흐름이 단순 | 에이전트 간 핸드오프까지 추적해야 함 |
| 권한 관리 | 에이전트 하나에 권한 집중 | 에이전트별로 권한을 나눌 수 있음 |
왜 다들 실험 단계에 머무를까
리포트들을 읽으면서 든 생각은, 막히는 지점이 모델 성능이 아니라는 거다. 데이터브릭스 리포트에서 가장 눈에 띈 건 AI 거버넌스 도구를 쓰는 회사가 12배 이상 많은 AI 프로젝트를 프로덕션에 올리고, 평가 도구를 쓰는 곳은 거의 6배 더 많이 올린다는 수치였다. 인과관계라기보다는 "이미 운영 체계를 갖춘 회사가 더 많이 올린다"는 상관관계일 가능성이 크지만, 그래도 방향은 분명하다.
맥킨지 2025년판에서도 AI 하이 퍼포머(EBIT의 5% 이상이 AI에서 나온다고 답한 곳)는 약 6%에 불과했고, 이들은 AI를 도입하면서 업무 프로세스 자체를 다시 설계하는 경향이 훨씬 강했다. 기존 업무 위에 에이전트를 얹는 수준으로는 PoC 데모까지만 가고, 운영 단계에서 "그래서 이게 틀리면 누가 책임지냐"는 질문에 막히는 거다. PoC를 한 번이라도 운영 문턱까지 끌고 가본 사람이라면 꽤 공감할 대목일 거다.
개발팀이 지금 준비해둘 것
결국 에이전트를 운영에 올리는 건 평범한 서비스 운영과 크게 다르지 않다. 다만 비결정적인 컴포넌트가 하나 끼어 있을 뿐이다. 내가 우선순위를 매긴다면 이 순서다.
- 통합과 권한: 에이전트가 호출하는 사내 API와 데이터에 대해 에이전트별 서비스 계정, 최소 권한, 쓰기 작업 전 사람 승인 같은 가드레일부터 정한다.
- 평가 세트: 거창한 벤치마크보다 실제 업무 케이스 수십 개로 시작하는 게 낫다. Anthropic도 처음엔 20개 정도의 쿼리로 시작했다고 한다. 모델이나 프롬프트를 바꿀 때마다 돌리는 회귀 테스트로 만든다.
- 관측성: OpenTelemetry의 GenAI 시맨틱 컨벤션은
invoke_agent스팬 아래 LLM 호출마다chat, 도구 호출마다execute_tool스팬을 두는 구조를 쓴다.gen_ai.usage.input_tokens같은 속성으로 토큰 비용도 같이 잡힌다. 아직 활발히 개발 중인 규격이라 바뀔 수 있지만, 벤더 종속 없이 트레이스를 남기려면 지금 맞춰두는 게 편하다. - 비용 가드: 멀티 에이전트로 가기 전에 요청당 토큰 상한, 에이전트 루프 최대 횟수, 대시보드부터 만든다.
- 거버넌스 문서: 어떤 에이전트가 어떤 데이터에 접근하고 누가 오너인지 목록으로 관리한다. 나중에 감사 대응할 때 이게 없으면 정말 괴롭다.
개인적인 생각
2026년 숫자를 보면 에이전트는 확실히 대기업을 중심으로 운영 단계에 들어가고 있다. 그런데 EBIT 기여 응답이 제자리인 걸 보면, 올려놓는 것과 돈이 되는 건 또 다른 문제인 것 같다. 가트너의 40% 취소 예측도 결국 "평가와 통제 없이 시작한 프로젝트"에 대한 경고로 읽힌다.
앞으로는 멀티 에이전트 아키텍처 자체보다 에이전트 간 트레이싱 표준이 얼마나 빨리 굳는지, 그리고 2027년 말에 가트너 예측이 실제로 얼마나 맞았는지를 지켜보려고 한다. 그때쯤이면 우리 팀 에이전트도 몇 개는 살아남아 있기를 바란다.
참고한 글
- Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 — 40% 취소 예측, agent washing, 2028년 전망
- Gartner Predicts 40% of Enterprise Apps Will Feature Task-Specific AI Agents by 2026 — 엔터프라이즈 앱의 에이전트 탑재 전망
- McKinsey, The state of AI in 2025: Agents, innovation, and transformation (PDF) — 88% 사용, 23% 스케일링, 하이 퍼포머 6%
- McKinsey, The state of AI in 2026: On the road to ROI (PDF) — 대기업 에이전트 스케일링 40%, EBIT 기여 37%, 에이전틱 코딩과 구매 결정
- Databricks, Enterprise AI agent trends: Top use cases, governance + evaluations and more — State of AI Agents 2026 요약, 멀티 에이전트 327%, 거버넌스 12배
- Databricks, State of AI Agents 2026 (PDF) — 리포트 원문
- PwC's AI Agent Survey — 미국 임원 300명 대상 도입 인식 조사
- Anthropic, How we built our multi-agent research system — 오케스트레이터-워커 구조, 성능과 토큰 비용
- OpenTelemetry, Inside the LLM Call: GenAI Observability with OpenTelemetry — 에이전트 스팬 구조와 GenAI 속성