1~2년 전만 해도 "AI로 코드 짜봤어?"가 대화거리였다. 요즘은 질문이 좀 달라졌다. 어떤 에이전트한테, 어디까지 맡기고, 검증은 누가 하느냐.
올해 나온 조사 몇 개를 몰아서 읽어봤는데 그림은 꽤 선명했다. 에이전트는 이제 대부분의 개발자가 매주 쓰는 도구가 됐고, 도구 1위도 바뀌었다. 그런데 같은 조사들이 개발자들이 AI 코드를 별로 믿지 않는다는 것도 같이 보여준다. 이 모순이 제일 눈에 걸려서 메모 삼아 정리해 둔다.
에이전트는 이미 기본값이 됐다
제일 큰 데이터는 JetBrains의 Developer Ecosystem Survey 2026이다. 2026년 5~7월에 전 세계 전문 개발자 1만 5천여 명한테 물었고, 8월에 JetBrains Research 블로그에 결과 일부가 올라왔다.
전문 개발자의 90%가 업무에서 AI 코딩 에이전트를 최소 주 1회 쓰고, 68%는 매일 쓴다고 답했다. 후속 분석을 보면 응답자들은 평균적으로 자기 코드의 절반 가까이(약 47%)를 에이전트가 완전히 작성했다고 했다. 절반 이상은 손으로 직접 쓰는 코드가 전체의 20%도 안 되고, 다섯 명 중 한 명은 AI 없이 쓰는 코드가 사실상 없다고 한다.
솔직히 분포 쪽이 더 재밌었다. 코드 대부분을 에이전트에 맡기는 '에이전틱 코더'가 약 31%, AI를 보조로 쓰는 그룹이 약 47%, 여전히 주로 직접 쓰는 그룹이 약 23%. 지역 차이도 커서, 코드의 80% 이상을 에이전트로 만드는 비율이 동아시아가 유럽·영국의 약 두 배였다. 체감상 그럴 것 같긴 했는데 숫자로 보니 생각보다 차이가 컸다.
Sonar의 2026 State of Code Developer Survey(2025년 10월, 1,149명)도 비슷하다. AI를 써본 개발자의 72%가 매일 쓰고, 커밋하는 코드의 약 42%가 AI 생성이거나 AI 보조 코드라고 했다. 다만 조사 시점이 JetBrains보다 반년 넘게 앞서 있다는 건 감안해야 한다.
그리고 조사마다 "에이전트"나 "AI 도구"의 정의, 표본, 시점이 다 다르다. 숫자끼리 직접 비교하기보다는 방향만 읽는 게 맞다고 본다.
Claude Code는 뜨고, Copilot은 내려오고
JetBrains 조사에서 제일 화제가 된 건 도구별 업무 사용률이었다(2026년 5~7월 기준).
| 도구 | 업무 사용률 | 변화 | 비고 |
|---|---|---|---|
| Claude Code | 약 39% | 1월 18% → 약 2배 | 미국에서는 47% |
| GitHub Copilot | 21% | 1년 전 29%에서 하락 | 인지도는 79%로 여전히 최상위권 |
| OpenAI Codex | 16% | 1월 3% → 약 5배 | 가장 가파른 성장 |
| Cursor | 12% | 1월 18%에서 하락 | 인지도 75% |
| JetBrains AI / Junie | 약 9% | — | IDE 통합형 |
| OpenCode | 7% | — | 오픈소스, 인지도 42% |
| Google Antigravity | 6% | 사용률 정체 | 인지도는 상승 |
성장을 끌고 간 건 Claude Code, Codex처럼 작업을 통째로 넘기는 터미널·에이전트형 도구였다. JetBrains 분석으로는 Claude Code를 주력 도구로 쓰는 사람이 전체 개발자의 31%나 된다. 반대로 자동완성 중심인 Copilot과 Cursor는 여전히 다들 알지만 사용률은 줄었다. "알긴 아는데 메인으로는 안 쓰는" 도구가 돼가는 느낌이다. OpenCode는 사용률은 한 자릿수인데 인지도가 높아서, 벤더 종속이 싫은 팀한테는 대안으로 눈에 들어올 만하다.
물론 조사 하나의 결과고, 가격 정책이나 모델 업데이트가 워낙 빨라서 몇 달이면 순위가 뒤집힐 수도 있다. 어느 도구가 정답이라기보다는 시장이 IDE 보조에서 자율 에이전트 쪽으로 옮겨가고 있다는 신호 정도로 읽고 있다.
쓰는 사람은 느는데 믿는 사람은 줄어든다
사용률이 이 정도면 신뢰도 높을 것 같은데, 데이터는 정반대를 가리킨다.
Stack Overflow 2025 설문에서 AI 도구를 쓰거나 쓸 계획이라는 응답은 84%까지 올라갔다. 그런데 AI 출력의 정확성을 불신한다는 응답(약 46%)이 신뢰한다는 응답(약 33%)보다 많았다. "매우 신뢰한다"는 약 3%뿐이었고, 가장 큰 불만은 66%가 꼽은 "거의 맞는데 완전히 맞지는 않는" 답이었다. 이건 정말 공감했다. 2026년 설문은 6월에 시작됐는데, 이 글 쓰는 시점까지 결과는 확인하지 못했다.
Sonar 쪽은 더 아프다. 96%가 AI 코드가 기능적으로 맞다고 완전히 믿지는 않는다고 했는데, 커밋 전에 항상 확인한다는 사람은 48%였다. 안 믿으면서 절반은 매번 보지는 않는다는 얘기다. 61%는 AI 코드가 "맞아 보이지만 믿을 수 없는" 경우가 많다고 했고, 38%는 AI 코드 리뷰가 동료 코드 리뷰보다 더 힘들다고 답했다.
Anthropic의 2026 Agentic Coding Trends Report도 같은 지점을 짚는다. 사내 연구에서 엔지니어들은 업무의 약 60%에 AI를 쓰는데, 완전히 위임할 수 있다고 느끼는 작업은 0~20%에 그쳤다. 보고서는 이걸 "협업의 역설"이라 부르고, 개발자들이 검증하기 쉽거나 위험이 낮은 일은 AI에 넘기고 설계 판단이 필요한 일은 붙잡고 있다고 설명한다.
내가 읽기엔 생성 비용은 확 싸졌는데 검증 비용은 그대로거나 오히려 늘었다는 게 핵심 같다. Sonar는 이걸 "검증 병목(verification bottleneck)"이라고 부른다. 신뢰가 낮다고 안 쓰는 게 아니라, AI를 믿고 맡기는 대상이 아니라 검증해야 하는 동료로 보기 시작한 쪽에 가깝다. 진짜 문제는 불신 자체보다 그 불신에 맞는 검증 체계가 없다는 거고, "48%만 항상 확인" 숫자가 그걸 그대로 보여준다.
Anthropic이 보는 방향, 조금 걸러서
Anthropic 보고서는 올해를 규정할 트렌드 8가지를 내놨는데, 팀에 바로 닿는 것만 추려봤다.
엔지니어의 가치가 코드 작성에서 에이전트 오케스트레이션, 결과 평가, 문제 분해로 옮겨간다는 게 첫 번째 축이다. 단일 에이전트에서 여러 에이전트가 협업하는 구조로, 몇 분짜리 작업에서 며칠 단위 작업으로 늘어난다는 예측도 있다. 사례로 Rakuten이 대규모 오픈소스 코드베이스에서 Claude Code로 7시간 자율 작업을 돌린 경우가 나온다. 감독 방식도 모든 코드를 사람이 보는 대신 AI가 1차 리뷰를 하고 사람은 중요한 부분에 집중하는 쪽을 제안한다. 에이전트가 방어자에게도 공격자에게도 도움이 되니 보안은 설계 단계부터 넣어야 한다는 얘기도 있다.
다만 벤더가 쓴 예측 문서고 사례 대부분이 자사 고객이라 좀 걸러 들을 필요는 있다. 그래도 사람을 루프에서 빼는 게 아니라 사람 판단이 필요한 곳에 집중시킨다는 방향은 앞의 설문 데이터와 잘 맞는다.
우리 팀이라면 이렇게 할 것 같다
리뷰는 "누가 썼냐"보다 "뭐가 바뀌었냐"를 봐야 한다고 생각한다. 에이전트 PR에도 사람 PR과 같은 기준을 적용하는 게 맞다. AI가 짰으니 대충 넘기는 것도, 무조건 의심하는 것도 비효율적이다. 에이전트 PR은 커지기 쉬우니 작업을 작게 쪼개라고 지시하고, 한 PR엔 의도 하나만 담게 하는 게 좋다. 정적 분석이나 AI 리뷰 봇으로 1차 리뷰를 돌리더라도 아키텍처·보안·도메인 로직은 사람이 최종 승인하는 식으로 역할을 나누고 싶다.
테스트는 검증 비용을 낮추는 제일 확실한 수단이다. "맞아 보이는데 틀린 코드"는 실행 가능한 테스트로 잡는 게 제일 빠르다. 구현이랑 테스트를 같이 쓰게 하고 CI 통과를 강제한다. 에이전트가 테스트를 통과시키려고 테스트 자체를 고치는 경우가 있어서, 테스트 파일 변경은 따로 눈여겨보는 습관이 필요하다. Sonar 조사에서도 테스트 생성은 AI가 비교적 잘하는 작업으로 꼽혔으니, 커버리지 낮은 레거시부터 에이전트로 테스트를 보강하는 것도 괜찮은 시작점 같다.
거버넌스는 도구보다 규칙이 먼저다. 체크할 것만 적어두면 이 정도다.
- 허용 도구와 데이터 범위: 에이전트가 어떤 저장소·비밀 정보에 접근하는지, 외부 모델로 코드가 나가는지
- 실행 권한 최소화: 쉘 명령, 배포, 프로덕션 DB 접근은 사람 승인 단계 두기
- 프로젝트 규칙 파일(에이전트용 컨텍스트 문서)에 코딩 컨벤션, 금지 패턴, 테스트 실행 방법 적어두기. 결과물 편차가 꽤 줄어든다
- 순위가 몇 달 만에 바뀌는 시장이니 특정 벤더에 워크플로를 너무 묶지 말고 교체 가능한 구조 유지
마지막으로 사람 문제. Anthropic 보고서에 인용된 한 엔지니어는 답이 어떤 모양이어야 하는지 알 때 주로 AI를 쓴다고 했다. 그 감각은 결국 직접 부딪혀본 경험에서 나온다. 에이전트가 코드를 거의 다 쓰는 환경에서 주니어가 판단력을 어떻게 기를지, 리뷰·페어링·설계 토론 같은 장치를 일부러 만들어야 할 것 같다.
개인적인 생각
데이터를 쭉 보고 나니 에이전트는 이미 대부분 개발자의 일상 도구인데, 그 결과물을 검증하는 체계는 아직 한참 뒤에 있다는 인상이 남는다. Claude Code와 Codex가 치고 올라오고 Copilot과 Cursor가 주춤하는 걸 보면 "자동완성"에서 "작업 위임"으로 넘어가는 건 맞는 것 같다. 생성이 빨라질수록 리뷰·테스트·권한 관리가 더 무거워지는 것도.
그래서 앞으로의 차이는 어떤 에이전트를 쓰느냐보다 에이전트가 만든 코드를 얼마나 빠르고 확실하게 검증하느냐에서 날 가능성이 크다고 본다. 나도 이번 주에 팀 CI랑 리뷰 규칙, 권한 설정부터 한 번 훑어볼 생각이다. 2026년 Stack Overflow 설문 결과가 나오면 신뢰 쪽 숫자가 어떻게 움직였는지도 같이 봐야겠다.
참고한 글
- AI Coding Agents: Adoption Trends – The JetBrains Blog — Developer Ecosystem Survey 2026 기반 에이전트 사용률과 도구별 점유율
- How Much Code Do Developers Really Let Agents Write? – The JetBrains Blog — 에이전트가 쓰는 코드 비중과 개발자 유형 분석
- 2026 Agentic Coding Trends Report – Anthropic — 에이전틱 코딩 8대 트렌드와 조직 우선순위 제언
- State of Code Developer Survey Report 2026 – Sonar — AI 코드 신뢰도, 검증 병목, 리뷰 부담 설문
- 2025 Stack Overflow Developer Survey – AI — AI 도구 사용률과 정확성 신뢰도 추이