Claude Opus 5.5가 나왔다: Fable 5.1급 성능을 훨씬 싼 값에, 9월 Anthropic 발표 정리

2026년 09월 22일
16분 읽기
목차 6

9월 한 달 동안 Anthropic 발표를 두 번이나 따라가느라 좀 정신이 없었다. 9월 1일에 최상위 모델 Claude Fable 5.1과, 같은 모델에 안전장치만 다르게 건 Claude Mythos 5.1이 나왔고, 3주 뒤인 9월 22일에는 Claude Opus 5.5가 공개됐다.

두 발표를 나란히 놓고 보니 결이 조금 다르다. Fable 5.1은 최고 성능을 더 싸게 쓰게 해주겠다는 쪽이고, Opus 5.5는 그 최고 성능에 가까운 결과를 훨씬 낮은 단가로 주겠다는 쪽이다. 솔직히 나는 후자가 더 반가웠다.

여기 나오는 벤치마크 수치는 전부 Anthropic이 직접 공개한 값이다. 회사 자체 수치라 실제 워크로드에서는 체감이 다를 수 있으니 좀 걸러 들을 필요는 있다.

세 모델이 어떤 관계인지부터

이걸 먼저 잡아두면 나머지가 편하다.

Fable 5.1(9월 1일)은 Anthropic에서 가장 강력한 범용 모델이다. 코딩, 지식 노동, 장시간 문제 해결을 노리고, API와 주요 클라우드에서 누구나 쓸 수 있다. Mythos 5.1(9월 1일)은 Fable 5.1과 동일한 모델인데 사이버보안·생명과학 쪽 안전장치를 풀어둔 버전이다. 신뢰 접근 프로그램에 들어간 미국 기업·개인만 쓸 수 있다.

Opus 5.5(9월 22일)는 새 5.5 패밀리의 첫 모델이다. 대부분의 작업에서 Fable 5.1 수준을 내면서 가격은 Opus 5보다 내려갔다. Sonnet 5.5와 Haiku 5.5도 "수 주 내"에 나온다고 예고됐다.

정리하면 성능 꼭대기에는 Fable/Mythos 5.1이 있고, Opus 5.5는 그 성능을 실무에서 부담 없는 가격대로 끌어내리는 역할이라고 보면 될 것 같다.

Fable 5.1과 Mythos 5.1: 같은 모델, 다른 안전장치

Anthropic은 Fable 5.1이 Fable 5보다 코딩과 에이전트 작업에서 크게 좋아졌다고 밝혔다. 눈에 띈 숫자만 추리면 이렇다.

  • Terminal-Bench 4.0(에이전트형 코딩): 42.0% → 55.8%
  • Terminal-Bench-Science 0.1(과학 연구형 에이전트 작업): 24.7% → 52.6%
  • AutomationBench(업무 자동화): 17.1% → 31.4%

과학 쪽 에이전트 벤치마크가 두 배 넘게 뛴 게 좀 의외였다. 이번엔 연구용 에이전트를 꽤 중요한 축으로 보고 있구나 싶었다. 발표에는 Mythos 5.1로 단백질 바인더를 설계한 사례, 오래된 NASA 레이더 데이터로 금성 고도 지도를 더 정밀하게 다시 만든 사례도 나온다.

가격은 기본 단가가 입력 100만 토큰당 $10, 출력 $50으로 Fable 5와 같다. 대신 캐시 읽기가 $1.00에서 $0.25로 75% 인하됐다. 숫자만 보면 별거 아닌 것 같은데, 에이전트를 돌려본 사람이면 이게 왜 큰지 안다. 에이전트는 시스템 프롬프트, 도구 정의, 쌓인 대화 맥락을 매 턴 다시 보내니까 전체 토큰 중 캐시 적중 비중이 엄청 높다. Anthropic 설명으로는 일반 워크로드는 약 25%, 에이전트 성향이 강한 워크로드는 최대 약 45%까지 비용이 준다고 한다.

개인적으로 은근히 반가웠던 건 오탐 감소다. 사이버보안 관련 개입이 세션당 약 60% 줄었다고 하는데, 방어 목적의 취약점 탐지는 허용하고 익스플로잇 생성이나 침투 테스트 같은 건 여전히 막는다. 기초적인 생물·의학 질문을 불필요하게 막는 일도 Fable 5보다 크게 줄었다고 한다. 보안 코드 만지다가 멀쩡한 요청이 막혀본 적이 있어서 이건 체감이 클 것 같다.

Mythos 5.1은 일반 개발자가 바로 쓸 수 있는 모델이 아니다. 보안 방어 업무용 Cyber Verification Program, 생명과학 연구용 Life Sciences Verification Program을 통해서만 접근할 수 있고, 지금은 미국 조직으로 제한된다. 검증된 보안·바이오 조직이 아니라면 그냥 Fable 5.1 기준으로 생각하면 된다.

Opus 5.5: Fable급 성능을 Opus 가격대로

Anthropic은 Opus 5.5가 "대부분의 작업에서" Fable 5.1 수준이라고 하고, 몇몇 영역에서는 오히려 넘어섰다고 한다. 같은 벤치마크 버전으로 비교된 수치는 이렇다.

벤치마크 (Anthropic 공개 수치)Opus 5.5Fable 5.1Opus 5
Terminal-Bench 4.0 (에이전트형 코딩)66.4%55.8%52.3%
CursorBench 4.0 (멀티 파일·모호한 과제)57.8%51.8%46.6%
GDPval-AA v2.1 (지식 노동, Elo)184617351708

그 밖에 OSWorld 2.0(컴퓨터 사용) 81.8%, Humanity's Last Exam(도구 사용) 67.7%도 공개됐다. 하나 주의할 건, Fable 5.1 발표와 Opus 5.5 발표에서 쓴 벤치마크 버전이 일부 다르다는 점이다(예: CursorBench 3.2.0 vs 4.0). 서로 다른 발표의 숫자를 그대로 비교하면 안 된다.

얼리 테스터 사례로는 68만 줄 코드 마이그레이션을 하루 안에 끝냈다거나, 20만 줄 코드베이스 감사를 3시간 안에 마쳤다는(Opus 5는 20시간 이상) 이야기가 나온다. 인상적이긴 한데 어디까지나 골라 뽑은 사례라는 건 감안해야 한다.

가격은 솔직히 제일 먼저 봤다. 100만 토큰당 기준으로,

  • 입력 $4 (Opus 5 대비 20% 인하)
  • 출력 $20 (20% 인하)
  • 캐시 읽기 $0.20 (60% 인하)
  • 캐시 쓰기 $5

Anthropic은 일반적인 워크로드 기준 Opus 5보다 약 40% 비용 절감이 된다고 한다. 출력 속도도 Opus 5보다 30% 이상 빨라졌고, Claude Code와 Claude Platform에서는 최대 2.5배 빠른 fast mode(입력 $8 / 출력 $40, 기본 단가의 두 배)도 있다. Fable 5.1($10 / $50)과 비교하면 입력·출력 모두 40% 수준이고, 캐시 읽기도 Fable 5.1($0.25)보다 싸다.

바뀐 점 중에 제일 신경 쓰이는 건 thinking이 항상 켜져 있다는 거다. Anthropic은 Opus 5.5를 thinking을 끈 상태로는 제공하지 않는다고 밝혔다. thinking을 꺼서 지연이나 토큰을 아끼던 파이프라인이면 동작과 비용을 다시 봐야 한다. 발표에 low / medium / high / xhigh 같은 effort 단계가 같이 언급되는 걸 보면, 비용 제어는 effort 설정 쪽으로 옮겨가는 흐름 같다.

사이버보안 작업은 라우팅될 수 있다는 것도 알아두자. Opus 5.5는 Fable 5.1과 비슷한 안전장치를 받고, 발표에 따르면 대부분의 사이버보안 작업은 Opus 4.8로 재라우팅된다. 보안 도구 만드는 팀이면 결과 품질을 따로 검증해봐야 한다.

그 외에 Anthropic의 자동화된 행동 감사에서 지금까지 테스트한 모델 중 정렬(alignment) 결과가 가장 좋았고, 출시 전 METR 등 외부 기관 평가도 거쳤다고 한다. 프롬프트 인젝션 내성도 나아졌다고 한다. 구독 쪽은 Pro, Max, Team, 좌석 기반 Enterprise 플랜의 5시간 사용 한도가 올라갔고, 원할 때 쓸 수 있는 rate limit 리셋이 생겼다.

모델 ID는 claude-opus-5-5이고, Claude Platform, AWS, Google Cloud, Microsoft Azure 어디서든 쓸 수 있다.

우리 팀이라면 이렇게 할 것 같다

지금까지 "어려운 건 Fable, 나머지는 Opus"로 나눠 썼다면 그 경계를 다시 그려볼 때다. 공개 수치상 에이전트형 코딩이나 멀티 파일 작업에서는 Opus 5.5가 Fable 5.1과 비슷하거나 앞서고, 단가는 절반도 안 된다. 나라면 Opus 5.5를 기본값으로 두고, 실제 평가셋에서 모자란 케이스만 Fable 5.1로 올리겠다. 최고 난도 연구나 장시간 문제 해결이라면 Fable 5.1을 기준선으로 두고 Opus 5.5와 비용 대비 품질을 비교해보는 정도가 적당해 보인다.

두 발표 모두 캐시 읽기 가격을 크게 내렸으니, 이제 캐시 설계가 곧 비용 설계다. 점검해볼 건 이 정도다.

  • 시스템 프롬프트와 도구 정의를 고정된 앞부분에 둬서 캐시 적중을 최대로 뽑고 있는지
  • 타임스탬프, 요청 ID처럼 매번 바뀌는 값이 프롬프트 앞쪽에 섞여서 캐시를 깨고 있진 않은지
  • 대시보드에서 캐시 읽기 토큰과 일반 입력 토큰 비율을 보고 있는지

Opus 5.5는 모델 ID만 바꾸면 끝나는 문제가 아닐 수도 있다. thinking을 끌 수 없으니 응답 지연, 출력 토큰 수, 스트리밍 처리 로직이 달라질 수 있다. 교체 전에 요청당 평균·p95 지연, 출력 토큰을 포함한 요청당 총비용, effort 단계별 품질과 비용의 균형점 정도는 비교해두는 게 좋겠다.

보안 스캐너, 취약점 분석 도구, 생명과학 서비스를 만든다면 안전장치와 라우팅 영향을 바로 받는다. 방어 목적이면 Cyber Verification Program 같은 신뢰 접근 프로그램을 검토해보고(검증된 조직이라면 Mythos 5.1도 후보다), 아니라면 어떤 요청이 막히거나 다른 모델로 넘어가는지 미리 테스트해두자.

그리고 모델이 좋아지고 인젝션 내성이 나아졌다고 에이전트 권한을 넓게 줘도 되는 건 아니다. 좁은 범위의 자격 증명, 도구 허용 목록, 되돌릴 수 없는 작업엔 사람 승인. 이 기본은 그대로 가져가는 게 맞다고 본다.

대량 처리나 저지연이 중요한 워크로드라면 곧 나올 Sonnet 5.5, Haiku 5.5까지 보고 정하거나 기존 경량 모델을 유지하는 편이 나을 수 있다. 복잡한 코딩 에이전트나 장시간 작업이라면 지금 Opus 5.5로 평가를 시작해도 충분하다.

개인적인 생각

9월 두 발표를 묶어 보면 방향은 꽤 분명해 보인다. 꼭대기 성능은 Fable/Mythos 5.1로 계속 밀어 올리고, 그 성능을 Opus 5.5로 훨씬 많은 사람이 감당할 수 있는 가격까지 내려보내겠다는 거다. 캐시 읽기 인하가 두 발표에 다 들어간 걸 보면, 경쟁 포인트가 한 번의 응답 품질보다 장시간 에이전트를 얼마나 싸고 안정적으로 돌리느냐로 옮겨가는 것 같다.

결국 벤치마크보다 중요한 건 내 워크로드에서 품질, 지연, 비용이 어떻게 나오느냐다. 이번에 평가셋이랑 비용 모니터링을 정비해두면 Sonnet 5.5, Haiku 5.5가 나올 때 훨씬 빨리 판단할 수 있을 것 같다. 나도 그쪽부터 손볼 생각이다.

참고한 글