← Claude Code Hub
✦ Tip #213 Sep 29, 2026

Sonnet 5.5 vs Opus 5.5 en Claude Code: el mismo trabajo por la mitad y más rápido

Anthropic promete que Sonnet 5.5 cuesta hasta un 30% menos que Sonnet 5. Lo puse a prueba con 48 ejecuciones en Claude Code, contra Sonnet 5 y contra Opus 5.5, tu modelo por defecto: acertó todo por menos de la mitad que Opus 5.5. Y cuándo sigue compensando Opus.

Sonnet 5.5 vs Opus 5.5 vs Sonnet 5: las mismas 4 tareas en Claude Code, 3 veces cada una. Coste total de 12 ejecuciones: Sonnet 5.5 $0,88, Opus 5.5 $1,91, Sonnet 5 $2,34. Tiempo de API mediano: 13,4, 21,8 y 38,7 segundos

TL;DR Para una tarea acotada (un bug, un renombrado, un script, un refactor con el diseño ya decidido), empieza la sesión con /model sonnet. Sonnet 5.5 hizo las 12 de 12 por $0,88 en total, frente a los $1,91 de Opus 5.5, y con una mediana de 13 segundos de API por tarea frente a 22. Deja Opus 5.5, tu Default, para lo ambiguo o largo. Y elige al empezar: cambiar de modelo a mitad de sesión rompe la caché y el modelo nuevo pierde el razonamiento del anterior.

Sonnet 5.5 salió ayer, 28 de septiembre de 2026, seis días después de Opus 5.5. Anthropic promete que es más de un 30% más rápido que Sonnet 5 y que cuesta hasta un 30% menos por tarea, al mismo precio por token.

En Claude Code, tu Default sigue siendo Opus 5.5. Sonnet 5.5 solo trabaja si lo pides. Así que la pregunta es si merece la pena pedirlo, y cuándo. Lo medí con el mismo banco de pruebas que usé para Opus 5.5 frente a Fable 5.1.

Lo que promete Anthropic

Prueba Sonnet 5.5 Opus 5.5 Sonnet 5
Terminal-Bench 4.0 70,6% 66,4% 10,3%
CursorBench 4.0 55,5% 57,8% 34,1%
OSWorld 2.1 (computer use) 80,1% 81,8% 57,0%
GDPval-AA (trabajo de oficina) 1844 1846 1449

Son sus cifras, no mías (el Opus 5.5 de Terminal-Bench corre en xhigh). Sonnet 5.5 queda a uno o dos puntos de Opus 5.5 en las demás, y por encima en Terminal-Bench. Aun así, la propia Anthropic dice que Opus 5.5 sigue siendo claramente mejor en el trabajo complejo y abierto, el que pide criterio sostenido.

Por token, Sonnet 5.5 cuesta la mitad que Opus 5.5 ($2/$10 frente a $4/$20 por MTok). La lectura de caché cuesta lo mismo en los dos: $0,20.

Qué medí

El mismo repo PHP de 11 ficheros y las mismas cuatro tareas del benchmark de Opus 5.5: arreglar un bug de redondeo, renombrar una clase en 5 ficheros, escribir un script que calcula costes desde un JSONL y extraer una validación duplicada en tres controladores. Cada una con su comprobación automática. Cada ejecución parte de una copia limpia y se lanza así:

claude -p "<prompt de la tarea>" --model claude-sonnet-5-5 \
  --setting-sources project --strict-mcp-config \
  --no-session-persistence --dangerously-skip-permissions \
  --output-format json

--setting-sources project deja fuera mi settings.json de usuario, así que cada modelo trabaja con su effort por defecto: medium en Sonnet 5.5 y Opus 5.5, high en Sonnet 5. Lo comprobé antes con la sonda de la cadena del effort. Como cuarto participante, Sonnet 5.5 con --effort high.

Los tres modelos, el mismo día y con la misma versión de Claude Code: no reutilicé las cifras de la semana pasada. El benchmark completo (repo, prompts, comprobaciones, harness y las 48 ejecuciones con el diff de cada una) está en este zip.

Resultados

48 ejecuciones: 4 configuraciones × 4 tareas × 3 repeticiones. Medianas por ejecución y total de las 12 de cada una:

Modelo Hechas Coste Tiempo de API Turnos Total
Sonnet 5.5 (medium) 12/12 $0,074 13,4 s 5 $0,88
Sonnet 5.5 (high) 12/12 $0,074 14,3 s 4,5 $0,93
Opus 5.5 (medium) 12/12 $0,162 21,8 s 5 $1,91
Sonnet 5 (high) 9/12 $0,191 38,7 s 13,5 $2,34

Sonnet 5.5 costó menos y tardó menos que Opus 5.5 y que Sonnet 5 en cada una de las cuatro tareas. Frente a Opus 5.5, un 54% menos de coste y un 39% menos de tiempo, con los mismos 12 aciertos. Frente a Sonnet 5, un 62% menos de coste: el doble de lo que promete Anthropic.

Los tres fallos de Sonnet 5 son reales: dos veces redondeó con round($total / 1000000 * 100) / 100, que da 0,57 donde tocaba 0,58, y una vez creó la clase del refactor pero dejó la validación en los tres controladores. Hace seis días, con el mismo repo, falló una de doce. Con tres repeticiones, esa diferencia es variación, no un empeoramiento.

Por qué la mitad

Frente a Opus 5.5 hay dos efectos que se multiplican:

  • Tarifa. Los tokens que gastó Opus 5.5, cobrados a precio de Sonnet 5.5: de $1,91 a $1,12, un 42% menos. No llega al 50% porque la lectura de caché cuesta lo mismo en los dos.
  • Tokens. Los dos resuelven en 5 turnos y leen de caché casi lo mismo, pero Sonnet 5.5 escribe un 43% menos de salida. A la misma tarifa, eso es un 21% menos.
  • Las dos juntas: de $1,91 a $0,88, un 54% menos (0,58 × 0,79).

Frente a Sonnet 5, la tarifa es idéntica, así que todo el ahorro viene de los tokens. Sonnet 5 necesitó 13,5 turnos de mediana, y cada turno relee el contexto: en total leyó de caché 5,3 millones de tokens, Sonnet 5.5 leyó 1,5.

Sobre la velocidad, un matiz: el "más de un 30% más rápido" de Anthropic es velocidad de generación. Lo que medí es el tiempo de API por tarea, que baja sobre todo porque hace menos turnos.

Subirlo a high no compró nada

Sonnet 5.5 en high hizo lo mismo que en medium: 12 de 12 y la misma mediana, $0,074. Igual que con Opus 5.5, en tareas de este tamaño medium no se queda corto. Para un turno concreto que lo pida, ultrathink.

Cuándo Sonnet 5.5, cuándo Opus 5.5, cuándo Fable

Modelo Cuándo
Sonnet 5.5 Sabes qué hay que cambiar y cómo comprobarlo: bugs localizados, renombrados, scripts, refactors con el diseño decidido, iterar sobre una feature
Opus 5.5 (Default) Tienes que decidir el qué, no solo el cómo: diseño, bugs que cruzan módulos, sesiones largas con muchas decisiones encadenadas
Fable 5.1 Territorio nuevo de verdad, o una tarea más grande que una sentada

En julio escribí que Sonnet vivía dentro de los subagentes y nunca como modelo principal. Con estos números, para una tarea acotada, eso ya no se sostiene.

La primera fila es lo que mide este benchmark. Las otras dos no las mide: aquí los dos modelos aciertan todo, y la ventaja de Opus 5.5 en trabajo con criterio es la que declara Anthropic. Para Fable 5.1, el razonamiento está en cómo reparto los modelos.

Dos cosas cambian sin que toques nada. Tus subagentes con model: sonnet ya corren en Sonnet 5.5. Y opusplan, que planifica con Opus y ejecuta con Sonnet, ahora ejecuta con Sonnet 5.5.

Elige al empezar la sesión

Cambiar de modelo a mitad de sesión tiene dos costes:

  • La caché. El modelo forma parte de la clave de caché. El turno siguiente al cambio relee toda la conversación a precio completo (el detalle).
  • El razonamiento. Ningún otro modelo lee los bloques de thinking de Sonnet 5.5, y Sonnet 5.5 no lee los de Opus 5.5. Al cambiar de uno a otro, la API los descarta y el modelo nuevo sigue sin ese razonamiento.

Así que decide al abrir la sesión:

claude --model sonnet

O con /model sonnet antes del primer prompt. Si la tarea se complica por el camino, /compact y después /model opus: el cambio cae sobre un historial ya corto.

Lo que cambia en Claude Code

  • Necesita la v2.1.284, que es la que lo añade y lleva a él el alias sonnet. Tras actualizar, en mi cuenta, claude --model sonnet responde con claude-sonnet-5-5.
  • Arranca en medium, y tu effort global no le llega. Mi settings.json de usuario tiene "effortLevel": "high", y la sonda devuelve EFFORT=medium con Sonnet 5.5. Pasa lo mismo que con Opus 5.5: si quieres otro nivel, añade claude-sonnet-5-5 en modelSettings.
  • El thinking no se puede apagar. alwaysThinkingEnabled y MAX_THINKING_TOKENS=0 no tienen efecto; el effort es el único mando (los demás, en thinking).
  • Sin modo rápido. /fast solo existe en Opus: activarlo desde Sonnet 5.5 te cambia a Opus.
  • 1M de contexto nativo. El sufijo [1m] no hace nada con Sonnet 5.5.
  • Rechazos. Si un clasificador marca una petición por ciberseguridad, Claude Code la repite en Sonnet 5. Si es por biología, termina en rechazo.

Documentación oficial: Model configuration · Introducing Claude Sonnet 5.5 · What's new in Claude Sonnet 5.5

¿Vienes de Sonnet 5? Lo que traía su lanzamiento está en Sonnet 5 en Claude Code. Y por qué Opus 5.5 es tu Default, en Opus 5.5 en Claude Code.

Lo que esto no mide

  • Calidad en tareas difíciles. Sonnet 5.5 y Opus 5.5 aciertan todo, así que esto separa coste y velocidad, no quién razona mejor.
  • Tamaño. Tareas de 7 a 50 segundos de API, tres repeticiones, un día.
  • Dólares de API. Con suscripción no ves este importe. Lo que notas es cuánto te dura el límite de cinco horas y cuánto esperas.

Requisitos

  • Claude Code v2.1.284 o superior (claude update). Todas las cifras son de esa versión, del 29 de septiembre de 2026.
Guía gratuita

Los 51 esenciales, en una guía.

Una página por tip. Cinco capítulos. Lo que de verdad uso a diario en producción. Sin teoría, sin humo.

  • I. Empieza bien 10 tips
  • II. Conciencia 3 tips
  • III. Maestría 22 tips
  • IV. Autonomía 10 tips
  • V. Comparativa 6 tips
¿Eres desarrollador/a Web profesional?

Recibirás la guía por email · Te unes a la newsletter Gravitas · Cancela cuando quieras

de 51
#

Wmedia · 51 Tips
Guía gratuita · 51 tips · 5 capítulos

Los 51 esenciales, en una guía.

¿Eres desarrollador/a Web profesional? · Cancela cuando quieras
Workshop para equipos

Multiplica el output de tu equipo sin sacrificar calidad: workshop AI First de 6 a 8 horas, online, sobre la plataforma Claude.

Ver el workshop

¿Quieres los 51 esenciales de Claude Code en una guía?