← Claude Code Hub
✦ Tip #216 Oct 2, 2026

Effort en Claude Code: en Opus 5.5, medium hace lo mismo por un tercio de lo que cuesta xhigh

Anthropic dice que subir el effort compensa cuando hay casos límite ocultos. Le preparé a Opus 5.5 tres tareas así y las lancé 27 veces en medium, high y xhigh: todas acertaron todo. Lo que cambió fue la factura.

Effort en Claude Code con Opus 5.5: medium, high y xhigh superaron el 100% de los casos límite ocultos en 27 ejecuciones. Coste total: $1,69, $2,30 y $4,99. Tiempo de API mediano: 31, 42 y 95 segundos

TL;DR Deja Opus 5.5 en medium para el trabajo de repo del día a día. Le di tres tareas con casos límite ocultos (un open redirect, renovaciones mensuales y un importador CSV) en medium, high y xhigh, tres veces cada una. Las 27 ejecuciones pasaron todos los casos ocultos. high costó un 36% más y xhigh el triple, con el triple de espera. Cuando una tarea concreta lo pida, sube el effort solo para esa sesión: claude --effort high.

Opus 5.5 arranca en medium, un nivel por debajo del high de Opus 5. En mi benchmark de Opus 5.5, high dio el mismo resultado que medium y costó lo mismo, pero aquellas tareas eran tan pequeñas que las resolvía cualquiera. La pregunta seguía abierta: ¿dónde se queda corto medium?

Anthropic da una pista. En su artículo Spending your effort, la conclusión es que subir el effort compensa en tareas con muchos casos límite escondidos, porque a más nivel Claude prueba y verifica más. Así que construí tareas de ese tipo.

Qué medí

Tres tareas en un repo PHP pequeño. Ningún prompt enumera los casos límite: cada uno describe el objetivo, y el repo trae un test visible que un arreglo superficial hace pasar. Cada ejecución se puntúa después con una batería oculta que el modelo nunca vio.

Tarea Qué pide el prompt Batería oculta
Open redirect Que ?next= solo redirija si el navegador se queda en https://app.example.com 45 URLs (33 que sacan al usuario del sitio, 12 legítimas), validadas con Node contra el estándar WHATWG que implementan los navegadores
Renovaciones Renovar el día del alta, o el último día del mes si es más corto, a la misma hora local 20 casos: fin de mes, años bisiestos, deriva, cambio de hora, zonas horarias
CSV Leer bien los CSV reales de Excel y Google Sheets (RFC 4180) 23 casos: saltos de línea entre comillas, comillas dobladas, barras invertidas, BOM, CRLF

Antes probé tres tareas con una especificación que listaba cada regla. medium sacó el 100% en las tres, así que quité la especificación.

Cada ejecución parte de una copia limpia del repo:

claude -p "<prompt de la tarea>" --model claude-opus-5-5 --effort xhigh \
  --setting-sources project --strict-mcp-config \
  --no-session-persistence --dangerously-skip-permissions \
  --output-format json

Sin --effort para medium. Comprobé el nivel real de cada configuración con la sonda de la cadena del effort. El benchmark completo (repo, prompts, baterías, soluciones de referencia y las 27 ejecuciones con su diff) está en este zip.

Resultados

Medianas por ejecución, y el total de las 9 de cada nivel:

Effort Casos ocultos Coste Tiempo de API Thinking Total
medium (Default) 100% $0,18 31 s 506 tokens $1,69
high 100% $0,22 42 s 1.095 tokens $2,30
xhigh 100% $0,38 95 s 5.483 tokens $4,99

Ni un solo caso fallado en 27 ejecuciones. Lo único que cambia con el nivel es lo que pagas y lo que esperas.

El open redirect es donde más se nota. En medium, Opus 5.5 vio por sí solo que parse_url() de PHP no lee las URLs como un navegador, y escribió una función que imita su parser: quita tabuladores y saltos de línea, trata \ como / y descarta lo que hay antes de la última @. En una de las tres ejecuciones, además, se escribió 26 casos de prueba propios. Mediana: menos de un minuto y $0,24. En xhigh llegó a la misma función, con los mismos 45 aciertos, en 4 a 6,5 minutos y por $0,90 a $1,20 cada vez.

En qué se gasta el dinero

Opus 5.5 cuesta $20 por millón de tokens de salida, y el thinking cuenta como salida. Sumando las 9 ejecuciones de cada nivel:

medium high xhigh
Thinking 7.709 21.521 92.176
Salida total 32.165 50.509 140.214
Lecturas de caché 1,14 M 1,35 M 2,35 M

xhigh piensa 12 veces más que medium y escribe más de 4 veces más. Además da más vueltas (7 turnos de mediana frente a 5), y cada turno relee la conversación. Con suscripción no ves los dólares, pero lo notas en el límite de cinco horas y en la espera.

Cuándo sí subirlo

Mis tareas duraron entre 16 segundos y 6,5 minutos de API. Las de Anthropic son de otra escala: en Terminal-Bench 3.0 hay tareas como montar una consola de 8 bits en Verilog. Ahí sí aparece la diferencia: en un sanitizador de HTML contra inyección de JavaScript, Fable 5.1 pasó de 1 de 5 intentos en low a 5 de 5 en xhigh.

Así que el effort alto tiene sentido cuando le pides a Claude un trabajo largo que no vas a revisar paso a paso: una auditoría de seguridad, una migración entera, algo que lanzas y dejas correr. Para una tarea que vas a leer al terminar, medium ya hace ese trabajo.

Y súbelo solo para esa sesión:

claude --effort high

Dentro de una sesión, según la documentación, /effort abre el selector: eliges el nivel y pulsas s para aplicarlo solo a la sesión actual. Con Enter, o escribiendo /effort high, se queda guardado como tu nivel por defecto para ese modelo, y lo arrastras a todas las tareas pequeñas.

Mi settings.json no tiene entrada para Opus 5.5 en modelSettings, así que trabaja en su medium. Con estos números, ahí se queda. Para un turno concreto que pida más, está ultrathink.

Documentación oficial: Model configuration: Adjust effort level · Spending your effort

Lo que esto no mide

  • Tareas largas. Nada de lo que medí pasa de 6,5 minutos. El punto donde high empieza a compensar existe, pero está por encima de este tamaño.
  • Construcciones abiertas. Aquí cada tarea tenía una respuesta correcta. Según Anthropic, en un "hazme una app" el nivel cambia cuánto decide Claude por su cuenta.
  • Tamaño de muestra. Un modelo, tres repeticiones, un día.

Requisitos

  • Claude Code v2.1.284. Todas las cifras son de esa versión, del 2 de octubre de 2026, a precio de lista de la API.
Guía gratuita

Los 51 esenciales, en una guía.

Una página por tip. Cinco capítulos. Lo que de verdad uso a diario en producción. Sin teoría, sin humo.

  • I. Empieza bien 10 tips
  • II. Conciencia 3 tips
  • III. Maestría 22 tips
  • IV. Autonomía 10 tips
  • V. Comparativa 6 tips
¿Eres desarrollador/a Web profesional?

Recibirás la guía por email · Te unes a la newsletter Gravitas · Cancela cuando quieras

de 51
#

Wmedia · 51 Tips
Guía gratuita · 51 tips · 5 capítulos

Los 51 esenciales, en una guía.

¿Eres desarrollador/a Web profesional? · Cancela cuando quieras
Workshop para equipos

Multiplica el output de tu equipo sin sacrificar calidad: workshop AI First de 6 a 8 horas, online, sobre la plataforma Claude.

Ver el workshop

¿Quieres los 51 esenciales de Claude Code en una guía?