TL;DR Deja Opus 5.5 en
mediumpara el trabajo de repo del día a día. Le di tres tareas con casos límite ocultos (un open redirect, renovaciones mensuales y un importador CSV) enmedium,highyxhigh, tres veces cada una. Las 27 ejecuciones pasaron todos los casos ocultos.highcostó un 36% más yxhighel triple, con el triple de espera. Cuando una tarea concreta lo pida, sube el effort solo para esa sesión:claude --effort high.
Opus 5.5 arranca en medium, un nivel por debajo del high de Opus 5. En mi benchmark de Opus 5.5, high dio el mismo resultado que medium y costó lo mismo, pero aquellas tareas eran tan pequeñas que las resolvía cualquiera. La pregunta seguía abierta: ¿dónde se queda corto medium?
Anthropic da una pista. En su artículo Spending your effort, la conclusión es que subir el effort compensa en tareas con muchos casos límite escondidos, porque a más nivel Claude prueba y verifica más. Así que construí tareas de ese tipo.
Qué medí
Tres tareas en un repo PHP pequeño. Ningún prompt enumera los casos límite: cada uno describe el objetivo, y el repo trae un test visible que un arreglo superficial hace pasar. Cada ejecución se puntúa después con una batería oculta que el modelo nunca vio.
| Tarea | Qué pide el prompt | Batería oculta |
|---|---|---|
| Open redirect | Que ?next= solo redirija si el navegador se queda en https://app.example.com |
45 URLs (33 que sacan al usuario del sitio, 12 legítimas), validadas con Node contra el estándar WHATWG que implementan los navegadores |
| Renovaciones | Renovar el día del alta, o el último día del mes si es más corto, a la misma hora local | 20 casos: fin de mes, años bisiestos, deriva, cambio de hora, zonas horarias |
| CSV | Leer bien los CSV reales de Excel y Google Sheets (RFC 4180) | 23 casos: saltos de línea entre comillas, comillas dobladas, barras invertidas, BOM, CRLF |
Antes probé tres tareas con una especificación que listaba cada regla. medium sacó el 100% en las tres, así que quité la especificación.
Cada ejecución parte de una copia limpia del repo:
claude -p "<prompt de la tarea>" --model claude-opus-5-5 --effort xhigh \
--setting-sources project --strict-mcp-config \
--no-session-persistence --dangerously-skip-permissions \
--output-format json
Sin --effort para medium. Comprobé el nivel real de cada configuración con la sonda de la cadena del effort. El benchmark completo (repo, prompts, baterías, soluciones de referencia y las 27 ejecuciones con su diff) está en este zip.
Resultados
Medianas por ejecución, y el total de las 9 de cada nivel:
| Effort | Casos ocultos | Coste | Tiempo de API | Thinking | Total |
|---|---|---|---|---|---|
medium (Default) |
100% | $0,18 | 31 s | 506 tokens | $1,69 |
high |
100% | $0,22 | 42 s | 1.095 tokens | $2,30 |
xhigh |
100% | $0,38 | 95 s | 5.483 tokens | $4,99 |
Ni un solo caso fallado en 27 ejecuciones. Lo único que cambia con el nivel es lo que pagas y lo que esperas.
El open redirect es donde más se nota. En medium, Opus 5.5 vio por sí solo que parse_url() de PHP no lee las URLs como un navegador, y escribió una función que imita su parser: quita tabuladores y saltos de línea, trata \ como / y descarta lo que hay antes de la última @. En una de las tres ejecuciones, además, se escribió 26 casos de prueba propios. Mediana: menos de un minuto y $0,24. En xhigh llegó a la misma función, con los mismos 45 aciertos, en 4 a 6,5 minutos y por $0,90 a $1,20 cada vez.
En qué se gasta el dinero
Opus 5.5 cuesta $20 por millón de tokens de salida, y el thinking cuenta como salida. Sumando las 9 ejecuciones de cada nivel:
medium |
high |
xhigh |
|
|---|---|---|---|
| Thinking | 7.709 | 21.521 | 92.176 |
| Salida total | 32.165 | 50.509 | 140.214 |
| Lecturas de caché | 1,14 M | 1,35 M | 2,35 M |
xhigh piensa 12 veces más que medium y escribe más de 4 veces más. Además da más vueltas (7 turnos de mediana frente a 5), y cada turno relee la conversación. Con suscripción no ves los dólares, pero lo notas en el límite de cinco horas y en la espera.
Cuándo sí subirlo
Mis tareas duraron entre 16 segundos y 6,5 minutos de API. Las de Anthropic son de otra escala: en Terminal-Bench 3.0 hay tareas como montar una consola de 8 bits en Verilog. Ahí sí aparece la diferencia: en un sanitizador de HTML contra inyección de JavaScript, Fable 5.1 pasó de 1 de 5 intentos en low a 5 de 5 en xhigh.
Así que el effort alto tiene sentido cuando le pides a Claude un trabajo largo que no vas a revisar paso a paso: una auditoría de seguridad, una migración entera, algo que lanzas y dejas correr. Para una tarea que vas a leer al terminar, medium ya hace ese trabajo.
Y súbelo solo para esa sesión:
claude --effort high
Dentro de una sesión, según la documentación, /effort abre el selector: eliges el nivel y pulsas s para aplicarlo solo a la sesión actual. Con Enter, o escribiendo /effort high, se queda guardado como tu nivel por defecto para ese modelo, y lo arrastras a todas las tareas pequeñas.
Mi settings.json no tiene entrada para Opus 5.5 en modelSettings, así que trabaja en su medium. Con estos números, ahí se queda. Para un turno concreto que pida más, está ultrathink.
Documentación oficial: Model configuration: Adjust effort level · Spending your effort
Lo que esto no mide
- Tareas largas. Nada de lo que medí pasa de 6,5 minutos. El punto donde
highempieza a compensar existe, pero está por encima de este tamaño. - Construcciones abiertas. Aquí cada tarea tenía una respuesta correcta. Según Anthropic, en un "hazme una app" el nivel cambia cuánto decide Claude por su cuenta.
- Tamaño de muestra. Un modelo, tres repeticiones, un día.
Requisitos
- Claude Code v2.1.284. Todas las cifras son de esa versión, del 2 de octubre de 2026, a precio de lista de la API.