TL;DR Escribe
ultrathinken el turno difícil y ese turno razona como si hubieras subido ahigh: en mis pruebas con Opus 5.5, un 27% más de razonamiento quemediumy un 9% más de coste. Tu effort no se mueve y el siguiente turno vuelve a lo normal. Lo que no hace es acertar más en lo quemediumya resuelve.
Si buscas ultrathink, la mitad de los resultados lo dan por enterrado y la otra mitad lo presentan como el modo máximo de Claude. Lo he medido en la v2.1.281 con Opus 5.5. Ni una cosa ni la otra.
Qué hace ahora
Claude Code reconoce la palabra en cualquier parte del prompt y añade al turno una instrucción en contexto. Es esta, literal:
The user included the keyword "ultrathink", requesting deeper reasoning on this turn.
Reason as thoroughly as the task warrants.
Eso es todo. Una nota para ese turno. El siguiente prompt ya no la lleva.
Es la única palabra que queda. think, think hard o think more llegan al modelo como texto normal: Claude Code no añade nada por ellas.
Qué no hace
No sube el effort. El nivel que se envía a la API sigue siendo el tuyo. Lo comprobé con la skill /whicheffort de la cadena del effort, que imprime ${CLAUDE_EFFORT}:
$ claude -p "/whicheffort" --model claude-opus-5-5
EFFORT=medium
$ claude -p "ultrathink /whicheffort" --model claude-opus-5-5
EFFORT=medium
No se guarda. No toca tu settings.json ni el nivel que tengas fijado por modelo.
No te da más aciertos en lo que medium ya resuelve. Esto es lo que medí.
Lo que medí
Cinco problemas con respuesta exacta y comprobable: combinatoria, probabilidad y un recuento de monedas, sin herramientas para que Claude no pudiera escribir código y tuviera que razonarlo. Tres configuraciones de Opus 5.5, tres repeticiones de cada una, 45 ejecuciones:
claude -p "<problema>" --model claude-opus-5-5 [--effort high] \
--tools "" --setting-sources project --strict-mcp-config \
--no-session-persistence --output-format json
En la configuración con ultrathink, el prompt empieza por ultrathink. y nada más cambia. El razonamiento es thinkingTokens del JSON de cada ejecución; el coste, total_cost_usd a tarifa de lista.
| Configuración | Aciertos | Razonamiento | Tiempo de API | Coste de las 15 |
|---|---|---|---|---|
medium (el que trae por defecto) |
15/15 | 901 tokens | 15,3 s | $0,60 |
medium + ultrathink |
14/15 | 1.148 tokens | 18,0 s | $0,65 |
--effort high |
15/15 | 1.102 tokens | 17,7 s | $0,64 |
Razonamiento y tiempo son la mediana de los dos problemas largos (permutaciones y monedas); en los otros tres ninguna configuración pasó de 300 tokens de razonamiento.
Con ultrathink, Opus 5.5 razonó un 27% más que en medium, casi lo mismo que en high (un 22% más), y costó un 9% más. Unos tres segundos de espera extra por respuesta.
Los aciertos no se movieron, porque medium ya lo resolvía todo. El único fallo de las 45 ejecuciones fue de ultrathink: 22 formas de pagar un dólar donde había 24. Con tres repeticiones eso no demuestra que empeore. Demuestra que aquí no mejora.
Cuándo usarlo
Para un turno concreto, en lugar de subir el effort de toda la sesión. Una decisión de diseño, un bug que cruza varios módulos, una migración que quieres ver planteada con calma. Escribes ultrathink en ese prompt y el siguiente vuelve a tu nivel sin que tengas que acordarte de bajarlo.
En Opus 5 y Sonnet 5 te ahorra además una relectura sin caché. En esos modelos, cambiar el effort a mitad de sesión obliga a releer la conversación entera sin caché, y eso se paga. ultrathink no cambia el effort, así que esa relectura no se produce. En Opus 5.5 y Fable 5.1 con suscripción o API key, cambiar el effort ya conserva la caché, y la diferencia se queda en el alcance: un turno o la sesión entera.
No lo pongas en todos los prompts. Eso es trabajar en high sin decirlo. Si todas tus tareas lo necesitan, fija high para ese modelo con /effort y deja ultrathink para lo excepcional. En mi benchmark de Opus 5.5 subirlo a high no cambió nada en tareas de diario.
Lo que esto no mide
- Problemas donde
mediumse queda corto. Todos acertaron casi todo, así que esto mide cuánto razona y cuánto cuesta, no si piensa mejor. En una tarea quemediumfalla, la nota extra podría notarse. - Tamaño. Cinco problemas, tres repeticiones, un modelo, un día.
- Sesiones con herramientas. Lo corrí con
--tools "". Si la nota hace que Claude lea más ficheros antes de escribir, esta prueba no lo ve.
Si lo que buscas es ver lo que piensa Claude, ultrathink no te lo enseña: eso se consigue de otra forma. Y por qué el effort es el único mando del thinking que sigue conectado a algo, en thinking en Claude Code.
Documentación oficial: Model configuration: use ultrathink for one-off deep reasoning · Prompt caching: changing effort level
Requisitos
- Comprobado en Claude Code v2.1.281 con Opus 5.5, el 24 de septiembre de 2026.