• 5 min de lectura
El esfuerzo de razonamiento ahora es una característica de los modelos
Los modelos modernos ya se lanzan con varios modos de razonamiento. Este artículo explica cómo RLVR, el escalado de inferencia y simples trucos de entrenamiento hacen eso posible.

Imagen: Build A Reasoning Model (From Scratch)
Casi dos años después de que OpenAI presentó o1, los modelos de razonamiento han pasado de ser una curiosidad a una característica estándar. DeepSeek-R1 llegó aproximadamente cuatro meses después y ayudó a popularizar el aprendizaje por refuerzo con recompensas verificables (RLVR) como forma de entrenarlos. La semana pasada, OpenAI lanzó la familia GPT-5.6 con tres tamaños y aproximadamente cinco o seis ajustes de esfuerzo de razonamiento por modelo.
En el relato de Sebastian Raschka, el cambio clave no es solo que los modelos puedan “razonar”, sino que puedan hacerlo en distintos niveles de esfuerzo. En la investigación sobre LLM, un modelo de razonamiento no significa un sistema que razone como un humano. Significa un modelo que produce una traza de razonamiento intermedia —una respuesta interna paso a paso antes de la respuesta final.
Hay dos formas generales de mejorar el rendimiento: el escalado del entrenamiento y el escalado de la inferencia.
Cómo RLVR entrena modelos de razonamiento
La parte de entrenamiento ya es familiar. DeepSeek-R1 usó RLVR para recompensar respuestas correctas en dominios donde la corrección puede verificarse automáticamente, como matemáticas y código. La señal de recompensa es simple: 0 = incorrecto y 1 = correcto, usando herramientas como SymPy, WolframAlpha, compiladores, tests unitarios o plataformas como LeetCode para la verificación.

Recomendado
La IA no reemplazará a los programadores, pero sí remodelará el trabajo
Un detalle notable: la traza de razonamiento en sí no es lo que entrena al modelo. Durante RLVR, el modelo es recompensado en función de la respuesta final y del formato de la respuesta, mientras que la traza intermedia se ignora.
Aun así, esa configuración es suficiente para que los modelos aprendan comportamientos asociados al razonamiento: escribir explicaciones intermedias, retroceder y corregir errores. Esas autocorrecciones a menudo se describen como momentos “Aha”.
Raschka también señala que Kimi K1.5 apareció en arXiv el mismo día que DeepSeek-R1 — 22 de enero de 2025 — y que el término RLVR ya se había acuñado dos meses antes en Tülu 3: Pushing Frontiers in Open Language Model Post-Training. Aun así, el artículo de DeepSeek se convirtió en la referencia destacada en parte porque mostró que el comportamiento de razonamiento podía surgir a partir del RL puro.
En la práctica, sin embargo, las canalizaciones completas de entrenamiento suelen ser más complicadas. Tülu 3 y Kimi K1.5 aplicaron aprendizaje por refuerzo sobre un modelo afinado mediante supervisión (SFT). DeepSeek-R1 en sí se entrenó a partir de un checkpoint SFT del modelo base DeepSeek-V3, junto con una variante R1-Zero entrenada con RLVR puro. R1-Zero era más débil que R1, pero sirvió como prueba de concepto de que RLVR por sí solo puede enseñar a un modelo a generar y usar trazas de razonamiento.
Escalado de inferencia y conmutadores de modo de razonamiento
El entrenamiento es solo la mitad de la historia. La otra palanca es el escalado de cómputo en la inferencia: gastar más cómputo en tiempo de ejecución para mejorar las respuestas. Los modelos de razonamiento ya hacen parte de esto implícitamente porque generan más tokens que los LLM convencionales. Los niveles de esfuerzo lo llevan más lejos controlando la longitud de salida y el presupuesto de cómputo.
Una técnica adicional común es la self-consistency, donde se consulta al modelo varias veces y la respuesta final se elige por voto mayoritario.
Raschka señala a DeepSeekMath-V2 como ejemplo de llevar esto al extremo, superponiendo un agresivo escalado de inferencia sobre un modelo de razonamiento especializado en matemáticas para alcanzar un rendimiento de vanguardia en problemas difíciles al estilo de olimpiadas.
También dedica tiempo a un concepto erróneo común: los tokens <think></think> no son lo que hace que un modelo razone.
Esas etiquetas son principalmente marcadores de formato, usados para separar la traza de razonamiento de la respuesta final para que la canalización de entrenamiento o la interfaz de usuario pueda ocultarla. Pueden reforzarse con una recompensa de formato durante RLVR, como en DeepSeek-R1, donde:
R_total = R_accuracy + R_format
La primera generación de sistemas de razonamiento fueron modelos dedicados como DeepSeek-R1, que tendían a producir respuestas largas y verbosas para casi cualquier prompt.
Los sistemas más recientes, como Qwen3, se movieron hacia un comportamiento híbrido, permitiendo que el mismo modelo actúe bien como un modelo afinado por instrucciones estándar o bien como un modelo de razonamiento bajo demanda. En Qwen3, ese interruptor se expone a través del tokenizador como enable_thinking=True o enable_thinking=False. Con enable_thinking=False, el sistema inyecta efectivamente un bloque vacío <think></think> al inicio de la respuesta del asistente para desactivar el modo de razonamiento.
Según el informe técnico de Qwen3, ese conmutador se introduce principalmente mediante SFT y luego se refuerza durante el RL general en sus modelos insignia más grandes. Tras una SFT inicial con largas cadenas de pensamiento y RL de razonamiento, Qwen añade una etapa de Thinking Mode Fusion donde el modelo ve ambos formatos:
- /think: <think>{reasoning}</think>{answer}
- /no_think: <think></think>{answer}
Thinking sigue siendo el comportamiento por defecto, por lo que /think se puede omitir. El resultado es un modelo que puede cambiar su esfuerzo de razonamiento en tiempo de inferencia —una capacidad que rápidamente se está convirtiendo en una expectativa por defecto en los lanzamientos de vanguardia.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía Hacker News


