5 min de lectura

El esfuerzo de razonamiento ahora es una característica de los modelos

Los modelos modernos ya se lanzan con varios modos de razonamiento. Este artículo explica cómo RLVR, el escalado de inferencia y simples trucos de entrenamiento hacen eso posible.

Imagen: Build A Reasoning Model (From Scratch)

Casi dos años después de que OpenAI presentó o1, los modelos de razonamiento han pasado de ser una curiosidad a una característica estándar. DeepSeek-R1 llegó aproximadamente cuatro meses después y ayudó a popularizar el aprendizaje por refuerzo con recompensas verificables (RLVR) como forma de entrenarlos. La semana pasada, OpenAI lanzó la familia GPT-5.6 con tres tamaños y aproximadamente cinco o seis ajustes de esfuerzo de razonamiento por modelo.

Figura 1: El modelo GPT 5.6 Sol con diferentes ajustes de esfuerzo de razonamiento. (Los números de referencia para Ultra no están disponibles actualmente, pero deberían ser relativamente similares a los de Max, ya que utiliza un nivel de esfuerzo similar pero acelera el trabajo con cuatro subagentes.)
Figura 1: El modelo GPT 5.6 Sol con diferentes ajustes de esfuerzo de razonamiento. (Los números de referencia para Ultra no están disponibles actualmente, pero deberían ser relativamente similares a los de Max, ya que utiliza un nivel de esfuerzo similar pero acelera el trabajo con cuatro subagentes.)

En el relato de Sebastian Raschka, el cambio clave no es solo que los modelos puedan “razonar”, sino que puedan hacerlo en distintos niveles de esfuerzo. En la investigación sobre LLM, un modelo de razonamiento no significa un sistema que razone como un humano. Significa un modelo que produce una traza de razonamiento intermedia —una respuesta interna paso a paso antes de la respuesta final.

Figura 3: Ilustración de una respuesta convencional de un LLM (izquierda) y una respuesta de un modelo de razonamiento (derecha).
Figura 3: Ilustración de una respuesta convencional de un LLM (izquierda) y una respuesta de un modelo de razonamiento (derecha).

Hay dos formas generales de mejorar el rendimiento: el escalado del entrenamiento y el escalado de la inferencia.

Figura 4: El escalado del entrenamiento y de la inferencia son dos maneras de mejorar las capacidades de resolución de problemas de los LLM y modelos de razonamiento. Gráfico basado en Learning to reason with LLMs.
Figura 4: El escalado del entrenamiento y de la inferencia son dos maneras de mejorar las capacidades de resolución de problemas de los LLM y modelos de razonamiento. Gráfico basado en Learning to reason with LLMs.

Cómo RLVR entrena modelos de razonamiento

La parte de entrenamiento ya es familiar. DeepSeek-R1 usó RLVR para recompensar respuestas correctas en dominios donde la corrección puede verificarse automáticamente, como matemáticas y código. La señal de recompensa es simple: 0 = incorrecto y 1 = correcto, usando herramientas como SymPy, WolframAlpha, compiladores, tests unitarios o plataformas como LeetCode para la verificación.

Recomendado

La IA no reemplazará a los programadores, pero sí remodelará el trabajo

Figura 5: Ilustración de las recompensas de exactitud y de formato durante el entrenamiento con RLVR.
Figura 5: Ilustración de las recompensas de exactitud y de formato durante el entrenamiento con RLVR.

Un detalle notable: la traza de razonamiento en sí no es lo que entrena al modelo. Durante RLVR, el modelo es recompensado en función de la respuesta final y del formato de la respuesta, mientras que la traza intermedia se ignora.

Aun así, esa configuración es suficiente para que los modelos aprendan comportamientos asociados al razonamiento: escribir explicaciones intermedias, retroceder y corregir errores. Esas autocorrecciones a menudo se describen como momentos “Aha”.

Figura 7: Un ejemplo de un momento aha, donde un modelo de razonamiento detecta un error en su razonamiento intermedio y lo corrige antes de producir la respuesta final.
Figura 7: Un ejemplo de un momento aha, donde un modelo de razonamiento detecta un error en su razonamiento intermedio y lo corrige antes de producir la respuesta final.

Raschka también señala que Kimi K1.5 apareció en arXiv el mismo día que DeepSeek-R1 — 22 de enero de 2025 — y que el término RLVR ya se había acuñado dos meses antes en Tülu 3: Pushing Frontiers in Open Language Model Post-Training. Aun así, el artículo de DeepSeek se convirtió en la referencia destacada en parte porque mostró que el comportamiento de razonamiento podía surgir a partir del RL puro.

En la práctica, sin embargo, las canalizaciones completas de entrenamiento suelen ser más complicadas. Tülu 3 y Kimi K1.5 aplicaron aprendizaje por refuerzo sobre un modelo afinado mediante supervisión (SFT). DeepSeek-R1 en sí se entrenó a partir de un checkpoint SFT del modelo base DeepSeek-V3, junto con una variante R1-Zero entrenada con RLVR puro. R1-Zero era más débil que R1, pero sirvió como prueba de concepto de que RLVR por sí solo puede enseñar a un modelo a generar y usar trazas de razonamiento.

Figura 9: Flujo de entrenamiento de modelos de razonamiento más detallado. Esta muestra los distintos modelos DeepSeek-R1. Para más detalles, véase mi otro artículo: Understanding Reasoning LLMs.
Figura 9: Flujo de entrenamiento de modelos de razonamiento más detallado. Esta muestra los distintos modelos DeepSeek-R1. Para más detalles, véase mi otro artículo: Understanding Reasoning LLMs.

Escalado de inferencia y conmutadores de modo de razonamiento

El entrenamiento es solo la mitad de la historia. La otra palanca es el escalado de cómputo en la inferencia: gastar más cómputo en tiempo de ejecución para mejorar las respuestas. Los modelos de razonamiento ya hacen parte de esto implícitamente porque generan más tokens que los LLM convencionales. Los niveles de esfuerzo lo llevan más lejos controlando la longitud de salida y el presupuesto de cómputo.

Una técnica adicional común es la self-consistency, donde se consulta al modelo varias veces y la respuesta final se elige por voto mayoritario.

Figura 10: Un ejemplo de self-consistency, una técnica popular de escalado de inferencia.
Figura 10: Un ejemplo de self-consistency, una técnica popular de escalado de inferencia.

Raschka señala a DeepSeekMath-V2 como ejemplo de llevar esto al extremo, superponiendo un agresivo escalado de inferencia sobre un modelo de razonamiento especializado en matemáticas para alcanzar un rendimiento de vanguardia en problemas difíciles al estilo de olimpiadas.

También dedica tiempo a un concepto erróneo común: los tokens <think></think> no son lo que hace que un modelo razone.

Figura 12: Tokens de formato comunes en los modelos de razonamiento.
Figura 12: Tokens de formato comunes en los modelos de razonamiento.

Esas etiquetas son principalmente marcadores de formato, usados para separar la traza de razonamiento de la respuesta final para que la canalización de entrenamiento o la interfaz de usuario pueda ocultarla. Pueden reforzarse con una recompensa de formato durante RLVR, como en DeepSeek-R1, donde:

R_total = R_accuracy + R_format

La primera generación de sistemas de razonamiento fueron modelos dedicados como DeepSeek-R1, que tendían a producir respuestas largas y verbosas para casi cualquier prompt.

Figura 13: Los modelos de razonamiento son muy verbosos, incluso con los prompts más sencillos.
Figura 13: Los modelos de razonamiento son muy verbosos, incluso con los prompts más sencillos.

Los sistemas más recientes, como Qwen3, se movieron hacia un comportamiento híbrido, permitiendo que el mismo modelo actúe bien como un modelo afinado por instrucciones estándar o bien como un modelo de razonamiento bajo demanda. En Qwen3, ese interruptor se expone a través del tokenizador como enable_thinking=True o enable_thinking=False. Con enable_thinking=False, el sistema inyecta efectivamente un bloque vacío <think></think> al inicio de la respuesta del asistente para desactivar el modo de razonamiento.

Figura 14: Respuesta del modelo de razonamiento Qwen3 0.6B con thinking=False y thinking=True. (Las etiquetas vacías <think></think> están ocultas en la interfaz a la izquierda ya que forman parte del prompt de entrada modificado, no de la respuesta generada.)
Figura 14: Respuesta del modelo de razonamiento Qwen3 0.6B con thinking=False y thinking=True. (Las etiquetas vacías <think></think> están ocultas en la interfaz a la izquierda ya que forman parte del prompt de entrada modificado, no de la respuesta generada.)

Según el informe técnico de Qwen3, ese conmutador se introduce principalmente mediante SFT y luego se refuerza durante el RL general en sus modelos insignia más grandes. Tras una SFT inicial con largas cadenas de pensamiento y RL de razonamiento, Qwen añade una etapa de Thinking Mode Fusion donde el modelo ve ambos formatos:

  • /think: <think>{reasoning}</think>{answer}
  • /no_think: <think></think>{answer}

Thinking sigue siendo el comportamiento por defecto, por lo que /think se puede omitir. El resultado es un modelo que puede cambiar su esfuerzo de razonamiento en tiempo de inferencia —una capacidad que rápidamente se está convirtiendo en una expectativa por defecto en los lanzamientos de vanguardia.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

// Sigue leyendo