En la entrada anterior hablamos de agentes y temperatura como forma de controlar las alucinaciones y creatividad del modelo. No obstante, respecto a la temperatura, esta dejó de estar disponible en la API de OpenAI para los modelos GPT-5. En cambio, la compañía insta a utilizar reasoning depth, output verbosity y output length. A continuación, explicaremos cada una de ellas y cómo sacarles el máximo provecho, dependiendo del contexto.
Reasoning depth
Los modelos GPT-5 ofrecen cuatro niveles de razonamiento. Por una parte, «minimal», que es la capa más baja, entrega respuestas con un razonamiento relativamente limitado, lo que impacta positivamente en el tiempo de respuesta y costo. En otras palabras, el modelo emplea menos tiempo para pensar y esto genera menos reasoning tokens (que se cuentan como tokens de salida), lo que abarata costos. Según Arsturn, esta configuración podría ser útil para responder preguntas básicas en torno a un texto predefinido, autocompletación de oraciones simples, clasificación de texto y para chatbots de alta frecuencia.
Un nivel más arriba, tenemos «low», cuyo tiempo de razonamiento y subsecuente costo son más altos que el nivel anterior. Esto entrega respuestas relativamente más elaboradas y creativas, sin incrementar significativamente el tiempo de respuesta. Arsturn recomienda este nivel para customer support típico, resumir contenido, extracción de datos y generar contenido en las redes sociales.
Finalmente, tenemos «medium» y «high». En ambas categorías, el tiempo de razonamiento aumenta considerablemente, lo que también aumenta el costo de tokens de salida (explicado por reasoning tokens). Estas categorías pueden ser usadas para análisis detallados, programación, creación de contenido, investigación científica y planificación estratégica.
A modo de ejemplo, si su empresa recibe preguntas concretas de sus clientes que requieren respuestas cortas y rápidas cuya solución es relativamente trivial, los niveles «low» y «minimal» son idóneos. En cambio, si está meditando la viabilidad de un plan de marketing o inversión, «medium» y «high» serían los niveles correctos.
Output verbosity
Esta característica consta de tres niveles, «low», «medium» y «high». En base a la documentación de OpenAI, verbosity determina cuántos tokens de salida pueden ser generados, incluso manteniendo el nivel de razonamiento constante. En palabras simples, el usuario puede fijar un nivel de razonamiento muy alto, pero si verbosity es bajo, la respuesta será breve, pero eventualmente de muy alta calidad. Naturalmente, en el contexto empresarial, si la pregunta es muy compleja, como una decisión estratégica, y el razonamiento necesita ser explicado de forma detallada, verbosity «high» es la configuración idónea. Por el contrario, si deseamos implementar un ChatBot de alta frecuencia que entregue respuestas simples y cortas, verbosity «low» es la opción.
Output length
Esta configuración es un límite más estricto para la cantidad de tokens de salida. Su función es ser una cota superior para los tokens de respuesta y de razonamiento. En términos concretos, si fijamos como la cantidad máxima de tokens 200 y el modelo usa 120 para razonar, sólo quedarán 80 para generar el texto de la respuesta. Esta función es útil para estandarizar respuestas o reducir su costo de forma implícita.
Pero ¿cuál es la configuración correcta?
Esto dependerá del contexto en el que se implementará la solución. No obstante, sin lugar a dudas, una solución costo-efectiva, con tiempos de respuesta y calidad razonables, estará condicionada a la adecuada configuración de estos tres parámetros.
José Miguel Muñoz Urra – jmunozu@pulki.es