La inversión en tecnologías relacionadas con IA generativa va camino a los 200 mil millones de dólares para 2025, y buena parte de ese dinero se está yendo a resolver una misma pregunta: ¿cómo hacer que un modelo de lenguaje razone de forma confiable en un proceso de negocio real? Dos técnicas concentran esa discusión, y conviene no confundirlas: la cadena de prompts y el chain of thought.

En esta nota explicamos la diferencia entre ambas y repasamos tres claves esenciales para diseñar una cadena de prompts eficiente en producción: la latencia, el tooling y los límites reales de lo que un LLM puede resolver por sí solo.

Puntos clave:

  • El chain of thought se trabaja en el entrenamiento del modelo, enseñándole a razonar paso a paso; la cadena de prompts se arma después, en producción, encadenando llamadas independientes al mismo LLM.
  • Una cadena de prompts de 8 pasos, con 500 milisegundos por llamada, ya suma 4 segundos de latencia antes de sumar el resto del procesamiento: la velocidad es la restricción real, no los tokens.
  • El tooling (llamar a un buscador, un geocodificador o una API del clima) es la tercera pata, menos discutida, que le da a un LLM la capacidad de responder con datos que no tiene en el modelo.
  • Ningún LLM «razona» en sentido estricto: es un modelo estadístico entrenado con secuencias, y su calidad depende de la calidad de los datos con los que se entrenó.

Qué es una cadena de prompts

Una cadena de prompts es un patrón de diseño donde, en lugar de resolver una tarea con una sola instrucción al modelo de lenguaje, se hacen múltiples llamadas encadenadas, cada una con su propio prompt y su propio objetivo. Si un LLM tiene que completar cinco pasos, se arman cinco prompts distintos —cada uno con su plantilla— y se los encadena para producir un resultado final.

Es la lógica detrás de buena parte de lo que hoy se llama «workflows agénticos»: la idea no es que el modelo sea más inteligente en una sola llamada, sino que la orquestación entre varias llamadas permita resolver tareas más complejas, como clasificar informes de seguridad e higiene, legajos de personal o datos de clientes en distintas categorías. Frameworks como LangGraph o Amazon Bedrock ya ofrecen servicios pagos específicamente para diseñar y correr estas cadenas de prompts.

Chain of thought: la otra pieza del razonamiento complejo

El chain of thought, en cambio, tiene que ver con cómo se entrena el modelo, no con cómo se lo usa en producción. Se le enseña al LLM con textos donde la secuencia de razonamiento está explícita: por ejemplo, resolver «2X + 5 = 10» mostrando cada paso —despejar el 5, dividir por 2, llegar a X = 2,5— en lugar de mostrar solo la respuesta final.

Distintos papers (Wei et al., 2022) muestran que entrenar así reduce las alucinaciones y mejora la calidad de las respuestas: por eso buena parte de las respuestas de ChatGPT vienen ordenadas paso a paso, como si las estuviera pensando en voz alta. Esa misma lógica se traslada después al diseño de una cadena de prompts, con plantillas conocidas como RISEN, RTF, COT o RODES para estructurar mejor cada instrucción.

Clave 1: la latencia es el problema real de la cadena de prompts

Diseñar una cadena de prompts no es solo un problema de calidad de respuesta: es, sobre todo, un problema de costo y de tiempo. Cada llamada al LLM implica latencia, y esa latencia se acumula. Si una cadena tiene 8 pasos y cada llamada tarda 500 milisegundos, ya son 4 segundos solo en tiempo de respuesta del modelo, antes de sumar lo que hay entre paso y paso. Para una aplicación empresarial que necesita responder en tiempo real, eso puede no ser aceptable.

Por eso cuanto más larga es la cadena de prompts, más cara resulta: no solo por la cantidad de tokens que devuelve el modelo, sino por la cantidad de llamadas necesarias para completar el flujo. Esta es la razón por la que buena parte del desarrollo actual en Gen AI empresarial se concentra en diseñar cadenas de prompts más cortas y más eficientes, en lugar de depender de un único modelo «todopoderoso».

Clave 2: el tooling, la pieza que rara vez se discute

Hay un tercer elemento, menos mencionado que el chain of thought o la cadena de prompts, pero igual de importante: el tooling, es decir, la capacidad del modelo de llamar a herramientas externas. Cuando alguien le pregunta a ChatGPT cuánto tarda en llegar del aeropuerto al hotel, el modelo no «sabe» la respuesta: llama a una herramienta de geolocalización, de forma parecida a como lo haría un usuario que abre Google Maps.

Lo mismo pasa con el clima, una cotización o cualquier dato que cambie en tiempo real: el LLM entiende que necesita ese tipo de búsqueda y decide qué herramienta invocar. Esta combinación —chain of thought en el entrenamiento, cadena de prompts en la orquestación y tooling para conectar con datos externos— es la que explica por qué estos sistemas dan la sensación de ser una «IA general», aunque en rigor no lo sean.

Clave 3: entender los límites antes de diseñar tu propia cadena de prompts

Antes de avanzar con un proyecto de cadena de prompts a medida, conviene que la empresa entienda las limitaciones reales del modelo: qué tareas puede resolver de forma confiable con la tecnología actual y cuáles todavía no. Esto es tan importante como la elección técnica del framework, porque define las expectativas de negocio del proyecto.

Ningún LLM razona por sí solo: entrena con secuencias y responde con probabilidades. Lo que hoy parece inteligencia general es, en realidad, la combinación bien orquestada de entrenamiento con chain of thought, una cadena de prompts en producción y tooling para acceder a datos externos.
— Equipo de Consultoría en IA, 7Puentes

Cómo diseñar tu cadena de prompts con 7Puentes

En 7Puentes tenemos más de 15 años de experiencia, más de 50 clientes y más de 100 proyectos de inteligencia artificial generativa implementados. Ayudamos a equipos de datos y de negocio a diseñar su cadena de prompts, elegir el framework adecuado y balancear latencia, costo y calidad según la necesidad puntual de cada organización, ya sea a través de nuestro servicio de consultoría en IA, de un squad ágil de datos dedicado o de un proyecto puntual de desarrollo de MVP con IA. Si querés profundizar antes de arrancar, también podés revisar nuestros whitepapers sobre IA y Machine Learning.

Si tu equipo ya viene explorando estos conceptos aplicados a un caso concreto, te puede servir también nuestra nota sobre videovigilancia industrial con IA generativa, donde la ingeniería de prompts cumple un rol parecido para reducir falsos positivos en modelos de visión.

Preguntas frecuentes

¿En qué se diferencia una cadena de prompts de un chain of thought?

El chain of thought se trabaja durante el entrenamiento del modelo, enseñándole a razonar paso a paso con ejemplos explícitos. La cadena de prompts se arma después, en producción, encadenando varias llamadas independientes al mismo LLM para resolver una tarea compleja.

¿Por qué una cadena de prompts larga puede ser un problema?

Porque cada llamada al modelo suma latencia. Ocho pasos de 500 milisegundos cada uno ya son 4 segundos de espera, algo que puede volver inviable una aplicación en tiempo real.

¿Qué es el tooling en el contexto de los LLM?

Es la capacidad del modelo de llamar a herramientas externas —un buscador, un geocodificador, una API de clima— cuando necesita un dato que no tiene incorporado, en lugar de intentar responder solo con lo que aprendió durante el entrenamiento.

¿Querés diseñar o auditar la cadena de prompts de tu producto de IA generativa? Contanos tu caso.
Contact