/5 min de lectura

Por qué llenar el prompt de reglas empeora el vídeo

Inflamos un prompt de vídeo de doscientos a tres mil caracteres creyendo que estábamos siendo cuidadosos. El resultado empeoró — y el motivo dice mucho sobre cómo funcionan estos modelos.

Esta es la lección de campo más cara que aprendimos construyendo EverFeed, y la que más contradice la intuición de quien viene de escribir prompts para modelos de texto.

Teníamos un prompt de vídeo corto, de unos doscientos caracteres, que funcionaba bien. Hicimos lo que haría cualquier persona cuidadosa: empezamos a añadir. Reglas de marca. Instrucciones de encuadre. Prohibiciones. Avisos. En pocas semanas el prompt tenía tres mil caracteres, y era mucho más completo.

Y los vídeos quedaron peores. No un poco peores — visiblemente peores, de una forma que se veía poniéndolos uno al lado del otro.

Qué pasó

Dos cosas distintas, que vale la pena separar porque las soluciones son distintas.

Dilución

Un modelo de difusión de vídeo no lee el prompt como una lista de requisitos a verificar. Condiciona la generación en el significado agregado del texto entero. Cada palabra que añades divide la atención con las que ya estaban.

En un prompt de doscientos caracteres, “pan saliendo del horno, vapor, luz de mañana” es prácticamente todo lo que el modelo tiene — y dedica la generación entera a eso. En los tres mil caracteres, esa misma frase es el 7% del texto. El otro 93% — instrucciones de marca, reglas de formato, avisos — también condiciona la escena, y la mayoría describe cosas que no son visuales.

El resultado es un vídeo que atiende vagamente a todo y no hace nada bien. La escena pierde foco porque el prompt perdió foco.

La prohibición se convierte en presencia

Este es el efecto más contraintuitivo, y el más fácil de reproducir.

Escribimos cosas como “sin texto en la imagen”, “no mostrar logotipos”, “evitar manos”. Son instrucciones perfectamente comprensibles para un modelo de lenguaje, que entiende la negación. Para un modelo de difusión, el campo positivo del prompt es una descripción de lo que debe estar en la escena, y condiciona en los conceptos que aparecen ahí.

“Sin texto en la imagen” pone el concepto texto en la descripción. “No mostrar logotipos” pone logotipo. Y no es raro recibir de vuelta exactamente lo que prohibiste — a veces más prominente que si no hubieras dicho nada.

Es el viejo “no pienses en un elefante”, solo que el modelo no puede no pensarlo: el elefante está en el texto que condiciona la imagen.

Dónde va la prohibición de verdad

Los modelos de imagen y vídeo tienen, casi todos, un campo separado para esto: el negative prompt. Es un canal propio, tratado de forma distinta en la generación — lo que está ahí se aleja, no se describe.

La corrección fue mecánica:

  • Todo lo que era descripción de la escena se quedó en el prompt positivo.
  • Todo lo que era prohibición visual salió de ahí y fue a negative_prompt: texto, marca de agua, logotipo, manos deformadas, distorsión, marco.
  • Todo lo que no era visual — regla de marca, instrucción de formato, aviso de cumplimiento — salió del prompt de vídeo entero. No es trabajo del modelo de vídeo. Es trabajo de la etapa de copy, o de la plantilla que escribe encima.

El prompt de vídeo volvió a cerca de doscientos caracteres. Los vídeos volvieron a estar bien.

Por qué esto no vale para texto

Vale la pena entender la asimetría, si no la lección se convierte en superstición.

Para un modelo de lenguaje, el contexto largo generalmente ayuda. Entiende la negación, obedece reglas explícitas y trabaja mejor con ejemplos. Un prompt de copy con el kit de marca entero — persona, términos prohibidos, oferta con precio, ejemplos buenos y malos — produce mejor texto que un prompt corto. Por eso el kit de marca de EverFeed tiene tantos campos: van todos a las etapas de texto.

Para un modelo de difusión, el contexto largo diluye, y la negación en el campo positivo funciona al revés. Son dos tipos de modelo con dos ergonomías opuestas, y tratarlos igual era el error que estábamos cometiendo.

La regla práctica

Texto: cuanto más contexto relevante, mejor. La prohibición funciona escrita.
Imagen y vídeo: cuanto más enfocada la descripción, mejor. La prohibición va en el campo negativo, nunca en el positivo.

Qué cambió esto en el producto

Tres decisiones salieron directamente de esa lección.

Prompts por capacidad, no un prompt único. La biblioteca de prompts de EverFeed está organizada por capacidad — texto, imagen, vídeo — y por objetivo. El prompt de copy y el prompt de vídeo no comparten estructura, porque no deberían.

El campo params es JSON crudo. Es donde vive el negative_prompt, junto con aspect_ratio, duration_seconds y lo que acepte el proveedor. No intentamos crear un campo bonito en la pantalla para cada parámetro de cada proveedor: quien sabe qué necesita pasar es quien eligió el proveedor. Eso vale para los cinco drivers.

El prompt enviado queda guardado. Cada etapa guarda el texto exacto que salió, junto con el proveedor, el modelo, el número de intentos y la duración. Sin eso, toda esta investigación habría sido imposible: no puedes descubrir que el prompt inflado empeoró el vídeo si no puedes ver los dos prompts uno al lado del otro. Y como las tomas anteriores también se guardan — hasta diez —, la comparación no cuesta una nueva generación.

Cómo escribir un prompt de vídeo que funcione

El formato que quedó después de todo esto:

  1. Un sujeto. Lo que está en la escena. Concreto.
  2. Una acción. Lo que pasa en los ocho segundos. Una sola.
  3. Una condición de luz o ambiente. Mañana, contraluz, cocina industrial.
  4. Un movimiento de cámara, si hace falta. Si no hace falta, no lo escribas.
  5. El resto en los parámetros. Duración, proporción, prohibiciones.

Cabe en dos líneas. Si pasa de tres, probablemente hay ahí dentro algo que pertenece a otra etapa.

La señal de alerta

Si estás escribiendo una regla de marca dentro de un prompt de vídeo, para. La marca no entra en la pieza por el prompt de difusión — entra por la plantilla que escribe encima, por los colores inyectados al renderizar y por el copy que la etapa de texto produce con el kit entero en la mano.

El modelo de vídeo tiene una función: hacer ocho segundos bonitos de lo que describiste. Toda instrucción que no sirve a esa función le está quitando calidad a alguna que sí sirve.

Escribe tu marca una vez.

En EverFeed el prompt enviado queda guardado en la etapa, con el proveedor, el modelo y la duración. Se pueden comparar dos tomas y descubrir qué cambió realmente.

Ver los prompts editables