Saltar al contenido

Caso de uso

Un vídeo que la IA sí puede leer entero

Un modelo que ve vídeo muestrea un fotograma por segundo, a ciegas. Una hora se vuelve 3.600 imágenes, más de un millón de tokens, y la mayoría es la misma pantalla quieta. El documento resuelve eso antes de llegar al modelo.

Página del documento generado, con la marca arriba, la identificación y cada pantalla junto a lo que se dijo12
Cómo sale la página. Lo que aparece cambia con el escenario: la evidencia lleva hora de reloj y huella digital; la instrucción de trabajo no lleva ninguna de las dos.

Tres cosas antes de mandarlo a la IA

Un vídeo largo se vuelve varios temas. Marca dónde empieza cada tema y sal con un documento por tema — cada uno cabe en una conversación, en vez de reventar la ventana de contexto de una vez.

El vocabulario de tu dominio, antes de mandarlo. Nombres de sistema, siglas y productos que la transcripción falla se corrigen de una vez, y la IA pasa a leer el texto correcto.

Tapar antes de pegar. Lo que no puede salir de la empresa se cubre en la imagen, no se esconde: el tapado se quema, y lo que mandas no tiene el dato debajo.

Preparar un vídeo para la IA gratis, y el vídeo no sale de tu ordenador

El dolor

Tienes una grabación — una demo, una clase, una sesión de soporte, un incidente — y quieres preguntarle cosas a un modelo. Mandar el archivo choca con tres paredes: el límite de tamaño, el coste de procesar fotogramas repetidos, y el hecho de que la mayoría de los modelos simplemente no acepta vídeo.

Y aun donde lo acepta, el modelo pierde lo que se dijo junto a lo que se mostró: el habla llega como un bloque de texto suelto, sin saber a qué pantalla pertenece.

Qué sale

Un PDF (o Markdown, HTML, JSON) que cualquier modelo lee, con la información ya organizada:

  • ~60 pantallas en vez de 3.600, porque el resto eran repeticiones de la misma imagen
  • Cada imagen emparejada con el habla de ese tramo, y no con la transcripción entera tirada al final
  • El instante exacto de cada fotograma, para que el modelo pueda citar "en el 04:12" con precisión
  • Cabe en cualquier modelo, incluidos los que rechazan vídeo — es un documento, no un archivo de medios
  • Prompt listo, escrito para que el modelo entienda qué está leyendo antes de responder
  • JSON estructurado cuando el destino no es un chat sino tu propio código o tu agente

Cómo hacerlo

  1. Deja el escenario en Contexto para IA — es el predeterminado.
  2. Arrastra el vídeo, o graba la pantalla en el momento.
  3. Deja que transcriba y extraiga los fotogramas. Descarta en la revisión lo que no interesa: cada pantalla de menos es un token de menos.
  4. Genera el PDF, copia el prompt y llévate los dos a la IA que uses.

Lo que no hace — mejor saberlo antes

No manda nada a ningún modelo. Monta el material y te lo entrega. Quien elige el modelo, la cuenta y la política de uso eres tú — incluido un modelo que corra dentro de tu propia empresa.

No sustituye ver el vídeo cuando el movimiento es el dato. Si lo que importa es una animación, una transición o el gesto de alguien, los fotogramas por cambio de escena lo pierden. Para pantalla de sistema, que es el caso común, capturan todo lo que interesa.

No resume por su cuenta. El resumen es trabajo del modelo; el nuestro es hacer que el modelo lea lo correcto.

Preparar un vídeo para la IA Ver los planes

Es el más genérico de los cinco, y el predeterminado de la herramienta — cuando no sabes qué documento quieres, este es el que sirve.