# Video Lab: análisis de video etnográfico e IHUT con IA

Video Lab es una plataforma de [Cassi.ai](https://www.cassiai.com) que analiza videos etnográficos y tests de producto en el hogar, como tests de uso en el hogar (IHUT), diarios de consumo y unboxings, con visión computacional y modelos de lenguaje multimodales. Descompone el video escena por escena, transcribe el habla con marcas de tiempo, identifica objetos, envases y gestos, y cruza lo que la persona dice con lo que la persona hace. El resultado es un conjunto de KPIs de comportamiento en los que toda conclusión lleva la marca de tiempo y el fotograma como evidencia.

## Cincuenta participantes graban tres momentos de uso. Alguien tiene que verlo todo.

El video es lo más cerca que el investigador llega del momento real de uso. También es el material que más tarda en convertirse en número.

- Tema: Video etnográfico y test de producto en el hogar. Tests de uso en el hogar (IHUT), diarios de consumo, unboxings. El participante graba el momento real de uso, y la grabación muestra lo que ningún cuestionario captura: la mano, el envase, la dosis, la duda.
- Cómo se hace hoy: Ver a 1,5x y llenar una planilla. Un estudio con 50 participantes que graban 3 momentos de uso genera más de 25 horas de video en bruto. El equipo lo ve acelerado y registra cada comportamiento a mano. Entre el cierre del campo y el informe ejecutivo suelen pasar más de 20 días hábiles.
- El dolor: Nadie tiene tiempo de medir lo dicho frente a lo hecho. Como el registro humano es pesado, la muestra se queda pequeña, de 10 a 15 personas. Y la lectura más valiosa del estudio, la distancia entre el comportamiento declarado en el cuestionario y el comportamiento grabado en video, queda en la impresión de quien lo vio.
- Dónde entra Cassi.ai: Cada video leído escena por escena, con evidencia. Video Lab descompone cada grabación escena por escena, transcribe el habla con marcas de tiempo, identifica objetos, envases y gestos, y cruza habla con acción. El resultado son KPIs de comportamiento en los que toda conclusión apunta a la marca de tiempo y al fotograma.

## Lo que responden las grabaciones cuando todas fueron vistas.

- Dicho frente a hecho ("¿Usan el producto como dicen que lo usan?"): El autorreporte y la evidencia física quedan en la misma tabla, comportamiento por comportamiento, con el tamaño del desvío. La distancia entre cuestionario y video se vuelve un número medido.
- Marca de tiempo y fotograma ("¿En qué punto del video pasa eso?"): Toda conclusión lleva al segundo de la grabación y al fotograma que la sostiene. Cualquier persona en la reunión puede abrir la evidencia y comprobarla.
- Objetos, envases, gestos ("¿Qué tomó de verdad el participante?"): La visión computacional describe cada segmento: el envase en la mesada, la tapa dosificadora, la mano que da vuelta la ropa. La identificación de marca y de producto pasa por revisión humana antes de darse por cierta.
- Desconocido, no visible ("¿Y si la cámara no lo mostró?"): El campo que el video no sostiene se marca como desconocido, no visible o no aplicable. La plataforma deja el vacío en la base y envía el ítem incierto a una persona.
- Dashboard y base ("¿Puedo cortarlo por perfil?"): La base consolidada alimenta un dashboard con varios proyectos y filtros por perfil, y sale tabulada en CSV, Excel y SPSS para los cruces que tu equipo corre por su cuenta.
- Biblioteca de clips ("¿Puedo mostrarle el fragmento a la dirección?"): Los momentos principales se convierten en una biblioteca de clips anonimizados, con los rostros protegidos por mosaico, listos para la presentación ejecutiva.

## Seis pasos del archivo en bruto al informe, con una persona revisando lo incierto.

1. Inventario de los videos. Cada archivo se lista y recibe una huella digital, una firma única calculada a partir de su contenido, junto con el audio y los metadatos técnicos. Ningún video se procesa dos veces ni queda afuera.
2. Fotogramas clave y hoja de contactos. La plataforma extrae los fotogramas clave de cada grabación y arma una hoja de contactos, el video entero de un vistazo. Cada fotograma conserva su marca de tiempo.
3. Transcribir y observar. El habla se transcribe con marcas de tiempo. Cada segmento recibe una observación visual: objetos, envases, gestos y el orden en que ocurren las cosas. Habla y acción en la misma línea de tiempo.
4. Extraer los KPIs. Cada video se convierte en la misma estructura fija de KPIs de comportamiento, para que los participantes puedan compararse y tabularse. Lo que no aparece se marca como no visible.
5. Validar y revisar. Estructura y confianza se comprueban en cada salida. Los ítems inciertos van a una cola de revisión humana antes de entrar en la base. Regla: el 95% de las salidas de KPI debe pasar la validación de estructura.
6. Consolidar y entregar. Las salidas revisadas forman una base consolidada, de la que salen los insights, las citas, los fotogramas y el informe. Ninguna conclusión sin marca de tiempo y fotograma.

## Dos números del flujo manual, una meta y una regla.

- 25+ h: de video en bruto en un estudio típico con 50 participantes que graban 3 momentos de uso
- 20+ días: hábiles entre el cierre del campo y el informe ejecutivo en el flujo manual
- < 2 h: es la meta de procesamiento de ese mismo lote en Video Lab
- 95%: de las salidas de KPI debe pasar la validación de estructura, la regla técnica de aceptación del producto

## Lo que nunca hace

- Nunca inventa lo que no está visible. El campo se marca como desconocido, no visible o no aplicable.
- Nunca da por perfecta una identificación de marca o de producto sin revisión humana.
- Nunca infiere datos sensibles que no estén visibles en el video.
- Nunca muestra una conclusión sin marca de tiempo y fotograma.
- Nunca publica un clip sin protección de rostro.

## Para quién es

Direcciones de insights, Gerentes y analistas de investigación, Institutos de investigación, Agencias con estudios cualitativos en video. Para equipos que ya recogen video y quieren la muestra entera leída con el mismo criterio, con la evidencia a un clic.

## Preguntas y respuestas

### ¿Qué es Video Lab?

Video Lab es una plataforma de Cassi.ai que analiza videos etnográficos y tests de producto en el hogar con visión computacional y modelos de lenguaje multimodales. Descompone el video escena por escena, transcribe el habla con marcas de tiempo, identifica objetos, envases y gestos, y cruza lo que la persona dice con lo que la persona hace.

### ¿Qué tipo de video analiza?

Grabaciones hechas por los participantes en casa o en contexto: tests de uso en el hogar (IHUT), diarios de consumo, unboxings y videos etnográficos en general. El caso típico es el estudio en el que cada participante graba varios momentos de uso de un producto.

### ¿Cómo compara lo que la persona dice con lo que hace?

La transcripción y la observación visual comparten la misma línea de tiempo. Para cada comportamiento, la plataforma registra lo declarado, en el habla o en el cuestionario, y lo que el video muestra físicamente, e informa el desvío entre los dos con la marca de tiempo y el fotograma de la evidencia.

### ¿Qué pasa cuando algo no se ve en el video?

El campo se marca como desconocido, no visible o no aplicable. Video Lab nunca llena un vacío con una suposición. Los ítems con baja confianza van a una cola de revisión humana antes de entrar en la base consolidada.

### ¿Identifica marcas y productos por su cuenta?

Detecta envases y objetos en la escena y sugiere qué son. Una identificación de marca o de producto nunca se da por perfecta sin revisión humana, así que esos ítems pasan por una persona antes de llegar al informe.

### ¿Cuánto tarda el procesamiento?

Un estudio típico con 50 participantes que graban 3 momentos de uso genera más de 25 horas de video en bruto, y el flujo manual suele tardar más de 20 días hábiles hasta el informe ejecutivo. La meta de procesamiento de ese mismo lote en Video Lab es de menos de 2 horas, seguida de la revisión humana de los ítems inciertos.

### ¿Cómo se cuida la privacidad de los participantes?

Los clips que salen de la plataforma llevan los rostros protegidos por mosaico, y ningún clip se publica sin esa protección. Video Lab tampoco infiere datos sensibles que no estén visibles en el video.

### ¿Qué recibo al final?

Una presentación ejecutiva interactiva en la web con fotogramas de los videos, un dashboard con varios proyectos y filtros por perfil, una base tabulada exportable a CSV, Excel y SPSS, un informe estratégico y una biblioteca de clips anonimizados.

## Trae un estudio en video que conozcas bien.

Cuéntanos de un estudio en curso, o de uno que tu equipo ya leyó a mano. Mostramos cómo Video Lab trata ese tipo de lote y recorremos una presentación de resultados, con la marca de tiempo y el fotograma detrás de cada conclusión. https://videolab.cassiai.com/es/#acesso
