Del video a una cita
que puedes comprobar tú misma.
Recuperación sobre video, hecha para investigación de mercados y no para reuniones. Esta página es el pipeline etapa por etapa, con lo que acierta y dónde falla.
Ocho etapas entre el archivo y la respuesta.
Todo lo de esta página está construido y probado. Nada de esto es un plan.
- 1
Transcripción con voces separadas
Cada voz queda separada de las demás, con una marca de tiempo en cada palabra.
- 2
Un rol y un nombre para cada voz
A la moderadora se la identifica porque es quien hace las preguntas. Los participantes reciben su nombre cuando la sesión lo muestra, como hace una videollamada con sus rótulos.
- 3
Estímulos reproducidos, marcados como tales
Cuando dentro de la sesión suena un comercial o un audio, se marca como estímulo reproducido en vez de atribuírselo a un participante. Sin esto, una pregunta de opinión se contestaría con la voz del anuncio.
- 4
Repeticiones colapsadas
Cuando el mismo comercial se reproduce varias veces, las copias se colapsan para que no tapen las reacciones a él.
- 5
La imagen, cada quince segundos
Se leen tres cuadros por tramo para la escena, las personas, las marcas y el texto en pantalla, literal. Es lo que contesta una pregunta cuya evidencia es solo visual: una placa, un empaque, un precio en una lámina.
- 6
Búsqueda híbrida
Significado y palabras exactas a la vez, con el español encontrado con acentos o sin ellos, reordenado por un modelo de relevancia y cortado en un piso de relevancia.
- 7
Un reparto justo entre sesiones
Con cincuenta videos cargados, cada sesión relevante aporta material. Las que no trataron el tema se declaran como tales, porque eso también es un hallazgo.
- 8
Citas que no se pueden inventar
Cada fragmento llega al modelo como documento con citas activadas, así que una cita solo puede apuntar a un fragmento que existe. Si la respuesta se corta a mitad, se rechaza por incompleta en vez de mostrártela.
99,3% de citas textuales, sobre 37 preguntas en 11 videos.
El examen corrió el 25 de septiembre de 2026 sobre tres colecciones de sesiones reales. Cada una de las 275 citas se comparó contra una segunda transcripción independiente hecha por otro motor, y 273 coincidieron.
La comparación automática dio 94,9%. Los 14 casos que marcó se leyeron a mano: 12 eran diferencias entre las dos transcripciones, es decir que la frase sí se dijo. Los otros 2 son el 0,7%.
Las fallas que encontró el mismo examen.
En un video que mezclaba español y portugués, la transcripción tradujo al español un tramo dicho en portugués. Una cita de ahí es fiel en significado y no literal.
El video muy editado y las preguntas puramente visuales son el punto débil. La colección visual fue la peor de las tres.
El análisis de imagen puede fallar en tramos sueltos. El diálogo sobrevive, y se devuelve la mitad del tiempo de esos tramos.
El tiempo de proceso no se promete. La única medición de punta a punta hasta hoy es un clip sintético de 46 segundos, que no dice nada útil sobre una sesión de dos horas.
Tus sesiones son tuyas, y lo dice la plomería.
- Cada cuenta ve solo sus propios proyectos, y eso se impone en la base de datos, no en la interfaz.
- Los videos viven en un depósito privado y se reproducen con enlaces firmados que caducan rápido.
- La transcripción se borra del servicio de transcripción en cuanto termina de procesarse.
- El análisis de imagen marca contenido sensible tramo por tramo. Pasado un umbral el video se bloquea, no se indexa, y sus horas no se devuelven.
Pregúntale a tus grupos focales. Cada respuesta cita el minuto exacto.
Trae cinco horas de sesiones o cuarenta. Encontrar el momento y citarlo es trabajo mecánico; qué significa para la marca lo sigues decidiendo tú.
¿Quieres probarlo con tus propias sesiones?
Está en beta con investigadoras invitadas. Cuéntanos en qué estás trabajando.
Pregunta por la beta