Epovest
← Todos los estudios

Estudio

YouTube en las respuestas de las IA: por qué Gemini y Perplexity citan los videos, y qué leen realmente en ellos

Por Simon Vasconcelos Lee

Entre el 10 y el 24 de julio de 2026 archivamos 883 respuestas de ChatGPT, Claude, Gemini y Perplexity, formuladas palabra por palabra, con cadencia semanal, sobre 69 preguntas de tres mercados que no tienen nada en común. En ese corpus, youtube.com es la fuente más citada en Gemini y la fuente más citada en Perplexity, contando todos los dominios. En los otros dos motores no aparece ni una sola vez en 1.655 citas registradas. Este estudio desmonta esa asimetría: qué motores citan videos, qué parte de un video leen realmente, y qué conviene hacer con ello.

Qué se midió

El punto de partida fue un mapa, no una intuición. En el Atlas, el registro de fuentes que nuestras mediciones hacen aparecer, youtube.com marca una AI Authority de 100 en Gemini y de 100 en Perplexity: en una escala de 0 a 100 calculada sobre el conjunto de las mediciones que Epovest ejecuta en los últimos 30 días, es la fuente que esos dos motores más citan. Las otras dos columnas están vacías. Un mapa tan sorprendente merece confrontarse con el terreno, así que abrimos el archivo completo que hay detrás.

El corpus es el historial completo de respuestas de nuestros propios seguimientos: 16 seguimientos semanales, 69 preguntas distintas, formuladas palabra por palabra a través de las interfaces oficiales de los motores, en tres frentes sin relación: destinos de viaje en inglés, visibilidad IA en inglés y en francés, servicios web en francés. Cada respuesta queda archivada con sus fuentes citadas, en orden, fechadas. Dos semanas de mediciones dan 883 respuestas y 6.754 citas registradas.

Motor Respuestas Respuestas con fuentes Citas registradas Citas de YouTube Respuestas que citan YouTube
ChatGPT 223 159 1.213 0 0
Claude 223 87 442 0 0
Gemini 223 211 2.546 35 35, el 16,6 % de las respuestas con fuentes
Perplexity 214 214 2.553 205 127, el 59,3 % de las respuestas con fuentes

La asimetría es el hallazgo. Que un video pueda llevar un nombre hasta una respuesta de IA no es una propiedad de YouTube: es una propiedad del pipeline de cada motor.

Un dominio, cuatro tratamientos

Perplexity lo cita constantemente. Más de la mitad de sus respuestas con fuentes citan al menos un video: 127 respuestas de 214, con 205 citas de videos en total, el 8 % de todo lo que el motor citó en las dos semanas. Diez veces, un video abrió la lista de fuentes. La posición media, 8,3 en listas de unas doce fuentes, dice el resto: los videos rara vez son la fuente estelar, son una presencia permanente en el segundo plano.

Gemini lo cita en cabeza de una cola muy larga. 35 citas colocan a youtube.com primero entre los cientos de dominios citados por Gemini, justo por delante de reddit.com con 33. Es solo el 1,4 % de sus citas, repartido en el 16,6 % de sus respuestas con fuentes, pero ningún otro dominio lo hizo mejor, y dos veces un video fue la primera fuente de la respuesta. La presencia cubre los tres frentes: 22 citas en las preguntas de viajes, 11 en visibilidad IA, 2 en servicios web.

Claude lo lee y escribe sin él. Cero citas en 442. Pero el archivo muestra al motor recuperando una página de video de YouTube cinco veces en la quincena, dos videos distintos, cada uno con la pregunta casi palabra por palabra en su título. Las páginas fueron leídas; las respuestas se escribieron sin ellas.

ChatGPT no lo toca. Cero citas en 1.213, y ni una página de YouTube entre las fuentes que retuvo.

Promediada sobre los cuatro motores, la parte de YouTube pesaría el 3,6 % de las citas: una cifra que no describe a ningún motor. En este corpus, un motor se apoya en videos en la mayoría de sus respuestas con fuentes, otro clasifica el dominio primero citándolo con moderación, y dos no lo acreditan nunca. Motor por motor es la única lectura honesta.

La parte que se lee es la pista hablada

Por cada fuente que retiene, el payload de Perplexity lleva el pasaje que el motor realmente guardó. Eso es lo que zanja la pregunta de qué parte de un video sirve a la respuesta.

Las 205 citas de videos apuntan todas a videos individuales: nunca la página de inicio, nunca un canal, nunca una página de resultados. 121 videos distintos, 203 entradas fechadas. Y los pasajes retenidos no son descripciones: 129 de los 205 llevan marcadores de segundos explícitos que apuntan al interior de la línea de tiempo del video, y casi todo el resto se lee como habla transcrita tal como se oyó, vacilaciones incluidas. Un pasaje retenido recomienda, con la ortografía propia de la transcripción, un "well ststructured website". Otro, en francés, aconseja crear contenido "optimisé pour lia", la grafía automática de "l'IA". No son accidentes de edición: son pruebas de origen. El motor lee la transcripción, generada automáticamente cuando no existe nada mejor, y la lee en profundidad: hay pasajes retenidos que apuntan hasta el minuto dieciséis de un video.

Ese índice está fresco. La mitad de las 205 entradas lleva una fecha de relectura en julio de 2026, el 71 % desde junio. El grupo de videos citados es joven sin ser solo nuevo: el 78 % se publicó desde comienzos de 2025, pero todavía emergen videos de 2020. Y las posiciones se mantienen: 33 de los 118 videos identificables vuelven en al menos dos mediciones semanales distintas, un cuarto del grupo recitado semana tras semana.

El payload de Gemini expone el dominio en lugar de la página, pero dos cosas se leen a través de él. Las consultas de búsqueda que lanza son reformulaciones directas de la pregunta. Y su atribución vincula bloques enteros de la respuesta final a fuentes de YouTube: listas de recomendaciones, criterios de elección, consejos prácticos, sostenidos por lo que un video dijo. La infraestructura del lado de Google está documentada: Gemini ancla sus respuestas mediante Google Search, y la indexación de video de Google lee lo que un video contiene y detecta sus momentos clave, con la indexación de subtítulos confirmada por la empresa desde hace años.

Por qué esos dos motores, y no los otros

La línea divisoria es el acceso a la pista hablada. El habla de un video no vive en el HTML de su página: la carga el reproductor, a través de puntos de acceso que el robots.txt de youtube.com no abre a los rastreadores genéricos. Un motor que lee la página web encuentra un título, una descripción y poco texto que citar.

Los dos motores que citan YouTube son los dos que tienen una puerta de entrada. Gemini pertenece a la empresa propietaria de YouTube: su anclaje corre sobre un índice que trata los videos como contenido de primer rango, transcripciones y momentos clave incluidos. Perplexity construyó su propia ingesta de video: los pasajes con marcas de tiempo de nuestros payloads son ese índice hablando. Los dos motores que no citan YouTube lo encuentran como una página web: nuestro archivo muestra a Claude recuperando una página de video y escribiendo sin ella, y a ChatGPT sin retener ninguna.

Nada de esto es doctrina por parte de ningún motor. Es el estado de cuatro pipelines de recuperación, medido entre el 10 y el 24 de julio de 2026. Los pipelines se mueven sin aviso, una razón más para medir en lugar de suponer.

El título abre la puerta, la transcripción lleva la conversación

¿Cómo entra un video en un conjunto de fuentes? En este corpus: por su título. Los videos que nuestras preguntas hicieron emerger llevan la pregunta, casi palabra por palabra, como título. Pregunte "What are the best places to visit in Africa right now?" y los conjuntos de fuentes devuelven "Top 10 Places To Visit in Africa" y "I Visited Every Country in Africa. Here's My Rankings". Pregunte "How can my business get recommended by AI assistants?" y devuelven "How to Get Your Business Recommended by EVERY AI Assistant". Hasta los dos videos que Claude fue a leer reformulaban la pregunta en su título. El título es lo que hace que un video sea recuperado, en todos los motores que recuperan; lo que pasa después se decide en la transcripción.

La lengua sigue al mercado. Las preguntas en francés hicieron emerger primero videos francófonos, con los anglófonos detrás y, a veces, más lejos: el emparejamiento cruza las lenguas, pero un video habla primero a un mercado en la lengua de ese mercado.

Qué conviene hacer con esto

Cada propiedad de abajo apunta al mecanismo medido arriba. Juntas definen cómo es un video pensado para las respuestas de las IA.

  • Parta de su propio mapa. Los motores pesan los videos de forma muy distinta, y el equilibrio cambia según el mercado y la pregunta. Su propia serie, motor por motor, muestra qué fuentes sirven a las preguntas que le importan: es ella la que decide el lugar que un video merece en su plan.
  • Dele al video el título de la pregunta. Lo que entra en el conjunto de fuentes es un video cuyo título enuncia la pregunta que hace su mercado, formulada como se formula. Una pregunta, un video, el título como puerta.
  • Diga los hechos en voz alta. La transcripción es el texto que los motores leen. Pronuncie su nombre con claridad: la transcripción automática escribe lo que oye, y lo que escribe es lo que se indexa. Diga las cifras, los nombres, los términos que quiere que se retengan, en palabras articuladas.
  • Suba una transcripción revisada. La transcripción automática es aquello a lo que el índice recurre por defecto. Unos subtítulos escritos por usted convierten el texto indexado en sus propias palabras, ortografía incluida.
  • Ponga capítulos y descripción. Los momentos clave se detectan y se indexan. Capítulos que retoman las preguntas, y una descripción que las responde en texto limpio, le dan a la detección algo que encontrar.
  • Hable la lengua del mercado. Un video llega primero a un mercado en la lengua de ese mercado; un segundo mercado merece un segundo video más que una simple pista de subtítulos.
  • Feche la acción y lea el efecto. Un video publicado es un movimiento que merece registrarse en su Logbook; las siguientes mediciones se leen frente a él. Su Atlas muestra si las fuentes detrás de sus preguntas se movieron, y Epovest Tracking si lo hicieron las respuestas mismas.

Hace un año, ser citable por las IA significaba sobre todo páginas. En dos de los cuatro motores que medimos, la fuente más citada es ahora un lugar donde el contenido habla en vez de escribir. La asimetría misma es la lección: la visibilidad en las respuestas de las IA no es una sola cosa que ganar, son cuatro pipelines que medir, y nuestro método empieza ahí: hacer las preguntas del mercado con cadencia fija, archivar las respuestas con sus fuentes, y dejar que la serie diga dónde actuar.

Fuentes