La mayoría de los titulares sobre GEO no aguantan cinco preguntas. Este artículo junta lo que el campo todavía no sabe, que es la parte que casi ningún contenido del rubro escribe, y las cinco preguntas que le hacemos a cualquier estudio antes de mover un peso. Incluidos los nuestros.
Lo que sigue abierto
Cuánto de todo esto es causal. Muy poco. El corpus disponible, incluido el nuestro, es abrumadoramente observacional: se miran citas que ya ocurrieron y se buscan patrones. Los dos experimentos causales serios que existen, C-SEO Bench y el de schema de Ahrefs, dieron resultados nulos o contrarios a lo esperado. Eso no prueba que nada funcione. Prueba que la industria está corriendo adelante de su propia evidencia.
Cuánto de lo que ves en un panel es señal y cuánto es ruido. SISTRIX analizó tres plataformas, seis países y diecisiete semanas: a nivel de dominio, AI Mode rota 56% semanal y ChatGPT 74%. A nivel de URL la rotación llega a 85%.
SE Ranking corrió 10.000 keywords tres veces el mismo día en AI Mode: la coincidencia promedio de URLs exactas entre las tres corridas fue 9,2%. Si tu reporte mensual dice que subiste, la primera pregunta honesta es si eso está por encima del ruido del sistema.
Cuánto vale un click de IA. Los reportes de proveedores coinciden en la dirección y no en la magnitud: Semrush reportó 4,4 veces más conversión que el orgánico, Seer Interactive midió 15,9% contra 1,76%, Ahrefs contó 0,5% de sus sesiones generando 12,1% de sus registros. Cuando cinco mediciones del mismo fenómeno van de 4 a 23 veces, no estás mirando un benchmark, estás mirando un rango de incertidumbre.
Qué pasa cuando todos optimizan. C-SEO Bench mostró rendimientos decrecientes con la adopción. Y Kumar y Lakkaraju, de Harvard, demostraron algo más incómodo: con una secuencia de texto diseñada adversarialmente empujaron un producto al primer puesto de las recomendaciones de un modelo. Si eso escala, la respuesta de las plataformas va a ser la misma que tuvo Google con el spam de links.
Qué pasa fuera del inglés. Casi toda la literatura pública se corrió en inglés y en Estados Unidos. Cuánto aplica a una consulta en español rioplatense sobre una categoría local es, hoy, una pregunta sin responder. Es la que más nos interesa y la que estamos midiendo.
Las cinco preguntas
¿Qué superficie midió? AI Overview, AI Mode, ChatGPT y Perplexity son sistemas distintos. En nuestras 518 búsquedas capturadas, el 47,45% de las citas del AI Overview ya estaba en el orgánico de esa misma búsqueda, y al pasar al AI Mode sobrevive el 19,98%. Por eso conviven titulares que dicen que el 76% de las citas viene del top 10 con otros que dicen que es el 17%. No se contradicen: miden pantallas diferentes.
¿Es observacional o causal? Si nadie cambió nada a propósito y comparó contra un grupo de control, es una correlación. Sirve para generar hipótesis, no para justificar presupuesto.
¿Quién hizo las preguntas? Consultas sintéticas armadas por un equipo no son consultas reales de usuarios. Las dos sirven, para cosas distintas.
¿Mide aparición o posición? Aparecer y aparecer primero son métricas que se mueven en direcciones opuestas. El blog de empresa es el mejor ejemplo: gana en volumen y pierde en lugar.
¿En qué idioma y en qué mercado? Si no lo aclara, asumí inglés y Estados Unidos.
La primera pregunta de tu propio estudio la podés responder hoy, gratis. GEO Observer captura tus búsquedas reales en ChatGPT, Gemini y Google, sin límite de uso. Y el seguimiento continuo, con escaneo semanal de más de 100 preguntas, está en Visibilidad AI.
Las cifras propias salen de Dashcrab GEO Citation Research 2026 y del experimento de 518 búsquedas capturadas con GEO Observer entre julio y agosto de 2026. Nuestros estudios son observacionales y no demuestran causalidad. Las cifras de terceros están enlazadas a su fuente original.