Saltar al contenido
citara Solicitar diagnóstico

Cómo saber si tu trabajo de AEO realmente sirvió

Que las cifras suban no prueba que tú las subiste. Esta guía explica la incrementalidad, los grupos de control y por qué en AEO nadie puede darte una prueba perfecta — incluidos nosotros.

Actualizado el 18 de agosto de 2026

La incrementalidad es el resultado que ocurrió gracias a lo que hiciste, y que no habría ocurrido si no hacías nada. Es la diferencia entre "mis ventas subieron" y "mis ventas subieron por esto". Suena obvio, pero casi nadie lo mide: lo normal es ver una cifra que sube, atribuírsela y seguir.

Esta guía explica cómo se mide de verdad, y por qué en AEO ningún proveedor —nosotros incluidos— puede darte una prueba perfecta. Preferimos decirlo antes de que nos contrates.

¿Por qué "subió" no significa "lo subiste tú"?

Porque casi siempre había algo más pasando al mismo tiempo.

Imagina que publicas contenido nuevo en noviembre y las ventas suben 20%. Puede ser tu contenido. También puede ser que noviembre sea temporada alta, que un competidor cerrara, que salieras en un medio, o que el modelo de IA se actualizó esa semana por razones que no tienen nada que ver contigo.

La pregunta correcta no es "¿subió?" sino "¿habría subido de todos modos?". Y para responderla necesitas algo con qué comparar.

¿Qué es un grupo de control?

Un grupo de control es la parte que deliberadamente dejas sin tocar, para poder comparar.

Es lo mismo que hacen las farmacéuticas al probar un medicamento: a un grupo le dan la pastilla, a otro no, y comparan. Sin ese segundo grupo no sabrías si la gente mejoró por la pastilla o porque se les iba a pasar la gripe igual.

En marketing hay dos formas clásicas de armarlo:

Prueba de exclusión (holdout). Divides a tus clientes al azar: a unos les muestras la campaña y a otros no. Si el grupo que la vio compra más, esa diferencia es tu resultado real.

Prueba de mercados pareados. Cuando no puedes separar personas, separas ciudades. Eliges dos plazas que históricamente se comportan igual, activas la campaña solo en una, y comparas. Si Guadalajara sube y Monterrey no, la diferencia es tuya.

¿Y por qué esto no se puede hacer igual en AEO?

Porque no controlas el canal. Aquí está el problema de fondo, y conviene decirlo sin rodeos.

En una campaña de publicidad tú decides quién ve el anuncio, así que puedes excluir a la mitad. En AEO no decides nada de eso: no controlas quién le pregunta a ChatGPT, ni qué escribe exactamente, ni qué le responde. No puedes decirle a la IA "a este usuario no le menciones mi marca".

O sea: la prueba de exclusión clásica, tal como se enseña, es imposible en AEO. Cualquiera que te diga lo contrario está vendiendo algo.

Lo que sí se puede hacer es cambiar qué cosa dejas sin tocar. En vez de separar personas, separas temas, zonas o momentos.

¿Cómo se mide entonces? Tres formas imperfectas

1. Dejar temas sin tocar

La más práctica. En vez de dividir clientes, divides tus propias preguntas.

Tomas, por ejemplo, 40 preguntas de tu categoría donde hoy no apareces. Eliges 20 al azar y trabajas solo esas: escribes las páginas, consigues las fuentes, arreglas lo técnico. Las otras 20 las dejas exactamente como están.

Unos meses después comparas los dos grupos. Si el grupo trabajado mejoró y el otro no, esa diferencia es tuya. Si mejoraron los dos por igual, algo externo los movió y tu trabajo no fue la causa.

Su límite: los temas no son independientes entre sí. Si mejoras la autoridad general del sitio, eso puede arrastrar también a las preguntas que dejaste sin tocar — y entonces subestimas tu propio efecto.

2. Usar el tiempo como control

Cuando no puedes dividir temas, comparas contra tu propio pasado.

Registras cómo venías durante meses, haces el cambio en una fecha concreta, y luego comparas lo que pasó después contra lo que venía pasando antes.

Su límite: es la más débil de las tres. El mundo no se queda quieto mientras trabajas: si el modelo se actualizó, si entró un competidor, si cambió la temporada, todo eso queda mezclado con tu efecto y no hay forma limpia de separarlo.

3. Separar por ciudad

Si vendes en varias plazas, puedes trabajar el contenido local de una y dejar otra igual, y comparar los resultados de negocio entre las dos.

Su límite: solo sirve si tienes presencia en varias ciudades comparables y suficiente volumen como para que la diferencia sea visible.

Método Qué separas Cuándo conviene Qué tan confiable
Temas sin tocar Preguntas de tu categoría Casi siempre La mejor disponible
El tiempo Antes y después Cuando no puedes dividir temas La más débil
Por ciudad Zonas geográficas Negocios con varias plazas Buena, si hay volumen

¿Por qué es tan difícil ver el resultado en el tráfico?

Porque buena parte del efecto no llega como clic.

Cuando alguien ve tu empresa recomendada por un asistente, muchas veces no toca el enlace: abre otra pestaña y busca tu nombre, o entra directo a tu sitio. En tus analíticas eso no aparece como "vino de la IA" — aparece como búsqueda de marca o como tráfico directo.

Por eso, en vez de buscar un solo número, hay que mirar varias señales a la vez:

  • El tráfico que sí llega identificado. ChatGPT etiqueta los enlaces de sus citas, así que esa parte se ve. Es el piso, no el total.
  • El aumento de búsquedas de tu marca. Si más gente empieza a buscarte por nombre justo después de que la IA empezó a recomendarte, esa es una señal fuerte.
  • El tráfico directo. Sube cuando la gente te escribe en el navegador después de haberte visto en una respuesta.

Ninguna de las tres prueba nada por sí sola. Las tres juntas, moviéndose al mismo tiempo que tu trabajo, son lo más cerca que se puede estar hoy de una prueba.

¿Qué se puede afirmar honestamente y qué no?

Esta es la tabla que más nos importa de toda la guía.

Se puede decir No se puede decir
"Apareciste recomendado en 6 de 20 corridas, contra 1 de 20 hace tres meses" "Subimos tu visibilidad un 500%"
"El grupo de temas que trabajamos mejoró y el que dejamos igual no" "Este contenido generó estas ventas"
"Las búsquedas de tu marca subieron en el mismo período" "La IA te trajo estos clientes"
"Esta respuesta buscó en la web, así que tu sitio pudo influir" "Cada mención vale tanto dinero"

A la columna de la izquierda la llamamos señal. A lo que quisieran vendernos en la columna derecha, atribución — y hoy no existe con la precisión que se le atribuye.

¿Qué hace Citara con esto?

Tres cosas concretas, para que puedas juzgarnos:

Registramos cada cambio con fecha. Cada intervención queda anotada y marcada sobre la línea de tiempo, para que puedas ver qué pasó antes y después sin que nadie te lo interprete.

Reportamos rangos, no un número. Cada métrica va con cuántas corridas tiene detrás. Puedes leer las respuestas completas que guardamos, una por una.

Decimos cuando no se puede atribuir. Pasa seguido. Cuando un cambio coincide con una actualización del modelo o con algo externo, lo decimos en vez de apuntárnoslo.

Y decimos también lo incómodo: no podemos probarte causalidad con una sola marca y sin grupo de control. Nadie puede. Lo que sí podemos es medir con método, mostrarte la evidencia cruda y ser claros sobre dónde termina lo que sabemos.

Si alguien te ofrece certeza en este terreno, esa certeza no existe todavía.

Términos relacionados

Ver también SEO y AEO: por qué uno se puede predecir y el otro no, tráfico oscuro de IA y mención y cita.