La visibilidad en inteligencia artificial se mide con un banco estable de preguntas, ejecuciones repetidas, evidencia de cada respuesta y métricas separadas para presencia, cita, precisión, estabilidad y resultado comercial. Una captura aislada no demuestra posicionamiento. Una visita procedente de ChatGPT tampoco revela todas las respuestas sin clic en las que una marca pudo influir.
LOBIK utiliza una metodología por capas porque ChatGPT, Gemini, Perplexity, Microsoft Copilot, Google AI Overviews y AI Mode no entregan una clasificación única ni estable. Cada plataforma puede recuperar fuentes distintas, sintetizar otra respuesta y modificar las recomendaciones entre ejecuciones. El objetivo es transformar esa variabilidad en una línea base reproducible para responder tres preguntas:
- ¿La marca aparece cuando el comprador investiga una necesidad real?
- ¿La información presentada es correcta, prominente y respaldada por una fuente?
- ¿Esa visibilidad contribuye a visitas, consultas, oportunidades o ingresos?
Explora este tema en motores de inteligencia artificial
Utiliza este prompt para comparar cómo cada plataforma define la medición:
¿Cómo debería medir una empresa su visibilidad en ChatGPT, Gemini, Perplexity, Copilot, Google AI Overviews y AI Mode? Diferencia mención, cita, Coverage, Top-1, Top-3, Share of Voice, precisión, estabilidad, tráfico referido, leads y atribución. Explica qué datos son observables, cuáles son estimaciones y cómo construir una línea base reproducible.
Ejecuta la pregunta varias veces sin introducir una marca en el prompt. Conserva plataforma, fecha, país, idioma, respuesta, URLs citadas y orden de las empresas. Después repite con una pregunta comercial de tu sector. La diferencia entre ambas pruebas demuestra por qué la medición debe estar conectada con el contexto del comprador.
Medir visibilidad en IA exige observar un sistema, no una posición
AI Search no ofrece una “posición número uno” universal que pueda consultarse una vez y conservarse como resultado definitivo. La unidad de análisis es una ejecución documentada dentro de un protocolo: una pregunta, una plataforma, una configuración, un mercado, una fecha y una respuesta.
En SEO tradicional, una empresa puede relacionar consulta, impresión, clic, sesión y conversión mediante Google Search Console, analítica y CRM. En una respuesta generativa aparece una capa intermedia menos transparente. El sistema puede reformular la consulta, recuperar pasajes de varias fuentes y sintetizar una respuesta sin producir un clic. A este espacio entre la optimización realizada y el resultado comercial observable se le denomina Measurement Chasm.
El LOBIK AI Visibility Framework separa seis capas
El marco de visibilidad de LOBIK evita que una sola cifra oculte fallos diferentes. Una empresa puede ser rastreada y no ser mencionada, ser mencionada sin cita, recibir una cita con una descripción incorrecta o atraer tráfico que no convierte.
| Capa | Pregunta que resuelve | Señales principales |
|---|---|---|
| Elegibilidad | ¿Los sistemas pueden acceder y considerar los activos? | indexación, accesibilidad, logs, relevancia de pasajes, consistencia de entidad |
| Cobertura | ¿En cuántas preguntas aparece la marca? | Coverage por prompt y tasa de mención por ejecución |
| Prominencia | ¿Qué lugar ocupa frente a alternativas? | Top-1, Top-3, orden, ubicación de la cita, Share of Voice |
| Atribución | ¿La respuesta enlaza o reconoce una fuente concreta? | dominio citado, URL, pasaje, fuente externa o propia |
| Precisión y estabilidad | ¿La descripción es correcta y se repite? | exactitud de claims, omisiones, contradicciones, volatilidad |
| Contribución comercial | ¿La exposición ayuda a una acción de negocio? | sesiones, consultas, leads calificados, oportunidades, ingresos asistidos |
Estas capas se relacionan, pero no son equivalentes. Una visita de ChatGPT prueba que existió un clic; no prueba cuántas impresiones tuvo la fuente. Un hit de OAI-SearchBot prueba acceso; no prueba que ChatGPT haya citado la página. Una mención correcta demuestra presencia en esa ejecución; no garantiza que se repita mañana.
Datos observables, derivados e inferidos no deben mezclarse
La confiabilidad del informe depende de etiquetar qué se vio, qué se calculó y qué se estimó. LOBIK utiliza tres categorías de evidencia.
Datos observables
Son hechos registrados directamente en la plataforma o en sistemas propios:
- texto exacto de la respuesta;
- marca mencionada;
- orden explícito de alternativas;
- URL citada y posición de la cita;
- fecha, plataforma, mercado e idioma;
- impresión reportada por una herramienta oficial;
- visita con referencia o UTM identificable;
- formulario, llamada, WhatsApp, reunión o venta registrada;
- solicitud de un bot identificable en logs del servidor.
Métricas derivadas
Se calculan sobre observaciones con una fórmula declarada:
- Coverage;
- tasa de mención;
- tasa de citación;
- Top-1 y Top-3;
- Share of Voice;
- precisión;
- estabilidad;
- diversidad de fuentes;
- tasa de conversión de tráfico referido.
Inferencias y estimaciones
Representan hipótesis razonables, pero no acceso al sistema interno:
- subconsultas generadas mediante query fan-out;
- conjunto de documentos considerado antes de sintetizar;
- similitud entre un retriever simulado y uno propietario;
- impresiones no informadas por una plataforma;
- contribución de una exposición sin clic a una visita directa posterior;
- causa exacta de un aumento o una caída.
Un dashboard serio no transforma una inferencia en un hecho mediante diseño visual. Cada estimación debe indicar modelo, fuente, fecha, supuestos y margen de incertidumbre.
La unidad mínima es una ejecución válida
Una ejecución válida conserva las condiciones necesarias para poder comparar el resultado. Registrar solamente la pregunta y la respuesta deja fuera variables que pueden explicar diferencias.
Cada fila del sistema debería incluir, como mínimo:
| Campo | Función |
|---|---|
run_id | Identificador único de la ejecución |
timestamp | Fecha, hora y zona horaria |
platform | ChatGPT, Gemini, Perplexity, Copilot, Google AI Overviews o AI Mode |
surface_mode | búsqueda web, conversación, panel, modo de investigación u otra superficie |
model_version | Modelo o modo visible, cuando la plataforma lo informa |
country_language | País e idioma de la prueba |
device_profile | Dispositivo, sesión limpia o perfil utilizado |
prompt_id | Identificador estable de la pregunta |
prompt_text | Texto exacto enviado |
prompt_cluster | Descubrimiento, comparación, selección, local, soporte u otro grupo |
buyer_stage | Descubrimiento, consideración o decisión |
brand_mentioned | Sí o no |
mention_order | Posición cuando existe un orden comparable |
citation_urls | URLs identificables asociadas a la respuesta |
accuracy_status | Evaluación de exactitud según una rúbrica |
evidence_url | Captura o respuesta almacenada con control de acceso |
El registro también debe diferenciar una respuesta incompleta de una ausencia real. Un error de plataforma, una sesión bloqueada o una respuesta cortada no cuenta como ejecución válida.
El banco de preguntas debe representar decisiones comerciales reales
El benchmark no comienza buscando el nombre de la empresa; comienza reconstruyendo lo que preguntaría un comprador que todavía no la conoce. Las preguntas de marca son útiles para auditar precisión, pero inflan artificialmente la presencia si se mezclan con descubrimiento no asistido.
Preguntas de descubrimiento sin marca
Evalúan si la empresa aparece cuando el usuario describe una necesidad:
- “Necesito una agencia en Chile que mejore mi posicionamiento orgánico”.
- “¿Qué empresa desarrolla páginas web rápidas y optimizadas para Google?”
- “¿Qué agencia puede preparar una marca para motores de respuesta?”
Preguntas de problema
Conectan síntomas con una posible solución:
- “¿Por qué mi empresa no aparece cuando pregunto en ChatGPT?”
- “¿Cómo recuperar tráfico orgánico después de una migración web?”
- “¿Cómo saber si una web puede ser comprendida por motores de IA?”
Preguntas de categoría y comparación
Miden asociación temática y consideración competitiva:
- “¿Qué diferencia existe entre una agencia SEO y una agencia AEO?”
- “¿Qué agencias integran SEO, AEO, GEO y desarrollo web en Chile?”
- “¿Qué debería comparar antes de contratar una consultoría SEO?”
Preguntas de selección y compra
Revelan si la marca entra en la etapa de decisión:
- “Recomiéndame tres empresas para desarrollar una web corporativa en Chile”.
- “¿Qué agencia elegirías para medir Share of Voice en IA y conectarlo con leads?”
- “¿Quién realiza una auditoría técnica de SEO y AI Search?”
Preguntas locales, sectoriales y restrictivas
Añaden condiciones que modifican la recuperación:
- ubicación;
- industria;
- tipo y tamaño de empresa;
- alcance técnico;
- presupuesto cuando sea pertinente;
- integración requerida;
- exigencias de seguridad o regulación.
Un banco puede contener 30, 50, 100 o más preguntas. La cantidad correcta depende de la amplitud de la oferta, no de una cifra universal. Lo indispensable es documentar el criterio de inclusión, mantener un núcleo estable y versionar las incorporaciones.
La muestra debe separar prompts, plataformas y repeticiones
Una línea base reproducible necesita varias ejecuciones por pregunta y resultados separados por plataforma. Promediar ChatGPT, Gemini y Perplexity en una sola cifra puede ocultar que la marca domina una superficie y está ausente en otra.
Una configuración inicial razonable puede utilizar:
- 50 preguntas comerciales estables;
- 4 plataformas;
- 3 repeticiones por pregunta;
- 2 fechas de observación dentro del ciclo;
- 1 mercado e idioma definidos.
Eso produciría hasta 1.200 ejecuciones válidas: 50 × 4 × 3 × 2. Es un ejemplo metodológico, no un mínimo obligatorio. Si el presupuesto es menor, conviene reducir preguntas sin eliminar repeticiones ni documentación.
Para cada ciclo se deben conservar:
- versión del banco;
- conjunto de competidores;
- configuración de país e idioma;
- estado de personalización o sesión;
- intervalo entre ejecuciones;
- fecha de cambios en contenido, enlaces o entidad;
- incidentes y actualizaciones conocidas de plataformas.
No se deben comparar dos periodos si el banco, el mercado o la fórmula cambiaron sin normalizar los datos.
Coverage responde en cuántas preguntas aparece la marca
Coverage o cobertura de marca mide la amplitud del descubrimiento dentro de un banco definido. La fórmula utiliza preguntas únicas, no el total de repeticiones.
Coverage = preguntas con al menos una mención de la marca
÷ preguntas evaluadas
× 100
Si una marca aparece en 18 de 60 preguntas, su Coverage es 30%. La cifra no indica estabilidad: una sola aparición dentro de cinco repeticiones activa esa pregunta. Por eso debe acompañarse con tasa de mención por ejecución.
Tasa de mención = ejecuciones válidas con mención de la marca
÷ ejecuciones válidas
× 100
Coverage explica variedad de intenciones cubiertas. La tasa de mención explica frecuencia de aparición. Reportarlas juntas evita declarar una cobertura alta basada en resultados esporádicos.
La tasa de citación mide fuentes propias, no cualquier mención
Una cita existe cuando la respuesta presenta una URL o referencia identificable que puede atribuirse a la organización o a una fuente que la respalda. Una marca escrita sin enlace es una mención, no una cita propia.
Cobertura de citación = preguntas con al menos una URL propia citada
÷ preguntas evaluadas
× 100
Tasa de citación por ejecución = ejecuciones con URL propia citada
÷ ejecuciones válidas
× 100
El informe debería separar:
- cita a una página de la empresa;
- cita a un perfil controlado por la empresa;
- mención respaldada por una fuente externa;
- fuente externa que habla de la categoría, pero no de la marca;
- enlace visible sin uso comprobable dentro de la síntesis.
La cita tampoco prueba que toda la respuesta provenga de esa página. Se debe verificar qué claim respalda realmente la URL y si conserva sus condiciones.
Top-1 y Top-3 solo aplican cuando existe un orden comparable
Top-1 y Top-3 miden prominencia cuando la respuesta presenta empresas como alternativas ordenadas o claramente priorizadas. No se deben forzar sobre una explicación narrativa que menciona marcas sin ranking.
Top-1 = ejecuciones ordenadas donde la marca aparece primera
÷ ejecuciones con lista comparable
× 100
Top-3 = ejecuciones ordenadas donde la marca aparece entre las tres primeras
÷ ejecuciones con lista comparable
× 100
El denominador excluye respuestas sin lista, sin recomendación o con menos contexto del necesario. También conviene separar “primera mención” de “recomendación principal”: ocupar el primer párrafo no siempre equivale a ser la opción elegida.
Share of Voice compara presencia dentro de un conjunto competitivo
Share of Voice en IA estima qué proporción de la presencia observada corresponde a una marca frente a competidores definidos. No es una métrica oficial común a todas las plataformas. Su valor depende del banco de preguntas, las repeticiones y la ponderación.
La versión no ponderada cuenta cada aparición una vez:
SOV no ponderado = menciones de la marca
÷ menciones de todas las marcas monitorizadas
× 100
La versión ponderada asigna valor distinto según prominencia. Por ejemplo, una metodología interna podría utilizar 3 puntos para recomendación principal, 2 para Top-3 y 1 para una mención secundaria:
SOV ponderado = puntos de presencia de la marca
÷ puntos de todas las marcas monitorizadas
× 100
La ponderación no debe ocultarse ni presentarse como regla de ChatGPT o Google. También se recomienda calcular un Citation Share of Voice independiente:
Citation SOV = citas del dominio propio
÷ citas de todos los dominios monitorizados
× 100
La lista de competidores se congela durante cada ciclo. Agregar o quitar marcas cambia el denominador y puede alterar SOV sin que cambie la visibilidad real.
Un ejemplo muestra por qué una sola métrica confunde
El siguiente escenario es hipotético y explica la metodología; no representa resultados reales de LOBIK ni de otra empresa. Se evaluaron 20 preguntas, 3 veces cada una, en una sola plataforma: 60 ejecuciones válidas.
| Métrica | LOBIK Systems | Empresa A | Empresa B |
|---|---|---|---|
| Preguntas con al menos una mención | 12 | 15 | 8 |
| Coverage | 60% | 75% | 40% |
| Ejecuciones con mención | 25 | 30 | 14 |
| Tasa de mención | 41,7% | 50% | 23,3% |
| Ejecuciones con cita propia | 11 | 6 | 8 |
| Tasa de citación | 18,3% | 10% | 13,3% |
| Top-1 en 30 listas comparables | 8 | 14 | 4 |
| Precisión de claims auditados | 96% | 82% | 93% |
La Empresa A domina Coverage y Top-1. LOBIK obtiene más citas propias y mayor precisión. No existe un ganador absoluto sin definir el objetivo. Si la prioridad es consideración, puede importar Top-1; si es autoridad de fuente, tasa de citación; si existe riesgo reputacional, precisión.
La precisión evalúa lo que la IA dice, no solo si nombra la marca
Una mención incorrecta puede ser peor que una ausencia. El análisis debe revisar razón social o nombre, especialidad, ubicación, servicios, clientes, precios, responsables, resultados, condiciones y cualquier afirmación sensible.
LOBIK propone una rúbrica de cuatro niveles:
| Estado | Criterio |
|---|---|
| Correcta | Los claims esenciales coinciden con fuentes vigentes |
| Correcta con omisiones | No contiene errores relevantes, pero falta contexto importante |
| Parcialmente incorrecta | Mezcla información cierta con errores o atribuciones dudosas |
| Incorrecta | Confunde la entidad, inventa datos o contradice fuentes primarias |
Cuando se necesita una cifra, la precisión puede calcularse por claim:
Precisión = claims correctos
÷ claims evaluados
× 100
Los errores no tienen la misma gravedad. Confundir una abreviatura es distinto de inventar una certificación, un precio o un cliente. El informe debería agregar severidad crítica, alta, media o baja y registrar la URL primaria que permite corregir cada afirmación.
La estabilidad mide repetición; no mide calidad
Estabilidad describe cuánto se repite un estado entre ejecuciones comparables. Una marca puede estar establemente ausente o una descripción incorrecta puede repetirse con gran consistencia. Por eso estabilidad siempre se interpreta junto con presencia y precisión.
Una forma sencilla de medir repetibilidad por pregunta es identificar el estado modal —mención o ausencia— y calcular su frecuencia:
Repetibilidad = ejecuciones con el estado más frecuente
÷ ejecuciones válidas de la pregunta
× 100
También puede calcularse visibilidad estable mediante un umbral interno:
Visibilidad estable = preguntas donde la marca aparece en ≥80% de repeticiones
÷ preguntas evaluadas
× 100
El 80% es una decisión metodológica de ejemplo, no una norma de la industria. Para detectar tendencias, es preferible utilizar promedios móviles y bandas de variación antes que comparar dos capturas puntuales.
La prominencia de una cita depende de cada interfaz
Dos citas no tienen la misma visibilidad si una aparece junto al claim principal y otra queda oculta en un panel secundario. El registro puede clasificar la ubicación sin asumir que representa un CTR universal.
Una taxonomía operativa puede diferenciar:
- cita inline junto a la afirmación;
- fuente visible en la primera pantalla;
- tarjeta o carrusel de fuentes;
- lista expandible;
- fuente al final de una respuesta;
- enlace relacionado sin atribución clara.
Si se utiliza un puntaje de prominencia, los pesos deben ser públicos dentro del informe. La interfaz puede cambiar; por eso también se guarda captura o HTML autorizado de la ejecución.
Google Search Console ya ofrece una vista generativa, pero todavía es parcial
Desde junio de 2026 Google prueba un informe específico de rendimiento generativo en Search Console para un subconjunto de propiedades. El informe incluye impresiones de URLs en AI Overviews y AI Mode y permite segmentar por página, país, fecha y dispositivo. Su disponibilidad es gradual y una propiedad puede no verlo por falta de acceso o volumen suficiente.
La documentación actual presenta una métrica de impresiones y no ofrece una dimensión de consulta dentro de ese informe. Por tanto, sirve para observar exposición directa de páginas en funciones generativas de Google, pero no reemplaza el banco de preguntas, la auditoría de citas ni la atribución comercial. Los datos también permanecen incluidos dentro del tipo de búsqueda Web del informe general.
Consultar el anuncio del informe generativo de Search Console
Consultar la documentación del informe
Para propiedades con acceso, LOBIK recomienda exportar semanalmente:
- impresiones totales;
- páginas visibles;
- país;
- dispositivo;
- fecha;
- anotaciones de cambios editoriales y técnicos.
La ausencia del informe no significa ausencia en AI Search. Puede corresponder al despliegue limitado, a umbrales de datos o a falta de impresiones.
GA4 y el CRM miden clics y resultados, no toda la exposición
La analítica web comienza cuando existe una visita identificable; las respuestas sin clic quedan fuera. El dashboard debe separar tráfico referido por plataformas de IA, Google orgánico, tráfico directo y fuentes no identificadas.
OpenAI indica que los enlaces de referencia de ChatGPT Search incorporan utm_source=chatgpt.com, lo que permite identificar ese tráfico en herramientas como Google Analytics. Esta señal prueba una visita procedente de un enlace de ChatGPT; no informa todas las veces que una respuesta mostró o utilizó la marca.
Consultar las preguntas para editores y desarrolladores de OpenAI
Un cuadro comercial mínimo debería registrar:
| Etapa | Métrica | Fuente |
|---|---|---|
| Visita | sesiones y usuarios referidos por IA | GA4 o analítica equivalente |
| Interacción | sesión con engagement, scroll, CTA, descarga | analítica y gestor de consentimiento |
| Consulta | formulario, WhatsApp, llamada o agenda | eventos y sistema de leads |
| Calificación | lead calificado y necesidad | CRM |
| Oportunidad | reunión, propuesta y valor estimado | CRM comercial |
| Resultado | contrato, ingreso y recurrencia | CRM o sistema financiero |
El formulario puede incorporar una pregunta de atribución declarada: “¿Cómo conociste a LOBIK Systems?”. La respuesta no sustituye la atribución técnica, pero ayuda a detectar exposición sin clic que posteriormente produce una visita directa o búsqueda de marca.
Campos útiles en CRM:
first_touch_source;last_touch_source;self_reported_source;ai_platform;prompt_theme;landing_page;service_interest;lead_quality;opportunity_value;closed_revenue.
El ingreso asistido debe presentarse como contribución dentro de un modelo definido, no como venta causada exclusivamente por una respuesta de IA.
Los logs muestran acceso, no recomendación
La actividad de crawlers ayuda a diagnosticar elegibilidad, pero no demuestra una cita. Cada user agent tiene una finalidad distinta y no debe agruparse bajo una etiqueta genérica de “visitas de IA”.
OpenAI diferencia, entre otros, OAI-SearchBot para funciones de búsqueda, GPTBot para posible entrenamiento y ChatGPT-User para solicitudes iniciadas por usuarios. Una solicitud de GPTBot no equivale a una aparición en ChatGPT Search. Del mismo modo, una caída de crawl puede motivar una revisión técnica, pero no prueba por sí sola pérdida de Share of Voice.
El análisis de logs debería registrar:
- user agent;
- IP validada según documentación del proveedor cuando esté disponible;
- URL solicitada;
- código de respuesta;
- bytes transferidos;
- fecha y frecuencia;
- robots aplicable;
- redirecciones;
- relación temporal con cambios de contenido y citas observadas.
La secuencia correcta es: acceso observado → posible elegibilidad → presencia comprobada mediante respuesta. Saltar directamente desde crawl hasta recomendación crea una conclusión no respaldada.
El seguimiento activo captura la capa que las analíticas no muestran
El monitoreo activo ejecuta preguntas controladas, captura respuestas y extrae marcas y fuentes. Puede realizarse manualmente en una muestra pequeña o mediante APIs y herramientas autorizadas cuando el volumen lo exige.
El principio transferible es registrar cada ejecución y observar frecuencia, posición y conjunto de citas a lo largo del tiempo.
Un sistema automatizado debería:
- leer preguntas versionadas desde una base;
- respetar términos de servicio, límites y permisos;
- ejecutar la configuración definida;
- conservar respuesta y metadatos;
- extraer entidades, marcas y URLs;
- normalizar dominios y canonicales;
- aplicar la rúbrica de precisión;
- calcular métricas por plataforma y clúster;
- generar alertas por cambios significativos;
- permitir revisión humana.
Automatizar una interfaz mediante selectores frágiles puede romperse cuando cambia el producto. Las APIs oficiales o proveedores autorizados son preferibles. La captura manual sigue siendo válida si el protocolo y la muestra están documentados.
La atribución comienza en la pregunta y termina en el resultado
Atribuir AI Search no significa asignar toda la conversión a una plataforma; significa conservar las relaciones observables entre prompt, entidad, respuesta, fuente, sesión y oportunidad. Cada nivel responde una pregunta distinta.
| Nivel | Pregunta de atribución |
|---|---|
| Prompt | ¿Qué necesidad activó la respuesta? |
| Intención | ¿Qué trabajo intentaba completar el usuario? |
| Entidad | ¿Qué empresa, servicio, producto, lugar o concepto interpretó el sistema? |
| Superficie | ¿En qué plataforma y modo apareció? |
| Fuente | ¿Qué dominio, URL o pasaje fue citado? |
| Marca | ¿Cómo fue mencionada y comparada? |
| Sesión | ¿Existió una visita identificable? |
| Conversión | ¿Qué acción realizó el usuario? |
| Negocio | ¿La acción se convirtió en lead, oportunidad o ingreso? |
La relación completa rara vez estará disponible en una sola fila. El sistema debe admitir “desconocido” sin rellenarlo con suposiciones.
Query fan-out se atribuye mediante inferencias controladas
La consulta visible puede actuar como semilla de otras búsquedas internas, pero las subconsultas exactas no suelen estar expuestas. Una manera de estudiarlas es observar sus “sombras” mediante variaciones controladas, URLs recurrentes y co-citación.
El procedimiento puede adaptarse así:
- seleccionar una pregunta comercial de alto valor;
- variar un solo elemento: entidad, atributo, fecha, ubicación o restricción;
- ejecutar cada variante varias veces;
- registrar fuentes citadas;
- calcular qué URLs aparecen juntas;
- agrupar fuentes y subintenciones;
- identificar cobertura y vacíos propios;
- etiquetar el mapa como inferido, no como registro interno del motor.
Las URLs que persisten en múltiples variantes pueden representar fuentes fuertes dentro del tema. No prueban qué subconsulta interna generó la plataforma; ofrecen inteligencia competitiva para diseñar pruebas y contenido.
Las entidades explican asociaciones que las keywords no muestran
La atribución de entidades registra qué organizaciones, servicios, lugares, personas y conceptos aparecen relacionados con una pregunta. Dos prompts con palabras distintas pueden activar asociaciones similares si comparten entidades e intención.
Una matriz de consulta y entidad puede contener:
| Prompt | Entidad principal | Atributo | Mercado | Fuentes | Marca presente |
|---|---|---|---|---|---|
| Agencia para AI Search | agencia digital | AEO/GEO | Chile | dominios citados | sí/no |
| Consultoría para tráfico orgánico | consultoría SEO | crecimiento | Chile | dominios citados | sí/no |
| Web rápida para empresa | desarrollo web | rendimiento | Rancagua | dominios citados | sí/no |
El análisis comprueba si el contenido propio representa esas relaciones en texto visible, enlaces internos y datos estructurados fieles. No se trata de agregar todas las entidades posibles, sino de cubrir las necesarias para resolver la intención.
La simulación permite probar hipótesis antes de esperar una cita
Un simulador de recuperación crea un entorno controlado para comparar consultas y pasajes, pero no reproduce el algoritmo propietario de una plataforma. Su función es diagnosticar y priorizar, no predecir con certeza.
Un entorno RAG local extrae contenido, lo divide, genera embeddings y devuelve los pasajes más próximos a una consulta. Los resultados pueden compararse con citas observadas para calibrar el modelo.
Una simulación documentada debería fijar:
- corpus y fecha de captura;
- reglas de extracción;
- tamaño y solapamiento de pasajes;
- modelo de embeddings y versión;
- consulta exacta y variantes;
- cantidad
top_kde resultados; - métrica de similitud;
- reranking aplicado;
- prompt de síntesis si existe;
- resultado esperado;
- comparación con observaciones reales.
Si una modificación mejora la posición del pasaje dentro del simulador, solo demuestra un resultado en ese entorno. La validación exige observar producción mediante ejecuciones repetidas.
Las pruebas de síntesis detectan errores y pérdida de contexto
La recuperación correcta no garantiza una respuesta correcta. El modelo puede omitir una condición, mezclar entidades o atribuir el dato a una fuente distinta.
Una batería de síntesis puede incluir:
- prompt directo que nombra la fuente;
- prompt no asistido que obliga al sistema a elegir fuentes;
- prompt con restricción geográfica;
- prompt temporal;
- prompt comparativo;
- prompt contradictorio que comprueba si conserva una advertencia;
- prompt de seguimiento que modifica una condición.
La evaluación revisa:
- fidelidad al pasaje;
- conservación de condiciones;
- atribución correcta;
- entidad correcta;
- actualidad;
- contradicciones;
- información inventada;
- capacidad para declarar incertidumbre.
El objetivo no es “erradicar alucinaciones”, una promesa que ninguna web puede sostener. El objetivo es detectar patrones de error, reducir ambigüedades propias y publicar fuentes primarias claras.
La taxonomía de fallos convierte métricas en acciones
Un informe útil identifica dónde se rompe el recorrido y asigna una intervención. LOBIK utiliza siete tipos de fallo.
| Fallo | Evidencia | Acción posible |
|---|---|---|
| Acceso | bloqueos, errores, HTML no disponible | corregir rastreo, respuesta, renderizado o robots |
| Elegibilidad | página accesible pero fuera de índices o corpus | revisar indexación, canonical, enlaces y relevancia |
| Recuperación | el pasaje no aparece en pruebas ni citas | mejorar cobertura de intención, entidades y fragmentos |
| Selección | aparece como candidato, pero otras fuentes dominan | aportar evidencia, diferenciación, actualidad y autoridad |
| Síntesis | la fuente se usa, pero el resultado distorsiona | clarificar claims, condiciones y relaciones |
| Atribución | la información aparece sin fuente propia o con fuente incorrecta | fortalecer procedencia y página primaria |
| Conversión | existe visibilidad, pero no acción comercial | alinear intención, propuesta, UX, CTA y seguimiento |
Esta clasificación impide responder a todos los problemas creando más contenido. Un bloqueo técnico no se resuelve con otro artículo; una baja conversión no siempre exige más citas.
El dashboard debe permitir diagnóstico y decisión
Un buen dashboard no acumula gráficos: conecta métricas con preguntas y responsables. La vista ejecutiva y la vista operativa cumplen funciones distintas.
Vista ejecutiva
- Coverage total y por etapa del comprador;
- Share of Voice frente al grupo competitivo;
- precisión y errores críticos;
- tendencia de impresiones generativas de Google, si está disponible;
- sesiones referidas por IA;
- leads calificados, oportunidades e ingreso asistido;
- cambios relevantes y decisiones del periodo.
Vista operativa
- prompt y plataforma;
- mención, orden y cita;
- URL citada;
- clúster de intención;
- entidad y atributo;
- exactitud;
- estabilidad;
- página propia asociada;
- fallo diagnosticado;
- tarea, responsable y fecha.
Vista técnica
- indexación y canonicales;
- logs por crawler y URL;
- respuestas y errores del servidor;
- cambios de robots;
- páginas con impresiones generativas;
- resultados de simulación por pasaje;
- discrepancias entre contenido visible y datos estructurados.
La cadencia puede variar según volumen. Las decisiones no deberían depender de oscilaciones diarias normales. Generalmente aplican revisiones diarias operativas, semanales tácticas y mensuales/trimestrales para evaluación estratégica.
Un experimento GEO necesita línea base y control de cambios
La mejora se evalúa comparando ciclos equivalentes antes y después de una intervención documentada. Cambiar arquitectura, textos, enlaces, schema y oferta al mismo tiempo puede producir movimiento, pero dificulta identificar su causa.
El protocolo mínimo es:
- formular una hipótesis;
- definir páginas, prompts y métricas afectadas;
- ejecutar la línea base;
- implementar un cambio coherente;
- comprobar publicación, indexación y acceso;
- esperar una ventana acorde con la superficie;
- repetir la muestra bajo condiciones comparables;
- contrastar con páginas o clústeres no modificados cuando sea posible;
- registrar eventos externos;
- decidir mantener, iterar o revertir.
Ejemplo:
Hipótesis: si la página de consultoría SEO define alcance, proceso, entregables, límites y cobertura en Chile mediante pasajes autónomos, aumentará la recuperación para preguntas de selección B2B sin reducir precisión.
La prueba no debería declarar causalidad por una única cita posterior. Debe observar varias preguntas, repeticiones y periodos, además de cambios competitivos.
Los formatos de evidencia C1–C5 evitan claims sin respaldo
Cada hallazgo del informe debe indicar qué clase de evidencia lo sostiene. LOBIK utiliza cinco formatos:
| Código | Evidencia | Uso |
|---|---|---|
| C1 | fuente primaria externa | documentación oficial, paper o declaración de plataforma |
| C2 | observación propia reproducible | respuesta, captura, log, exportación o prueba LOBIK |
| C3 | comparación estructurada | marcas, páginas o periodos bajo el mismo protocolo |
| C4 | caso documentado | contexto, intervención, medición y limitaciones |
| C5 | conexión interna | página canónica, servicio, metodología o activo de LOBIK |
Una recomendación puede combinar varios formatos. Por ejemplo, el informe de Search Console es C1; la exportación de la propiedad es C2; la comparación mensual es C3; una migración medida es C4; la relación con la auditoría es C5.
Errores frecuentes al medir visibilidad en IA
La mayoría de los falsos positivos aparece por diseño deficiente de la prueba, no por una fórmula compleja. Evita estos errores:
- preguntar solamente por el nombre de la marca;
- utilizar una sola ejecución;
- mezclar plataformas en un promedio sin desglose;
- cambiar prompts entre periodos sin versionarlos;
- contar una mención como cita;
- aplicar Top-1 a respuestas sin orden;
- cambiar competidores y mantener el mismo SOV histórico;
- tratar crawl de bots como recomendación;
- atribuir tráfico directo automáticamente a IA;
- confundir correlación temporal con causalidad;
- ocultar errores de precisión detrás de una cifra de presencia;
- publicar datos de ejemplo como resultados reales;
- depender de selectores o scraping no autorizado;
- guardar prompts o respuestas con datos personales innecesarios;
- actualizar el dashboard sin documentar cambios de metodología.
Checklist para implementar una línea base de visibilidad
Alcance
- [ ] Están definidos mercado, idioma, plataformas y superficies.
- [ ] El conjunto competitivo tiene un criterio explícito.
- [ ] El periodo y la cadencia están establecidos.
- [ ] Los objetivos comerciales están conectados con el análisis.
Banco de preguntas
- [ ] Incluye descubrimiento, problema, comparación y decisión.
- [ ] Separa preguntas de marca y sin marca.
- [ ] Representa servicios, sectores y ubicaciones relevantes.
- [ ] Cada pregunta tiene ID, clúster y etapa.
- [ ] Existe control de versiones.
Captura
- [ ] Cada ejecución conserva fecha y configuración.
- [ ] Las respuestas incompletas se excluyen o etiquetan.
- [ ] Se guardan URLs y evidencia visual o textual.
- [ ] Existen varias repeticiones por pregunta.
- [ ] La automatización respeta permisos y términos.
Métricas
- [ ] Coverage y tasa de mención se calculan por separado.
- [ ] La citación exige una fuente identificable.
- [ ] Top-1 y Top-3 usan solo listas comparables.
- [ ] La fórmula y ponderación de SOV están documentadas.
- [ ] Precisión y severidad de errores son revisadas.
- [ ] Estabilidad acompaña los promedios.
Atribución y negocio
- [ ] GA4 identifica referrals y UTMs disponibles.
- [ ] El CRM registra fuente declarada y técnica.
- [ ] Leads y oportunidades tienen criterios de calidad.
- [ ] Ingreso directo y asistido están diferenciados.
- [ ] Las inferencias están marcadas como tales.
Gobierno
- [ ] Hay un responsable de recolección.
- [ ] Hay revisión humana de claims sensibles.
- [ ] Las fuentes y fechas son auditables.
- [ ] Los datos personales se minimizan.
- [ ] Los cambios de metodología quedan registrados.
Preguntas frecuentes sobre medición de visibilidad en IA
¿Qué es la visibilidad en inteligencia artificial?
Es la presencia observable de una empresa, fuente, producto o concepto dentro de respuestas y funciones generativas para un conjunto definido de preguntas. Debe evaluarse por plataforma, contexto, fecha y repetición; no es una posición universal.
¿Cómo se mide Share of Voice en IA?
Se divide la presencia de una marca por la presencia total de las marcas monitorizadas dentro del mismo banco y periodo. Si se ponderan Top-1, Top-3 o menciones secundarias, los pesos y el conjunto competitivo deben declararse.
¿Cuál es la diferencia entre Coverage y tasa de mención?
Coverage mide en cuántas preguntas únicas aparece la marca al menos una vez. La tasa de mención mide en qué porcentaje de todas las ejecuciones válidas aparece. La segunda refleja mejor la frecuencia y variabilidad.
¿Una mención es lo mismo que una cita?
No. Una mención nombra o describe la marca. Una cita presenta una fuente o URL identificable. Puede existir mención sin enlace, cita a una fuente externa o fuente propia sin una mención prominente de marca.
¿Qué significa Top-1 en una respuesta de IA?
Significa que la empresa aparece como primera alternativa o recomendación dentro de una respuesta explícitamente ordenada. No debe calcularse en textos narrativos sin clasificación comparable.
¿Cuántas veces se debe repetir cada pregunta?
No existe un número universal. Tres a cinco repeticiones por ciclo ofrecen una primera lectura de variación, pero decisiones de alto impacto pueden requerir más observaciones, fechas y segmentos.
¿Google Search Console muestra AI Overviews y AI Mode?
Google prueba desde junio de 2026 un informe generativo para un subconjunto de propiedades. Muestra impresiones y dimensiones de página, país, fecha y dispositivo para AI Overviews y AI Mode. La disponibilidad y los datos pueden ser limitados.
¿GA4 puede mostrar tráfico de ChatGPT?
Sí, cuando existe un clic con referencia o UTM identificable. OpenAI indica que ChatGPT Search añade utm_source=chatgpt.com a sus enlaces. GA4 no observa menciones ni respuestas que no generan visita.
¿Los hits de OAI-SearchBot prueban que ChatGPT citó una página?
No. Prueban acceso del crawler de búsqueda a una URL. La cita debe comprobarse mediante la respuesta o el tráfico referido. GPTBot, OAI-SearchBot y ChatGPT-User tampoco cumplen la misma función.
¿Se puede atribuir una venta directamente a una respuesta de IA?
Solo cuando existe una cadena observable suficiente, por ejemplo clic identificado, sesión, lead y cierre en CRM. En recorridos sin clic o multicanal corresponde hablar de contribución o atribución asistida, no de causalidad absoluta.
¿Un simulador puede predecir qué citará ChatGPT o Google?
No con certeza. Puede comparar relevancia y recuperación dentro de un corpus y modelo definidos, detectar pasajes débiles y priorizar pruebas. La validación final requiere observación en la plataforma real.
¿Qué debería incluir un informe mensual de visibilidad en IA?
Debe incluir alcance, muestra, plataformas, Coverage, mención, cita, Top-1, Top-3, SOV, precisión, estabilidad, páginas y entidades, tráfico, leads, cambios realizados, limitaciones y próximas acciones.