AI Search transforma una pregunta en un proceso de recuperación y síntesis. El sistema interpreta la intención, puede generar subconsultas, busca documentos o pasajes, reordena candidatos, reúne evidencia y utiliza un modelo generativo para construir una respuesta.
Una página puede estar publicada e indexada, pero quedar fuera de la respuesta porque no coincidió con una subconsulta, perdió durante el reranking, presentó información difícil de extraer o no aportó evidencia suficiente para la síntesis. Por eso, posicionar en AI Search exige comprender el recorrido completo y no solamente la palabra clave inicial.
Explora este tema en motores de inteligencia artificial
Utiliza esta pregunta para comparar explicaciones y fuentes:
¿Cómo funciona una arquitectura de AI Search desde que una persona formula un prompt hasta que el sistema recupera fuentes, aplica RAG, sintetiza una respuesta y muestra citas?
Después pide que el motor represente el proceso como diagrama y que diferencie búsqueda léxica, búsqueda semántica, recuperación híbrida, reranking y query fan-out. Observa qué conceptos omite, qué fuentes cita y cuáles presenta como hipótesis.
Nota: las plataformas son servicios externos. Sus respuestas pueden variar según fecha, modelo, ubicación, idioma, sesión, disponibilidad de búsqueda y configuración.
¿Cómo funciona AI Search desde la consulta hasta la respuesta?
Una arquitectura de AI Search puede modelarse como un embudo de candidatos que termina en una respuesta generada. No todas las plataformas implementan las mismas etapas ni publican su arquitectura interna, pero el patrón permite diagnosticar dónde puede perderse una fuente.
Prompt o consulta del usuario
↓
Interpretación de intención, entidades y restricciones
↓
Reescritura, expansión y query fan-out
├── Recuperación léxica
├── Recuperación semántica
└── Grafos, feeds, APIs y fuentes verticales
↓
Fusión y deduplicación de candidatos
↓
Reranking, calidad, actualidad y seguridad
↓
Selección y empaquetado del contexto
↓
Síntesis mediante un modelo generativo
↓
Respuesta, citas, enlaces o acciones El proceso no debe interpretarse como una descripción exacta de todos los sistemas. Es una arquitectura de referencia construida a partir de investigación sobre recuperación de información, RAG y documentación pública de plataformas.
Las ocho etapas del proceso
| Etapa | Pregunta técnica | Motivo por el que una página puede quedar fuera |
|---|---|---|
| Ingestión | ¿El sistema pudo acceder y procesar el recurso? | Bloqueos, errores HTTP, contenido inaccesible o formatos difíciles de interpretar |
| Representación | ¿El contenido quedó indexado o representado correctamente? | Canonical incorrecto, duplicación, chunking deficiente o metadatos ambiguos |
| Interpretación | ¿El sistema comprendió la necesidad y las entidades? | Lenguaje ambiguo, intención mal delimitada o falta de contexto |
| Expansión | ¿Qué subconsultas y necesidades latentes generó? | La página solo cubre la frase inicial y no los criterios relacionados |
| Recuperación | ¿Qué candidatos coinciden de forma léxica, semántica o estructurada? | Cobertura insuficiente, términos ausentes o baja pertinencia semántica |
| Selección | ¿Qué pasajes son más útiles, verificables y extraíbles? | Respuesta enterrada, alcance impreciso, baja evidencia o desactualización |
| Síntesis | ¿Qué evidencia cabe y sostiene la respuesta? | El pasaje no aporta un hecho necesario o contradice fuentes más sólidas |
| Atribución | ¿Qué fuentes reciben mención, enlace o cita visible? | La información se usa sin atribución visible o se prefiere otra fuente |
Esta separación evita una conclusión equivocada: "Si estoy indexado, debería ser citado". La indexación abre una puerta; no determina por sí sola todas las decisiones posteriores.
La recuperación evolucionó de palabras exactas a representaciones semánticas
La búsqueda moderna no abandonó las palabras clave: agregó capas capaces de reconocer significado, contexto y relaciones. Los sistemas más robustos combinan recuperación léxica y neuronal porque cada enfoque resuelve problemas distintos.
Índices invertidos y búsqueda léxica
Un índice invertido relaciona cada término con los documentos o pasajes donde aparece. Funciona de manera parecida al índice de un libro: en lugar de recorrer todos los documentos para cada consulta, el sistema consulta listas previamente organizadas.
Métodos como TF-IDF y BM25 ponderan la importancia de los términos. Una palabra frecuente en casi todos los documentos aporta menos diferenciación que un nombre, código o término técnico poco común.
La recuperación léxica sigue siendo especialmente útil para:
- nombres de personas y empresas;
- modelos, códigos y SKU;
- fechas y versiones;
- términos legales o científicos precisos;
- frases cuyo significado depende de una coincidencia literal.
Su debilidad aparece cuando la consulta y el contenido expresan la misma idea con palabras diferentes. Una página puede hablar de "tienda online" y una persona buscar "plataforma de comercio electrónico", por ejemplo.
Consultar el marco probabilístico de BM25
Embeddings y recuperación densa
Un embedding representa texto, imagen u otro objeto como un vector numérico. Elementos semánticamente relacionados tienden a ocupar regiones próximas dentro del espacio vectorial, aunque no compartan todas las palabras.
Word2Vec mostró que podían aprenderse representaciones continuas de palabras a partir de grandes colecciones de texto. La investigación posterior extendió este principio a oraciones, pasajes, documentos e información multimodal.
Consultar el trabajo de Google sobre Word2Vec
En una recuperación densa, la consulta y los pasajes se representan en un espacio compatible. El sistema busca los candidatos más próximos mediante una medida de similitud. Esto permite recuperar contenido conceptualmente pertinente aunque la redacción sea diferente.
El trabajo sobre Dense Passage Retrieval demostró la utilidad de representaciones densas para seleccionar pasajes en preguntas de dominio abierto.
Consultar Dense Passage Retrieval
La similitud semántica no equivale a verdad
Dos textos pueden estar cerca en el espacio vectorial y contener afirmaciones incompatibles. La recuperación semántica identifica proximidad de significado, no verifica automáticamente actualidad, autoridad o exactitud.
Por eso, los sistemas posteriores pueden agregar reranking, filtros, corroboración y selección de evidencia. Una estrategia GEO que solo intenta "mejorar embeddings" ignora la mitad del problema.
Transformers y BERT cambiaron la comprensión contextual
La arquitectura Transformer permitió construir representaciones sensibles al contexto y procesar relaciones entre partes distantes de una secuencia. Esto ayudó a superar modelos donde una palabra tenía prácticamente la misma representación sin importar la frase.
El artículo Attention Is All You Need introdujo en 2017 una arquitectura basada en mecanismos de atención. BERT aplicó Transformers de forma bidireccional y Google comunicó su uso para comprender mejor consultas y resultados de Search.
Consultar Attention Is All You Need
Consultar la explicación oficial de BERT en Google Search
La palabra "banco" necesita contexto para distinguir una institución financiera de un asiento o la orilla de un río. Los modelos contextuales representan esas diferencias utilizando las palabras que rodean el término.
Para el contenido, esto implica que repetir una palabra no sustituye una explicación completa. Los sistemas necesitan relaciones claras entre entidad, atributo, acción, condición y resultado.
De un vector por documento a múltiples vectores
Una sola representación puede perder detalles en documentos extensos. Los modelos multivector representan distintas partes de una consulta o documento mediante varios vectores y comparan sus relaciones con mayor granularidad.
ColBERT propuso una arquitectura de interacción tardía que conserva representaciones por token y combina eficiencia con comparación fina. Google Research presentó después MUVERA, un método que aproxima similitud multivector mediante codificaciones de dimensión fija y permite recuperar candidatos con estructuras de búsqueda más eficientes antes del reranking exacto.
Consultar el artículo de ColBERT
Consultar MUVERA en Google Research
Esto no permite afirmar qué algoritmo exacto usa cada producto en cada consulta. Sí demuestra una tendencia: la recuperación puede evaluar unidades más pequeñas y relaciones más detalladas que una coincidencia a nivel de página completa.
La recuperación híbrida combina precisión léxica y cobertura semántica
Una arquitectura híbrida ejecuta búsquedas léxicas y densas, fusiona sus resultados y aplica una etapa adicional de selección. Esta combinación evita depender exclusivamente de coincidencias literales o similitud vectorial.
Consulta
├── canal léxico → coincidencias exactas, nombres, códigos y términos raros
├── canal denso → significados, paráfrasis y conceptos relacionados
└── canal estructurado → entidades, precios, ubicación, disponibilidad o relaciones
↓
fusión de candidatos
↓
reranking Por qué el SEO clásico continúa siendo necesario
Las palabras clave siguen ayudando al sistema y a las personas a identificar tema, categoría y alcance. Los títulos, encabezados, enlaces y nombres de entidades aportan señales explícitas que también mejoran la comprensión humana.
Abandonar el vocabulario utilizado por el mercado puede debilitar el canal léxico. La solución no consiste en repetir frases artificialmente, sino en nombrar con precisión la necesidad y explicarla con suficiente cobertura semántica.
Por qué el lenguaje natural también importa
La recuperación densa puede conectar variaciones que una lista de sinónimos no cubriría de manera eficiente. Esto favorece contenido que explica relaciones, escenarios, diferencias y condiciones utilizando lenguaje natural.
Una página sobre AEO no debería limitarse a repetir "agencia AEO Chile". Debe explicar qué problema resuelve, cómo se implementa, qué señales analiza, qué métricas utiliza y en qué se diferencia de SEO o GEO.
¿Qué es RAG y qué función cumple en AI Search?
Retrieval-Augmented Generation (RAG) combina un modelo generativo con información recuperada desde una memoria o fuente externa. En lugar de responder únicamente desde los parámetros aprendidos durante el entrenamiento, el sistema incorpora contexto obtenido para la consulta actual.
El trabajo fundacional de Lewis y colaboradores describió modelos que combinan memoria paramétrica con una memoria no paramétrica recuperable. El concepto evolucionó y hoy "RAG" se utiliza para varias arquitecturas de recuperación y generación, no para una implementación única.
Consultar el trabajo original sobre RAG
Arquitectura de referencia de un sistema RAG
- Ingestión: recopila documentos, páginas, datos o archivos autorizados.
- Limpieza: elimina ruido, navegación repetida y contenido innecesario.
- Segmentación: divide los recursos en chunks o pasajes.
- Representación: genera índices léxicos, vectores y metadatos.
- Consulta: interpreta la pregunta y sus restricciones.
- Recuperación: encuentra candidatos potencialmente útiles.
- Reranking: reordena candidatos con un modelo más preciso.
- Context packing: selecciona qué evidencia entra en la ventana del modelo.
- Generación: redacta la respuesta utilizando el contexto disponible.
- Atribución: conecta afirmaciones con fuentes cuando el producto lo permite.
RAG mejora el acceso a información actual, pero no garantiza exactitud
Un sistema RAG puede recuperar una fuente equivocada, obsoleta o manipulada. También puede interpretar mal un pasaje correcto, mezclar condiciones incompatibles o colocar una cita que no respalda exactamente la frase generada.
RAG reduce algunas limitaciones de los modelos que responden únicamente desde conocimiento aprendido, pero no elimina alucinaciones ni sustituye revisión, calidad de fuentes o controles de seguridad.
El contexto disponible tiene un presupuesto
Un sistema no puede utilizar todo lo recuperado con la misma profundidad. Debe asignar espacio y costo a ciertos pasajes. LOBIK denomina presupuesto de recuperación al conjunto de límites prácticos que condicionan cuántas consultas, fuentes, tokens y ciclos de validación puede utilizar una respuesta.
Este concepto ayuda a explicar por qué la claridad importa. Si una fuente necesita cinco párrafos para expresar un hecho que otra demuestra en uno, la segunda puede ser más eficiente para construir contexto, siempre que conserve precisión y alcance.
"Presupuesto de recuperación" es un marco operativo de LOBIK, no una métrica oficial publicada por Google u otra plataforma.
El chunking determina qué unidades pueden recuperarse
Chunking es el proceso de dividir un recurso en unidades que puedan indexarse, compararse y recuperarse. Un chunk demasiado pequeño pierde contexto; uno demasiado grande mezcla intenciones y consume más espacio del necesario.
No existe una longitud universal. La unidad adecuada depende del contenido:
| Tipo de información | Unidad recuperable recomendable |
|---|---|
| Definición | Término, respuesta directa, alcance y diferencia principal |
| Procedimiento | Objetivo, prerrequisitos, pasos y resultado esperado |
| Comparación | Criterio, alternativas, diferencias y conclusión condicionada |
| Dato estadístico | Cifra, universo, periodo, fuente y limitación |
| Servicio | Problema, solución, proceso, entregable y condición comercial |
| Producto | Nombre, atributos, disponibilidad, precio y restricciones |
Un encabezado no crea automáticamente un buen chunk
La etiqueta H2 o H3 ayuda a delimitar la sección, pero el texto debe conservar significado si se extrae parcialmente. Frases como "como explicamos más arriba" o "esta solución" pueden volverse ambiguas cuando el pasaje aparece sin su contexto original.
El método P.A.S.A.J.E. de LOBIK ayuda a diseñar unidades recuperables:
- Pregunta o intención: define la necesidad de la sección.
- Answer first: entrega la conclusión en la primera oración.
- Sujeto, verbo y objeto: expresa relaciones sin pronombres ambiguos.
- Autoridad: agrega fuente, responsable o evidencia.
- Jerarquía: utiliza encabezados, listas y tablas con dependencia real.
- Entidades: nombra empresas, tecnologías, servicios y lugares.
P.A.S.A.J.E. es una metodología editorial; no constituye un requisito oficial de los motores ni garantiza citación.
Query fan-out expande una pregunta en múltiples rutas de recuperación
Query fan-out es una técnica mediante la cual un sistema genera y ejecuta varias búsquedas relacionadas para responder una necesidad compleja. Google confirma públicamente que AI Overviews y AI Mode pueden utilizar esta técnica sobre subtemas y fuentes de datos.
Consultar la documentación oficial de Google sobre query fan-out
La consulta visible funciona como una semilla. El sistema puede identificar entidades, restricciones y vacíos; después crea subconsultas que exploran distintas ramas.
[Agencia para posicionar una empresa en Google e IA en Chile]
├── Agencia SEO técnico Chile ────────┐
├── Agencia AEO y GEO Chile ────────┤
├── Medición de visibilidad en ChatGPT ────────┼──► Conjunto de fuentes candidatas
├── Desarrollo web Headless para SEO ────────┤ │
├── Casos, metodología y evidencia ────────┤ ▼
└── Cobertura, precio y contratación ────────┘ Selección y síntesis La cantidad y el contenido de las ramas no son fijos. Dependen de la plataforma, la consulta, el contexto, la disponibilidad de fuentes y el costo que el sistema asigne a la búsqueda.
La intención latente representa necesidades no expresadas directamente
La intención latente es una necesidad que el sistema infiere a partir del prompt, la categoría y el recorrido probable del usuario. Si una persona pregunta por una agencia, puede necesitar conocer metodología, experiencia, ubicación, precios, capacidad técnica o forma de medir resultados aunque no lo haya escrito.
Clasificación de tarea
El sistema puede interpretar si la persona quiere una definición, comparación, recomendación, procedimiento, diagnóstico o acción. Esa clasificación influye en el formato y las fuentes apropiadas.
Identificación de slots
Un slot es una variable necesaria para completar una respuesta útil. Para elegir una agencia de AI Search, los slots podrían ser:
- país o cobertura;
- tipo y tamaño de empresa;
- problema actual;
- plataformas prioritarias;
- capacidades requeridas;
- presupuesto;
- evidencia y metodología;
- plazo y modelo de trabajo.
Algunos slots aparecen en el prompt. Otros permanecen vacíos y pueden generar búsquedas adicionales o preguntas de aclaración.
Reescrituras y subpreguntas
Una plataforma puede crear paráfrasis, consultas más específicas, preguntas comparativas o búsquedas orientadas a fuentes. OpenAI documenta que ChatGPT Search puede reescribir una pregunta en una o más consultas dirigidas a proveedores de búsqueda. Google documenta query fan-out en sus funciones de IA.
Consultar cómo ChatGPT Search utiliza consultas dirigidas
No debe asumirse que todas las plataformas generan el mismo número de consultas ni que exponen esas consultas al usuario.
Las subconsultas se enrutan hacia fuentes y modalidades diferentes
El enrutamiento decide dónde y cómo buscar cada parte de la necesidad. Una definición puede resolverse con documentación primaria; una ubicación necesita datos locales; un precio requiere una fuente comercial actual; un procedimiento puede beneficiarse de texto, vídeo y transcripción.
| Clase de necesidad | Fuentes potenciales | Formatos útiles |
|---|---|---|
| Definición técnica | Documentación, estándares, artículos académicos | Respuesta breve, glosario y diagrama |
| Comparación | Páginas de producto, documentación y análisis | Tabla con criterios equivalentes |
| Información local | Perfil de negocio, mapas y página de ubicación | Dirección, cobertura, horario y contacto |
| Producto | Página de producto, feed y plataforma comercial | Atributos, precio, stock, imagen y oferta |
| Procedimiento | Guía experta y documentación oficial | Pasos, requisitos, advertencias y vídeo |
| Evidencia | Estudio, caso, base de datos o informe | Metodología, muestra, fecha y resultado |
| Selección de proveedor | Servicios, casos, directorios y reseñas | Criterios, capacidades, pruebas y límites |
La paridad multimodal amplía puntos de entrada
Una idea importante puede representarse en texto, tabla, imagen, vídeo, audio o datos estructurados. Eso no obliga a duplicar contenido sin propósito. Significa que la información crítica debería estar disponible en una forma accesible para personas y sistemas.
Un vídeo debe tener título, descripción y transcripción. Una tabla relevante no debería existir únicamente dentro de una imagen. Un PDF importante necesita texto seleccionable y una página HTML que describa su contenido.
La recuperación puede cruzar idiomas sin eliminar la necesidad de localizar
Una consulta y la fuente recuperada no siempre están escritas en el mismo idioma. Las representaciones multilingües pueden acercar preguntas y documentos semánticamente relacionados, pero nombres, precios, cobertura, regulación y vocabulario comercial deben conservar el contexto del mercado al que corresponden.
Para una empresa que opera en Chile, traducir automáticamente una página global no sustituye una versión localizada. La página debería indicar en español qué ofrece la entidad, dónde opera, en qué moneda cotiza, qué condiciones aplica y qué términos utiliza realmente su audiencia. Esta precisión reduce ambigüedades durante la recuperación y evita que una respuesta combine datos de países o servicios diferentes.
La agregación de fuentes construye un conjunto común de candidatos
La agregación reúne resultados procedentes de diferentes consultas, índices y modalidades. Antes de generar una respuesta, el sistema puede fusionar puntuaciones, eliminar duplicados y limitar la concentración de información proveniente de una sola fuente.
Fusión
Los puntajes léxicos, vectoriales y estructurados no son directamente equivalentes. El sistema necesita normalizarlos o utilizar métodos de combinación para construir un conjunto común.
Deduplicación
Varias URLs pueden repetir el mismo comunicado, ficha o texto sindicado. La deduplicación reduce candidatos idénticos o casi idénticos y evita desperdiciar contexto.
Diversidad
Una respuesta puede requerir perspectivas o fuentes distintas. La diversidad ayuda a evitar que diez páginas equivalentes ocupen todo el conjunto de evidencia.
Corroboración
La coincidencia entre fuentes independientes puede aumentar confianza en una afirmación. Esto no convierte automáticamente el consenso en verdad, pero ayuda a detectar contradicciones y afirmaciones aisladas.
El reranking decide qué candidatos merecen una evaluación más profunda
Reranking reordena un conjunto reducido de candidatos utilizando una comparación más costosa y contextual. La primera recuperación privilegia velocidad y cobertura; el reranker puede analizar con mayor detalle la relación entre consulta y pasaje.
Un sistema puede aplicar varias capas:
- recuperación rápida de cientos o miles de candidatos;
- fusión de canales y eliminación de duplicados;
- reranking contextual de un conjunto menor;
- selección de evidencia para el contexto final.
La página no compite solamente contra otras páginas. Cada pasaje puede competir contra pasajes de documentos diferentes que resuelven una parte específica de la necesidad.
¿Qué hace seleccionable un pasaje para la síntesis?
Un pasaje seleccionable combina pertinencia, autonomía, evidencia y alcance claro. La información debe poder reutilizarse sin perder las condiciones que determinan cuándo es válida.
Extractabilidad
El pasaje puede separarse del resto de la página y conserva sujeto, tema y conclusión. Una tabla con encabezados descriptivos resulta más reutilizable que una secuencia visual sin etiquetas.
Densidad de evidencia
La sección aporta datos, definiciones o relaciones útiles sin rodeos. Densidad no significa comprimir hasta perder matices; significa ubicar la información principal antes de la explicación secundaria.
Claridad de alcance
La afirmación especifica país, periodo, tipo de empresa, versión, condiciones o excepciones cuando son relevantes.
Autoridad y trazabilidad
El sistema y el lector pueden identificar quién publica, quién revisa y qué fuente sostiene una afirmación. La autoridad debe demostrarse, no declararse mediante adjetivos absolutos.
Actualidad y estabilidad
Un contenido fechado permite evaluar vigencia. La fecha no debe cambiar automáticamente en cada compilación; debe reflejar una revisión sustantiva.
Seguridad
Las áreas médicas, financieras, legales o de seguridad requieren controles más estrictos. Una respuesta fácil de extraer no debe omitir riesgos, límites o necesidad de asesoría profesional.
Ejemplo completo: cómo podría procesarse una consulta sobre LOBIK
El siguiente escenario ilustra una arquitectura posible; no afirma revelar los algoritmos internos de ninguna plataforma.
Consulta inicial:
Necesito una empresa en Chile que mejore la visibilidad de mi marca en Google y motores de IA, y que también pueda reconstruir mi sitio web.
1. Interpretación
El sistema identifica:
- territorio: Chile;
- tipo de proveedor: empresa o agencia;
- objetivos: visibilidad en buscadores y motores generativos;
- capacidad adicional: desarrollo o migración web;
- intención: comercial y comparativa.
2. Fan-out
Podría generar búsquedas sobre:
- agencia SEO técnico Chile;
- agencia AEO y GEO Chile;
- desarrollo web Headless para empresas;
- auditoría de visibilidad en ChatGPT y AI Overviews;
- empresas que integran marketing y tecnología;
- metodología, casos y formas de medición.
3. Recuperación
El sistema puede recuperar páginas de servicio de LOBIK, páginas de competidores, directorios, artículos, perfiles empresariales y casos. Una misma URL no necesita responder todas las ramas si existe un clúster bien conectado.
4. Selección
Los pasajes que expliquen qué hace LOBIK, cómo trabaja, qué entrega, dónde opera y cómo mide resultados compiten con información equivalente de otras empresas.
5. Síntesis
El sistema podría considerar a LOBIK como una opción técnica si encuentra evidencia suficiente para conectar SEO, AEO, GEO y desarrollo Headless. Podría omitirla si solo encuentra lenguaje general, información contradictoria o menos evidencia pública que para otros proveedores.
6. Atribución
La respuesta puede mencionar LOBIK, citar su página, enlazar una fuente externa o no mostrar atribución visible. Estas cuatro situaciones deben registrarse por separado.
Cómo diseñar una arquitectura de contenido para el fan-out
Una arquitectura preparada para fan-out distribuye una intención amplia entre una página pilar y páginas especializadas conectadas. No crea cientos de URLs con variaciones mínimas ni obliga a una sola página a cubrir todo superficialmente.
Para el ejemplo anterior, el clúster puede incluir:
| Rama de intención | Fuente canónica de LOBIK |
|---|---|
| Marketing orgánico y descubrimiento | /agencia/marketing-chile |
| SEO técnico y crecimiento | /agencia/seo-avanzado |
| AEO y GEO | /servicios/aeo-geo-chile |
| Answer Engine Optimization | /agencia/answer-engine-optimization |
| Generative Engine Optimization | /agencia/generative-engine-optimization |
| Web corporativa Headless | /servicios/sitio-web-corporativo |
| Medición de visibilidad | /como-medir-visibilidad-en-ia |
| Diagnóstico técnico | /auditoria-retrieval-readiness |
Cada página necesita una función diferenciada. El enlazado debe expresar relaciones reales, no repetir todos los enlaces en todos los párrafos.
Fallos frecuentes en una arquitectura RAG
La calidad de la respuesta depende de toda la cadena; un modelo avanzado no corrige automáticamente una recuperación deficiente.
Retrieval miss
La fuente correcta existe, pero no entra al conjunto de candidatos. Puede deberse a acceso, vocabulario, segmentación, representación o falta de cobertura.
Chunk sin contexto
El pasaje contiene la respuesta, pero perdió fecha, sujeto o condición durante la segmentación. La síntesis puede aplicarlo fuera de alcance.
Reranking equivocado
Un pasaje superficial recibe una puntuación mayor que una fuente más completa. La similitud no siempre captura utilidad o verdad.
Evidencia contradictoria
Varias fuentes entregan precios, fechas o definiciones diferentes. El sistema puede elegir una, combinar datos incompatibles o expresar incertidumbre.
Context poisoning
Contenido manipulado o incorrecto entra al contexto. La generación puede amplificarlo si no existen controles de confianza y corroboración.
Context overflow
La recuperación obtiene demasiada información y parte de la evidencia relevante queda fuera del contexto final o recibe poca atención.
Error de síntesis
Citation mismatch
La cita visible no respalda exactamente la frase generada. Una auditoría debe revisar correspondencia, no solo presencia del enlace.
Métricas para evaluar recuperación y fan-out
Las métricas deben observar cada etapa antes de atribuir el resultado a "la IA".
| Métrica | Qué evalúa |
|---|---|
| Index Coverage | Porcentaje de URLs objetivo accesibles e indexadas donde corresponde |
| Branch Coverage | Porcentaje de ramas de intención cubiertas por fuentes propias |
| Subquery Recall | Presencia de la marca o página en subconsultas simuladas |
| Passage Eligibility | Porcentaje de secciones con intención, respuesta, alcance y evidencia |
| Retrieval Rate | Frecuencia con que una fuente entra al conjunto observable |
| Citation Rate | Frecuencia con que recibe una cita visible |
| Citation Accuracy | Correspondencia entre afirmación generada y fuente citada |
| Entity Accuracy | Exactitud con que se describe la empresa, servicio o producto |
| Stability | Persistencia entre ejecuciones comparables |
| Assisted Conversion | Visitas, contactos o acciones asociadas con AI Search |
Algunas métricas internas de las plataformas no son observables desde fuera. En esos casos se utilizan pruebas controladas y aproximaciones, claramente etiquetadas como tales.
Checklist técnico y editorial
Acceso e indexación
- Las URLs canónicas responden con estado 200.
- Robots.txt y el CDN permiten los agentes autorizados.
- El contenido principal existe en HTML procesable.
- Canonical, sitemap y enlaces internos son coherentes.
- No existen versiones contradictorias de la misma entidad.
Representación
- Cada página posee una intención principal.
- Los títulos y encabezados utilizan vocabulario real del mercado.
- Las entidades se nombran de manera explícita.
- Tablas, imágenes y vídeos poseen contexto textual.
- Los datos estructurados coinciden con el contenido visible.
Pasajes
- Cada sección entrega primero su respuesta principal.
- Los pronombres no vuelven ambiguo el sujeto al extraer el fragmento.
- Fechas, territorios y condiciones aparecen cuando corresponden.
- Las afirmaciones importantes incluyen evidencia cercana.
- La longitud conserva contexto sin mezclar varias intenciones.
Fan-out
- Se mapearon criterios, objeciones y subpreguntas.
- Las ramas prioritarias poseen una fuente canónica.
- El clúster evita canibalización entre URLs equivalentes.
- Los formatos responden a la modalidad de la necesidad.
- Los enlaces conectan conceptos, servicios, evidencia y conversión.
Medición
- Existe un banco de prompts y subconsultas versionado.
- Se registra motor, fecha, modelo, sesión y ubicación.
- Mención, recuperación, cita y precisión se separan.
- Las pruebas se repiten con competidores equivalentes.
- Cada hallazgo se traduce en una hipótesis verificable.
Qué no debes hacer
- Declarar que una arquitectura hipotética describe exactamente a todas las plataformas.
- Abandonar keywords porque existen embeddings.
- Repetir términos sin explicar entidades y relaciones.
- Dividir cada párrafo en chunks arbitrarios sin continuity.
- Crear una URL por cada subconsulta del fan-out.
- Publicar tablas o datos únicamente dentro de imágenes.
- Suponer que RAG elimina alucinaciones.
- Confundir similitud vectorial con autoridad o exactitud.
- Agregar fechas automáticas para simular frescura.
- Presentar una cita como prueba de recomendación permanente.
- Afirmar que ChatGPT depende de un único proveedor o índice sin evidencia vigente.
- Utilizar schema para declarar información ausente o no verificable.
Preguntas frecuentes sobre arquitectura RAG y query fan-out
¿Qué significa RAG?
RAG significa Retrieval-Augmented Generation o generación aumentada mediante recuperación. Combina un modelo generativo con información recuperada desde fuentes externas para construir una respuesta con contexto actualizado o específico.
¿RAG elimina las alucinaciones?
No. Puede reducir errores derivados de información ausente o desactualizada, pero una recuperación incorrecta, una fuente deficiente o una mala síntesis todavía pueden producir afirmaciones falsas.
¿Qué diferencia existe entre búsqueda léxica y semántica?
La búsqueda léxica compara términos y estadísticas del texto. La búsqueda semántica utiliza representaciones vectoriales para recuperar contenido relacionado por significado, incluso cuando no utiliza las mismas palabras.
¿Qué es una recuperación híbrida?
Es la combinación de búsqueda léxica, semántica y, cuando corresponde, fuentes estructuradas. Sus candidatos se fusionan y pueden pasar por reranking antes de la síntesis.
¿Por qué se describe RAG como un embudo?
Porque el sistema comienza con un índice inmenso, recupera un conjunto de miles de candidatos, selecciona unos pocos tras un reranking y sintetiza la respuesta con un grupo todavía menor de pasajes.
¿Qué es query fan-out?
Es la generación y ejecución de múltiples subconsultas a partir de un prompt inicial para explorar distintos aspectos de una necesidad compleja.
¿Por qué una página indexada no aparece en la respuesta?
Puede deberse a que no coincide con las subconsultas del fan-out, tiene una puntuación baja en el reranking, carece de información extraíble o no aporta evidencia complementaria a otras fuentes elegidas.
¿Por qué es importante el chunking?
Porque determina la unidad de información que el sistema evaluará y recuperará. Un mal chunking pierde el contexto o mezcla respuestas incompatibles, lo que debilita la posición de la fuente en el reranking.