Saltar al contenido
Sitio web y marketing

Por qué su sitio no aparece en las respuestas de las IAs

Un motor de respuestas no busca la mejor página: busca el párrafo que puede copiar sin equivocarse.

Publicado 10 min de lectura Navhera

Cada vez más gente resuelve dudas preguntándole a ChatGPT, a Perplexity o al resumen que Google pone arriba de los resultados. Esas respuestas citan páginas. Y muchas empresas que tenían un sitio decentemente posicionado descubren que en esas respuestas no aparecen nunca.

No es mala suerte ni un algoritmo secreto. Es que el trabajo es distinto, y conviene separar tres cosas que suelen mezclarse en la misma factura.

SEO, AEO y GEO no son lo mismo

Qué persigueQué gana
SEO
Aparecer en la lista de resultadosUn clic hacia su sitio
AEO
Ser la respuesta que el buscador muestra arribaVisibilidad, a veces sin clic
GEO
Ser citado dentro de una respuesta generadaUna mención con enlace, y crédito de autoridad

La diferencia práctica es esta: un buscador clásico decide qué página mostrar; un motor de respuestas decide qué frase copiar. Optimizar para lo primero es hacer que la página sea buena. Optimizar para lo segundo es hacer que haya, dentro de la página, un párrafo que se pueda extraer sin equivocarse.

Lo que tiene que pasar para que una IA cite su página

Con distintas mecánicas, todos los motores de respuesta necesitan lo mismo. Y falla en el orden en que aparece.

1 · Que puedan entrar

Los rastreadores de los motores de respuesta son distintos de los de los buscadores, y muchos sitios los bloquean sin saberlo —a veces por una configuración heredada, a veces porque un cortafuegos los trata como tráfico raro.

Si quiere que le citen, esos rastreadores tienen que estar permitidos explícitamente en el robots.txt. Y conviene decidirlo a conciencia, porque hay dos familias distintas: los que buscan en vivo para responder una pregunta —los que dan visibilidad— y los que recogen contenido para entrenar modelos. Se pueden permitir unos y no otros.

2 · Que puedan leer sin ejecutar nada

Esta es la causa más común y la más cara de arreglar tarde.

Muchos sitios modernos entregan un documento casi vacío y construyen el contenido en el navegador con JavaScript. Los buscadores grandes tienen capacidad de ejecutarlo; varios rastreadores de motores de respuesta, no, o no de forma fiable. Si su contenido solo existe después de ejecutar código, para ellos su página está en blanco.

Es comprobable en diez segundos sin herramientas: abra el código fuente de la página —no el inspector, el código fuente— y busque un párrafo de su texto. Si no está ahí, tampoco está para quien no ejecuta JavaScript.

3 · Que la afirmación se sostenga sola

Un motor de respuestas extrae fragmentos. Un párrafo que empieza con «esto» o «como decíamos antes» no se puede extraer: fuera de contexto no significa nada, y el sistema prefiere una fuente que no lo obligue a adivinar.

De ahí una regla de redacción que suena tonta y funciona: que cada afirmación importante repita su sujeto. No «cuesta unos 50 dólares», sino «una licencia anual de X cuesta unos 50 dólares». La segunda se puede citar; la primera, no.

4 · Que la pregunta esté escrita en la página

La gente le pregunta a una IA en la forma en que hablaría con una persona: «¿cuánto cuesta poner un bot de WhatsApp en mi restaurante?». Una página que titula esa sección «Nuestras soluciones de mensajería» no está compitiendo por esa pregunta.

Poner la pregunta literal como encabezado, y debajo la respuesta directa en dos o tres frases, es la técnica más simple y la que más rinde. El resto del apartado puede explicar, matizar y dar contexto: eso ya no estorba una vez que la respuesta está arriba.

5 · Que las entidades estén definidas

Los sistemas que generan respuestas trabajan con entidades: empresas, productos, lugares, conceptos. Si su empresa se llama distinto en el sitio, en el perfil del negocio, en LinkedIn y en un directorio, esas menciones no se consolidan en una sola entidad. Nombre, dirección y teléfono idénticos en todas partes valen más que cualquier ajuste fino de palabras clave.

Un detalle que se pasa por alto: muchas empresas tienen dos direcciones legítimas —la del domicilio social inscrito y la de donde de verdad se trabaja— y las usan indistintamente. Para una máquina son dos entidades. Hay que elegir una para el directorio, el perfil del negocio y el sitio, y usar esa siempre.

Los datos estructurados ayudan a lo mismo: le dicen a una máquina qué es cada cosa en lugar de dejar que lo deduzca.

6 · Que haya algo que citar

Una IA cita porque necesita respaldar una afirmación. Las páginas que se citan son las que tienen definiciones claras, comparaciones honestas, cifras con fuente y criterio propio. Una página que solo dice que su empresa es líder no le sirve a nadie para respaldar nada.

Sobre el archivo llms.txt

Va a oír que hay que poner un archivo llms.txt en la raíz del sitio para que las IAs lo entiendan mejor. Conviene decirlo con precisión.

llms.txt es una convención propuesta, no un estándar adoptado: el propio proyecto que la mantiene se describe como «una propuesta para estandarizar» el uso de ese archivo, y no la respalda ningún organismo de normalización. Ponerlo cuesta poco y no hace daño; venderlo como la palanca que le va a conseguir citas es exagerado.

Hay un argumento que va a escuchar a favor y que conviene saber desarmar: «pero si OpenAI, Anthropic y Google publican su propio llms.txt». Es cierto, y no prueba lo que parece. Publicar un archivo para que otros lo lean no es lo mismo que comprometerse a leer el de los demás, que es lo que a usted le interesa. Antes de gastar en esto, pregunte por lo segundo y no por lo primero.

La palanca sigue siendo tener contenido legible sin ejecutar código y afirmaciones que se sostengan solas.

Lo que hicimos en este sitio

Sirve de ejemplo comprobable, porque lo puede verificar usted mismo ahora:

  • Todo el HTML se genera al construir. Este artículo está completo en el código fuente. Las versiones en inglés y francés del sitio también son páginas estáticas de verdad, no traducciones que ocurren en el navegador.
  • Los rastreadores de motores de respuesta están permitidos por nombre en el robots.txt, y separados de los de entrenamiento para poder decidir sobre cada grupo.
  • Cada página declara sus datos estructurados, y las preguntas frecuentes del dato estructurado se generan del texto visible, de modo que no puedan decir una cosa distinta de la que lee una persona. Si un artículo no trae preguntas, no se declara la ficha: una ficha vacía es peor que ninguna.
  • Un solo idioma por dirección, con las alternativas declaradas entre sí — y solo cuando la traducción existe de verdad. Un artículo que solo está en español no anuncia versiones que no existen.

Sobre el alcance de este artículo. Lo que hay aquí es criterio técnico y decisiones verificables sobre cómo se construye un sitio legible para un motor de respuestas. Cada afirmación técnica que hacemos sobre este sitio se puede comprobar abriendo su código.

En qué orden arreglarlo

  1. Compruebe que su contenido está en el código fuente. Si no lo está, todo lo demás es decoración.
  2. Revise el robots.txt y decida a conciencia qué rastreadores entran.
  3. Reescriba los encabezados como preguntas reales y ponga la respuesta directa debajo.
  4. Unifique el nombre y los datos de contacto en todas partes, incluida la dirección.
  5. Añada datos estructurados que describan lo que la página muestra de verdad.
  6. Publique algo que valga la pena citar. Es lo más lento y lo único que no se puede sustituir.

Los cinco primeros son trabajo técnico de alcance conocido: se revisan, se arreglan y se comprueba que quedaron arreglados. Es exactamente lo que hace la división de estudio cuando revisa un sitio, y sale de ahí una lista de lo que está mal, ordenada por lo que más pesa, con lo que cuesta cada cosa al lado.

El sexto no lo resuelve ninguna herramienta, y es el que decide si su sitio termina citado o no. Publicar algo que valga la pena citar es un trabajo editorial sostenido: elegir las preguntas que su cliente hace de verdad, responderlas mejor que quien ya está ahí, y hacerlo con la constancia suficiente para que un motor lo tome en serio. También lo hacemos, y este blog es lo que sale de aplicarnos el método a nosotros mismos: puede juzgarlo leyendo.

Si quiere saber en qué estado está su sitio antes de decidir nada, la revisión de los cinco puntos técnicos es una reunión de treinta minutos, sin costo y sin obligación de contratar.

Preguntas frecuentes

¿Cómo hago para que ChatGPT cite mi sitio web?

Hacen falta tres condiciones. Que los rastreadores de motores de respuesta puedan entrar, lo que se declara en el robots.txt. Que el contenido esté en el HTML sin necesidad de ejecutar JavaScript, porque varios de esos rastreadores no lo ejecutan de forma fiable. Y que haya párrafos que se sostengan fuera de contexto, con el sujeto repetido, para que se puedan extraer sin ambigüedad. Ninguna herramienta sustituye tener algo que valga la pena citar.

¿Qué diferencia hay entre SEO, AEO y GEO?

El SEO busca aparecer en la lista de resultados de un buscador y ganar un clic. El AEO busca ser la respuesta destacada que el buscador muestra arriba, aunque no haya clic. El GEO busca ser citado dentro de una respuesta generada por un sistema de IA. El primero premia que la página sea buena; los otros dos premian que dentro de la página haya una frase extraíble sin equivocarse.

¿Sirve de algo poner un archivo llms.txt?

Es una convención propuesta, no un estándar adoptado: el propio proyecto que la mantiene se describe como una propuesta, y no la respalda ningún organismo de normalización. Que OpenAI, Anthropic o Google publiquen el suyo no significa que lean el de usted, que es lo que le interesaría. Ponerlo cuesta poco y no hace daño, pero no sustituye lo que sí funciona: contenido legible sin ejecutar JavaScript y afirmaciones que se sostengan solas.

¿Mi sitio hecho con JavaScript puede ser citado por una IA?

Solo si el contenido llega ya escrito en el HTML. Abra el código fuente de la página y busque un párrafo de su texto: si no aparece ahí, la página está en blanco para cualquier rastreador que no ejecute JavaScript, y varios de los que alimentan a los motores de respuesta no lo hacen de forma fiable.

Fuentes y notas

  1. Las decisiones técnicas descritas en el apartado «lo que hicimos en este sitio» son verificables directamente en navhera.com.
  2. llmstxt.org, proyecto que mantiene la especificación de llms.txt y que la describe como una propuesta de estandarización. Ningún organismo de normalización la ha adoptado.
  3. Los nombres de los rastreadores que este sitio permite o separa están en su propio robots.txt, comentados uno por uno. Los operadores de esos rastreadores publican sus nombres y su comportamiento en su documentación; conviene consultarla, porque cambian.
  4. Artículo marcado como semiperenne: los motores de respuesta cambian de comportamiento con frecuencia. Revisión a los seis meses.

Escrito por el equipo de Navhera y revisado antes de publicar. Si encuentra un error, escríbanos y lo corregimos con nota de la corrección.