RAG en empresa: que las IAs encuentren y citen tu marca

Casi todos los proyectos de RAG en empresa se plantean hacia dentro: un asistente que responda sobre manuales, tarifas y politicas. Mientras tanto hay otro RAG funcionando sobre tu negocio sin que lo hayas montado tu: el de ChatGPT, Perplexity, Gemini y los resumenes de Google. Ese recupera tu contenido publico y decide, cada dia, si te cita a ti o a tu competencia.

Tu RAG interno y el de ChatGPT hacen lo mismo

RAG significa recuperar antes de responder. El sistema parte los documentos en fragmentos, los indexa por significado, busca los trozos que encajan con la pregunta y solo entonces redacta. La generacion es la parte visible. La recuperacion es la que decide si sales o no sales.

Un buscador generativo hace exactamente eso con la web abierta. Tu sitio es un documento mas dentro de su corpus. Si tus paginas se fragmentan mal, si una respuesta necesita tres scrolls de contexto para entenderse, ese fragmento pierde frente a otro que dice lo mismo en cuatro lineas limpias.

De ahi la conclusion practica: preparar el corpus de tu RAG interno y preparar tu contenido para GEO es el mismo trabajo tecnico hecho sobre materiales distintos. Quien hace uno bien tiene medio camino del otro.

Un fragmento recuperable no es un texto bonito

El criterio no es estilistico, es de aislamiento. Cada bloque de tu pagina tiene que sostenerse solo, porque el modelo casi nunca ve la pagina entera: ve el trozo que el buscador semantico ha seleccionado.

Esto cambia como escribes. Nada de 'como comentabamos antes'. Nada de pronombres que apuntan a un parrafo que el modelo no ha recibido. El sujeto, la marca y el producto se nombran completos, aunque suene repetitivo al leerlo de corrido.

  • H2 en forma de pregunta real, y la respuesta en las dos primeras frases debajo.
  • Definiciones cortas antes de los matices. Primero que es, luego los peros.
  • Cifras con unidad y fecha en la misma frase, no repartidas por el parrafo.
  • Tablas para comparativas: se fragmentan mejor que tres parrafos de prosa.
  • Nombra la entidad completa: 'RAG en empresa', no 'esta tecnologia'.

Datos estructurados: metadatos para el indice de otros

En un RAG interno nadie discute que cada documento lleve metadatos: version, area, fecha, responsable. Sin eso el sistema recupera la tarifa de hace dos anos y la da por buena. En tu web ese papel lo juega el marcado con Schema.org.

El minimo util es concreto: Organization con sameAs apuntando a tus perfiles reales, Article con author y dateModified, FAQPage en las paginas que responden preguntas, y Product o Service donde vendas algo. No es magia de posicionamiento; es reducir la ambiguedad sobre quien eres y de cuando es el dato.

Anade el mismo criterio de higiene que aplicarias a un corpus interno: fechas de actualizacion visibles, una sola URL canonica por tema y contenido obsoleto retirado o marcado. Un corpus con tres versiones contradictorias del mismo precio produce respuestas malas dentro y fuera de casa.

Como saber si el RAG ajeno te esta usando

Esto se mide, no se intuye. Primero, los logs del servidor: mira si pasan GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended, con que frecuencia y por que URLs. Si un bloqueo antiguo en robots.txt los esta echando, tu contenido no entra en ningun indice generativo.

Segundo, el trafico de referencia. Las visitas que llegan desde chatgpt.com o perplexity.ai aparecen etiquetadas en analitica. Son pocas comparadas con las de buscador, pero indican que alguien te ha citado con enlace.

Tercero, la prueba manual. Coge las diez preguntas que de verdad hace tu cliente antes de comprar, lanzalas en varios asistentes y anota si apareces, con que frase y desde que pagina. Repite el mismo listado cada mes. Ese registro vale mas que cualquier estimacion de visibilidad.

Donde encaja el RAG en el resto de tu operacion

El RAG rara vez vive solo. Suele ser la capa de conocimiento sobre la que se apoyan asistentes y automatismos, y conviene decidir desde el principio que corpus alimenta a cada uno. Sobre como se organiza esa arquitectura interna, en Potenciado lo explican en la arquitectura de una empresa con agentes, y en All ITs AI hay un repaso de casos concretos en 20 agentes IA que tu empresa necesita en 2026.

Si el uso es cara al cliente, el ejemplo de chatbot con stock, leads y postventa en automocion de Agent Hub muestra bien la parte operativa.

Desde el lado de visibilidad la pregunta que hay que sostener es otra y es mas simple: de todo lo que tu RAG interno sabe, ¿que parte deberia estar publicada, estructurada y fechada para que tambien la recupere la IA que usa tu cliente antes de llamarte?

Este tema tambien se trata, desde otro enfoque, en Potenciado · All ITs AI · Agent Hub.

El RAG en empresa se suele plantear como un proyecto de IA. Visto desde el posicionamiento es, sobre todo, un proyecto de orden documental con dos beneficiarios: tu asistente interno y el indice de quien decide si te cita. Si quieres saber por donde empezar en tu caso, en GEOySEO revisamos que parte de tu conocimiento ya es recuperable y cual se esta quedando invisible.

Preguntas frecuentes

¿Montar un RAG interno mejora mi posicionamiento?

No de forma directa. Google y los asistentes no ven tu indice privado. Lo que si mejora el posicionamiento es el trabajo previo: limpiar duplicados, fechar documentos, resolver contradicciones y escribir respuestas autocontenidas. Ese corpus saneado, cuando lo publicas, se recupera mucho mejor que la version anterior.

¿Hay que dejar pasar a GPTBot y a los demas rastreadores de IA?

Depende de tu modelo de negocio. Si vives de que te descubran, bloquearlos te deja fuera de las respuestas generativas y de sus citas con enlace. Si vendes acceso al contenido, tiene sentido restringir. Lo importante es que sea una decision consciente en robots.txt, revisada, y no un bloqueo heredado de hace anos que nadie ha vuelto a mirar.

¿Que contenido conviene publicar y cual dejar solo en el RAG interno?

Publica lo que responde preguntas previas a la compra: como funciona el servicio, plazos, requisitos, criterios de eleccion, comparativas, condiciones generales. Deja dentro lo que sea dato personal, precio negociado, procedimiento interno o informacion sujeta a confidencialidad. La regla practica: si un comercial lo contaria por telefono a un desconocido, deberia estar en la web y marcado con datos estructurados.

¿Como se mide si una IA me esta citando?

Con tres fuentes combinadas. Los logs del servidor te dicen que rastreadores de IA entran y por donde. La analitica te muestra las visitas de referencia desde chatgpt.com, perplexity.ai y similares. Y una bateria fija de preguntas reales, lanzada cada mes en varios asistentes, te dice si apareces, con que frase y desde que pagina. Guarda las respuestas para comparar la evolucion.