IA y proteccion de datos: que cambia en tu SEO y en tu GEO

La proteccion de datos parece un asunto solo legal. No lo es. Cada decision sobre cookies, consentimiento y datos personales cambia lo que mide tu analitica y lo que los modelos de IA pueden leer y citar de tu web. Eso es visibilidad, no papeleo.

Privacidad y visibilidad tiran del mismo hilo

El marco es conocido: RGPD (Reglamento UE 2016/679), LOPDGDD 3/2018 en España y, desde 2024, el Reglamento de IA (UE 2024/1689). Lo que casi nadie mira es el efecto colateral en posicionamiento.

Tres puntos de contacto directos. Uno: el consentimiento decide cuantos datos ves para optimizar. Dos: los datos estructurados que publicas para que te entiendan Google y los modelos generativos pueden contener datos personales. Tres: el fichero robots.txt decide si los bots de IA pueden leerte y, por tanto, citarte.

Ninguno de los tres se resuelve solo con un banner de cookies copiado de otra web.

El consentimiento decide los datos con los que optimizas

Si el usuario rechaza cookies, tu analitica deja de verlo. GA4 pierde sesiones, conversiones y atribucion. No baja el trafico: baja la medicion. Confundir las dos cosas lleva a decisiones de SEO tomadas sobre un agujero.

Desde marzo de 2024, quien use Google Ads o audiencias de GA4 con trafico del Espacio Economico Europeo necesita Consent Mode v2 correctamente implementado. Y el banner tiene que permitir rechazar con la misma facilidad con la que se acepta: es criterio sostenido de la AEPD, no una opinion.

La buena noticia es que el nucleo del SEO no depende de cookies. Estas fuentes siguen intactas aunque el usuario rechace todo:

  • Search Console: clics, impresiones, posicion media y consultas, sin cookies de por medio
  • Logs del servidor: rastreo real de Googlebot y de los bots de IA
  • Rank tracking externo: posiciones por keyword y por dispositivo
  • Auditorias tecnicas: indexacion, Core Web Vitals de campo agregados, enlaces internos

Datos estructurados: marca la entidad, no a las personas

El schema es lo que convierte tu web en una entidad legible para un buscador y para un modelo generativo. Tambien es, con frecuencia, una fuga de datos personales publicada en el HTML sin pensarlo.

Casos habituales: un LocalBusiness con el domicilio particular del autonomo, un Person con el movil personal del gerente, un Review con nombre y apellidos completos de un cliente que nunca autorizo esa publicacion. Todo eso es tratamiento de datos personales y necesita base juridica.

La regla practica: marca lo que identifica a la empresa y deja fuera lo que identifica a un individuo sin necesidad.

  • Organization o LocalBusiness con datos fiscales y de contacto profesionales, nunca privados
  • sameAs apuntando a los perfiles oficiales de la marca para reforzar la entidad
  • author como Person solo si esa persona firma publicamente y lo sabe
  • Review y testimonios con consentimiento documentado, o con el nombre reducido

La pagina de privacidad tambien construye confianza

El aviso legal y la politica de privacidad contienen exactamente lo que un motor usa para verificar quien eres: razon social, NIF, domicilio, forma de contacto y, si aplica, el delegado de proteccion de datos. Es informacion de identidad, y la identidad es la base de que te citen en una respuesta generativa.

Dos errores frecuentes. El primero, dejar esas paginas con datos que no coinciden con el resto de la web ni con tu ficha de Google Business Profile: incoherencia de entidad. El segundo, esconderlas o bloquearlas al rastreo. No hace falta que posicionen, pero deben ser accesibles y consistentes.

Es la version aburrida del E-E-A-T, y funciona: una empresa identificable y verificable se cita mas facil que una web anonima.

¿Bloqueas a los bots de IA o dejas que te citen?

Aqui la proteccion de datos se cruza de lleno con el GEO. Puedes controlar en robots.txt el acceso de agentes como GPTBot, ClaudeBot, PerplexityBot, CCBot, Applebot-Extended y Google-Extended.

Conviene entender que hace cada cosa. Google-Extended no cambia como te indexa el Buscador: controla el uso de tu contenido por los modelos de Google. Bloquear GPTBot o ClaudeBot no te penaliza en Google, pero reduce la probabilidad de que esos sistemas conozcan y mencionen tu marca.

Es una decision de negocio, no tecnica. Si vives de que te encuentren, bloquear todo es dispararte al pie. Si publicas datos sensibles o contenido de pago, hay zonas que si conviene cerrar.

Un enfoque razonable:

  • Abre el blog y las paginas de servicio a los bots de IA: ahi es donde quieres ser citado
  • Cierra areas privadas, paneles de cliente, buscadores internos y cualquier URL con parametros que expongan datos
  • Revisa que ningun formulario deje datos personales en URLs indexables
  • Comprueba en los logs quien te rastrea de verdad antes de escribir reglas a ciegas

La proteccion de datos bien planteada no frena tu SEO: lo ordena. Consentimiento que no destruya tu medicion, schema que identifique a la empresa sin exponer a las personas, y un robots.txt que decida a conciencia quien puede citarte. Si quieres una revision de como estan hoy esos tres puntos en tu web, en GEOySEO lo miramos contigo y te decimos que tocar primero.

Preguntas frecuentes

¿Bloquear los bots de IA me penaliza en Google?

No. Bloquear agentes como GPTBot, ClaudeBot o Google-Extended en robots.txt no afecta a como Googlebot indexa y posiciona tu web, porque son agentes distintos. Lo que pierdes es presencia en las respuestas de esos modelos: si no pueden leer tu contenido, no pueden citarlo ni conocer tu marca. La penalizacion no es de ranking, es de visibilidad en el canal generativo.

¿Si rechazan las cookies pierdo trafico?

No pierdes trafico, pierdes medicion. Las visitas siguen llegando, pero tu herramienta de analitica no las registra si dependen de cookies sin consentimiento. Por eso conviene cruzar GA4 con fuentes que no dependen del consentimiento: Search Console para clics e impresiones desde busqueda, y los logs del servidor para el trafico real y el rastreo de bots.

¿Puedo publicar resenas de clientes con datos estructurados?

Si, siempre que tengas base juridica para publicar esos datos personales. El nombre de una persona identificable es un dato personal, y marcarlo en schema Review lo hace ademas legible por maquinas a escala. Lo limpio es pedir consentimiento explicito para publicar la resena con nombre, guardarlo, y ofrecer una alternativa reducida (nombre y inicial del apellido) para quien no lo autorice.

¿Usar IA para redactar contenido afecta al RGPD?

Solo si metes datos personales en el proceso. Redactar un articulo generico no implica tratamiento de datos. Pegar en un prompt la base de clientes, correos reales o datos de un lead, si: sigues siendo el responsable del tratamiento y debes saber donde se procesan esos datos y bajo que condiciones. La practica segura es trabajar con datos anonimizados o agregados.