MindWorks
Schema Markup para AI Search: Guía técnica
Volver al blog
Guía

Schema Markup para AI Search: Guía técnica

Esteban San Martin

Esteban San Martin

CEO · MindWorks

9 min de lectura

¿Importa el schema markup para la búsqueda con AI?

El schema markup es data estructurada, casi siempre JSON-LD, que describe tu página en un vocabulario que las máquinas leen sin adivinar: esto es un artículo, esta persona lo escribió, esta empresa vende este servicio. Ningún motor de AI te paga una cita por agregarlo. La correlación igual corre en una sola dirección: las páginas con data estructurada válida aparecen entre 20% y 30% más seguido en resúmenes generados por AI, según benchmarks 2025 de Semrush y Measured.com.

Esa brecha entre "no es factor de ranking" y "las páginas citadas suelen tenerlo" define el trabajo de schema en 2026. Los motores de respuesta arman sus salidas desde índices de búsqueda que la data estructurada alimenta hace una década. Saltártelo no te vuelve invisible. Te vuelve más difícil de desambiguar, y los motores resuelven la ambigüedad citando a otro.

20-30%

más apariciones en resúmenes generados por AI para páginas con data estructurada válida (benchmarks de Semrush y Measured.com, 2025)

~48%

de las consultas rastreadas mostraba un AI Overview de Google en febrero de 2026, contra 31% un año antes (theStacc)

+30%

de visibilidad en respuestas de AI por citar fuentes, medido por el estudio GEO de Princeton (KDD 2024)

5

tipos de schema cubren casi todo lo que un sitio B2B necesita: Organization, Article, FAQPage, BreadcrumbList y Service

Cómo usan la data estructurada los motores de AI

Importan tres pipelines. Los AI Overviews de Google se montan sobre el índice normal de Google, donde la data estructurada alimenta los rich results y el Knowledge Graph desde 2012. Bing abastece a Copilot y al modo de búsqueda en vivo de ChatGPT, y sus ingenieros han dicho en público que el schema ayuda a sus modelos de lenguaje a entender el contenido. Los crawlers de entrenamiento como GPTBot y ClaudeBot reducen las páginas mayormente a texto, así que ahí el markup pesa menos.

La consecuencia práctica: el schema trabaja en el lado de la recuperación, antes de que un motor decida a quién citar. Determina si el índice entiende quién eres y qué responde la página. La claridad de entidad además se acumula. Un bloque Organization consistente con un array sameAs une tu sitio, tu página de LinkedIn y tus fichas en directorios en una sola entidad en vez de cuatro suposiciones.

Los cinco tipos de schema que importan para AI search

  • Organization (o ProfessionalService) en la home, con name, url, logo y un array sameAs apuntando a cada perfil real que controlas. Este bloque ancla la desambiguación de entidad.
  • Article o BlogPosting en cada post, con headline, datePublished, dateModified y un author que referencia a una persona real con URL de perfil real. La autoría es una señal que los motores pueden verificar.
  • FAQPage en páginas con pares visibles de pregunta y respuesta. Google recortó el rich result de FAQ para la mayoría de los sitios en 2023, pero el formato Q&A legible por máquina calza uno a uno con cómo los motores de respuesta recuperan pasajes.
  • BreadcrumbList, para que los motores sepan dónde vive una página en tu jerarquía y atribuyan una respuesta a la sección correcta del sitio.
  • Service o Product con offers, precio y disponibilidad donde la página los muestra. Las consultas comerciales en motores de AI usan estos campos para armar comparaciones.

Cómo implementar JSON-LD sin que se pudra

Usa JSON-LD en un solo script tag, el formato que Google recomienda, y combina tipos en una página con @graph en vez de apilar bloques separados. Después genéralo desde la misma fuente de datos que renderiza el contenido visible. En nuestro sitio, el JSON-LD del blog lee de los mismos archivos TypeScript que renderizan cada página, así que un cambio de título actualiza ambos a la vez. El schema escrito a mano se desalinea, y ese desfase es lo que los validadores marcan y los motores descartan.

En React o Next.js, renderiza el script tag en el servidor para que los crawlers lo reciban en el HTML inicial. La inyección por cliente le llega a Googlebot después de una cola de render, y a los crawlers de AI más livianos les llega tarde o nunca.

El markup que miente queda ignorado

El schema debe describir contenido que existe en la página. Marcar FAQs que nadie ve, reseñas escritas por ti mismo o un promedio cinco estrellas construido sobre tres ratings te puede costar los rich results del dominio completo: Google aplica acciones manuales por spam de data estructurada a nivel de sitio.

Valida antes de publicar

Pasa cada template por el Rich Results Test de Google y el validador de schema.org antes de deployar, y después vigila los reportes de mejoras en Search Console para detectar regresiones. Los errores que conviene revisar dos veces: fechas fuera de ISO 8601, URLs relativas en vez de absolutas y valores de enumeración escritos de memoria. Un campo malformado bota el bloque entero, y nada en la página te avisa.

El checklist de implementación

  • Elige primero las páginas que ameritan markup: home, posts del blog, páginas de servicios, FAQ.
  • Genera el JSON-LD desde tu fuente de contenido en vez de pegar bloques estáticos.
  • Combina tipos por página con @graph en un solo script tag, renderizado en el servidor.
  • Referencia autores reales con URL de perfil en cada bloque Article.
  • Valida con el Rich Results Test y el validador de schema.org.
  • Revisa los reportes de mejoras de Search Console dos semanas después de cada deploy.

El schema es una capa del stack legible por máquinas

Los crawlers de AI también leen llms.txt, un índice de tu sitio en texto plano escrito para modelos de lenguaje. La adopción va temprano: 8,7% de los 1.000 sitios más grandes lo tenía a junio de 2026, y el total en la web creció 8,8x en doce meses hasta cerca de 36.000 sitios. En mindworks.cl publicamos las tres capas: JSON-LD en cada post y FAQ, un llms.txt y reglas de robots que nombran a cada bot de AI en vez de tratarlos como un solo crawler.

¿Google usa schema markup para los AI Overviews?

Google no ha nombrado la data estructurada como factor de ranking de AI Overviews. Los resúmenes salen del mismo índice y la misma capa de comprensión que el schema alimenta, y la brecha de 20% a 30% en apariciones para páginas con markup válido se repite en benchmarks independientes de 2025. Trátalo como infraestructura del índice, no como un interruptor de AI.

¿Los LLMs leen JSON-LD directamente?

Depende del pipeline. Los crawlers que juntan data de entrenamiento reducen las páginas mayormente a texto plano. Los motores que buscan antes de responder, como Copilot, el modo búsqueda de ChatGPT y los AI Overviews, recuperan desde índices construidos con data estructurada, y ahí es donde tu markup hace su trabajo. Bing ha confirmado que el schema ayuda a sus modelos a interpretar páginas.

¿JSON-LD es mejor que microdata para AI search?

Sí. Google recomienda JSON-LD, vive en un solo bloque en vez de atributos repartidos por tu HTML y puedes generarlo desde una fuente de datos y mantenerlo alineado con el contenido visible. Migrar microdata antiguo cuesta como medio día y elimina una trampa de mantención.

¿Qué páginas marcar primero?

La home con Organization, después el blog con bloques Article y referencias de autor, y después cualquier página con pares visibles de pregunta y respuesta como FAQPage. Ese orden adelanta claridad de entidad y autoría, las dos señales en que se apoyan los motores de respuesta al decidir si una fuente merece cita.

Dónde calza el schema en tu trabajo de AEO

La data estructurada es la capa barata: un par de templates, una pasada de validación, y aguanta mientras haces el trabajo recurrente de publicar respuestas que merezcan cita. Nuestra guía de answer engine optimization cubre ese lado de contenido, y nuestra comparativa de plataformas de AEO cubre cómo medir el resultado. Si quieres saber cómo se lee tu sitio para las máquinas hoy, nuestra auditoría de growth gratuita incluye un chequeo de data estructurada y llms.txt, sin retainer de por medio.

Ningún motor te cita por tener schema. A todos les resulta más fácil saltarte sin él.
Esteban San Martin

Escrito por

Esteban San Martin

CEO

Ingeniero civil industrial especializado en growth marketing y product management, con experiencia liderando equipos de producto y marketing en empresas de Silicon Valley. Combina visión de negocio con fluidez técnica para construir sistemas de growth que se acumulan.

¿Quieres llevar esto a la práctica?

Agenda una auditoría de growth