Néstor Romero: «Todavía no existe una forma científicamente validada de saber qué dice la IA de tu marca»

estudio GEO panamá

La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha lanzado en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con la firma de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos dados por la línea investigativa centrada en Generative Engine Optimization (GEO) que Centria Group impulsa en colaboración con centros universitarios y académicos de cuatro naciones.

Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión: al sugerir un hotel, un seguro o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de despejar esta duda, el grupo llevó a cabo una revisión sistemática exploratoria (scoping review) basada en la metodología del Joanna Briggs Institute (JBI) y documentada de acuerdo con la pauta PRISMA-ScR, examinando de manera ordenada la forma en que los estudios recientes evalúan la visibilidad, la mención y la inclusión de marcas y fuentes dentro de los motores basados en inteligencia artificial.

«Por espacio de cerca de veinte años, la presencia en la red se evaluaba mediante una destreza muy específica: salir en un índice de opciones y recibir clics. Actualmente, las personas ya no se encuentran con diez vínculos azules; ahora obtienen una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El cuestionamiento fundamental ya no se centra en si mi dirección web figura y es seleccionada, sino en si mis materiales forman parte de la contestación que el consumidor verdaderamente visualiza», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.

«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.

 Las cinco preguntas de investigación junto con sus respectivas respuestas

RQ Pregunta Respuesta del estudio
RQ1 ¿Qué familias de métricas se emplean? Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador.
RQ2 ¿Sobre qué unidad de análisis se operacionalizan? Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa.
RQ3 ¿Cómo se controla la variabilidad estocástica de los motores? Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error.
RQ4 ¿Qué evidencia de fiabilidad y validez se reporta? Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta.
RQ5 ¿Existe un instrumento integrado y validado de presencia generativa? En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada.
LEER  ¿Buscas baterías para autos eléctricos en El Salvador? Descubre la mejor opción

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

Cuatro vías complementarias integraron la búsqueda, ideadas para contrarrestar los puntos débiles de cada método: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias mediante nodos clave y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados por DOI —evitando el título debido a los frecuentes conflictos entre denominaciones genéricas dentro de esta disciplina—, dos evaluadores filtraron los registros analizando los resúmenes de manera autónoma, logrando acuerdos consensuados ante cualquier desacuerdo. Treinta y seis informes completos fueron valorados, seleccionándose veintitrés investigaciones principales, además de un par de revisiones catalogadas de forma independiente a modo de sustento teórico.

«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.

Siete grupos de indicadores y ningún modelo que los unifique

El mapeo identifica siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que conviven sin un marco integrador compartido. El estudio destaca además que la frontera conceptual más fértil del campo es la distinción entre citación (que una fuente sea seleccionada) y absorción (que su contenido se incorpore efectivamente al texto de la respuesta), un desdoblamiento en dos capas de lo que antes se medía como un binario.

El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes

No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.

Tipología de la evidencia disponible

Grado de evidencia Casos prácticos Proporción en el corpus
Benchmark de evaluación GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) Predominante
Medición primaria (motores reales) How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) Escasa
Estudio aplicado / comercial GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) Restringida
LEER  Así funciona el invento que consume cinco veces menos energía y no requiere gas ni instalación externa

Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.

La Inteligencia Artificial no contesta de forma idéntica todo el tiempo, y prácticamente nadie evalúa este fenómeno

Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.

«Dentro de este ámbito, registrar una única ejecución carece de solidez epistemológica. Todo instrumento fiable necesita integrar la repetición y el análisis de la incertidumbre como una exigencia fundamental, más allá de considerarlo un simple detalle opcional», puntualiza Romero.

El hallazgo central: un campo que mide mucho y valida poco

La conclusión determinante del estudio es que ningún trabajo del corpus somete su instrumento de medición a validación psicométrica en sentido estricto. Lo que existe son controles adyacentes y aislados (métricas de estabilidad, fidelidad de la atribución, triangulación por diseño o robustez al orden), y la fiabilidad intercodificadores, requisito básico de cualquier instrumento, apenas se reporta. La validez, cuando se argumenta, descansa en la coherencia interna de benchmarks creados ad hoc antes que en propiedades de medición. De ahí la conclusión central del mapeo: no existe todavía un instrumento integrado y validado para medir la presencia generativa de marca.

Requisitos para participar

Parámetro

Adisión

Descarte

Enfoque

Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas

Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito

Periodo

2023-2026 (ámbito nativo digital)

Previo a 2023

Idioma

Castellano e inglés

Idiomas restantes que carezcan de traducción accesible

Clasificación

Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas

Artículos de opinión, editoriales y material de índole comercial

Condición

Se aceptan preprints conforme a los criterios de sensibilidad establecidos

Documentación informal difundida sin supervisión editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Hallamos un sector donde abunda la medición y escasea la validación. Las propuestas de evaluación no escasean —de hecho, sobran—; lo que realmente escasea es la fiabilidad documentada y la validez de constructo. Y es preciso señalarlo con rigor, pues equiparar un simple benchmark con un instrumento debidamente validado eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.

Una brecha entre la práctica profesional y la academia

El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.

«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».

«La visibilidad generativa es manipulable, y eso traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

La revisión aporta además un hallazgo metodológico de interés directo para la comunidad hispanohablante. Existe un estrato de investigación en español, publicado en revistas de Biblioteconomía y Documentación, que aborda la visibilidad ante la IA generativa desde ángulos complementarios —la volatilidad de la presencia de marca en recomendaciones turísticas generadas por IA, o la optimización de repositorios académicos para su rastreo por motores generativos— y que la literatura anglófona dominante tiende a pasar por alto. Su recuperación solo fue posible mediante búsqueda multilingüe, lo que evidencia un sesgo lingüístico latente en el campo.

LEER  ¿TikTok te conoce mejor que tu madre? Cómo enviar datos guardados sobre el usuario y limitar la información a copiar

A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Proceso de elección de estudios (PRISMA-ScR, dos ramas)

Fase Hallazgo
Fase de búsqueda (Consensus) Se identificaron 70 registros; 23 descartados de forma previa al filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 sometidos a revisión por resumen; 26 descartados; 21 evaluados a texto completo
Fase de métodos complementarios 18 referencias adicionales (búsqueda de citas, OpenAlex y comprobación en bases indexadas); 15 elegibles para texto completo
Comprobación en Web of Science 360 registros iniciales; 136 analizados (de acceso abierto); ningún nuevo trabajo de medición apto
Revisión del texto completo Se examinaron 36 informes; 13 descartados (por no ajustarse al alcance o carecer de medición directa de presencia)
Selección definitiva Se incorporaron 23 investigaciones primarias a la síntesis, además de 2 revisiones documentadas como marco teórico

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.

La visibilidad generativa es susceptible de manipulación

Un conjunto de los análisis examinados evidencia que la visibilidad dentro de los motores generativos resulta alterable de manera adversarial, ya sea recurriendo a procedimientos de manipulación de posiciones en buscadores conversacionales o a través de una optimización encubierta de prompts. Dicha investigación traslada semejantes datos al ámbito de la medición, concluyendo que la solidez ante cualquier intento de alteración tendría que integrarse entre las características indispensables de toda herramienta de visibilidad.

«Una prueba de rendimiento comprueba si una estrategia resulta eficaz o si un elemento varía de posición, pero no determina si un indicador mide adecuadamente un constructo. Mezclar ambos planos magnifica el grado de desarrollo ficticio de la disciplina».

«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».

Próximos pasos: del diagnóstico a la herramienta

Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.

«Buscamos transitar del análisis a la solución práctica: diseñar y contrastar una métrica que cualquier entidad, sin importar su magnitud, logre aplicar para medir con rigor científico el impacto de su marca cuando la inteligencia artificial genera respuestas sobre ella», señala Néstor Romero.

Limitaciones declaradas por los autores

El texto deja claros sus propios confines: la fragilidad de los datos en una disciplina tan novísima y dominada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotado radio idiomático al inglés y al castellano junto con la carencia de validación en Scopus debido a la ausencia de convenios universitarios; un etiquetado efectuado en parte sobre los resúmenes, con métricas de admisión sujetas a revisión; el riesgo de incurrir en circularidad, puesto que múltiples investigaciones utilizan inteligencias artificiales evaluadoras de su propia evaluación; y la caducidad temporal que afecta a cualquier radiografía de un ámbito sustentado en herramientas propietarias en mutación permanente.

Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».