Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios publicitarios (si los hubiera). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics y Youtube. Al utilizar el sitio web, usted acepta el uso de cookies. Hemos actualizado nuestra Política de privacidad. Haga clic en el botón para consultar nuestra Política de privacidad.

Un estudio panameño identifica un vacío en la investigación en español sobre inteligencia artificial generativa

Un estudio panameño identifica un vacío en la investigación en español sobre inteligencia artificial generativa

La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer dentro de su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual fue elaborado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el producto inicial de la línea de estudio centrada en Generative Engine Optimization (GEO) que impulsa Centria Group en colaboración con diversas entidades académicas y universitarias de cuatro naciones.

El artículo aborda una incógnita que el marketing digital aún no ha logrado resolver con precisión: al sugerir un hotel, una aseguradora o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de esclarecerlo, el grupo llevó a cabo una revisión de alcance o scoping review, apegándose a la metodología del Joanna Briggs Institute (JBI) y documentada conforme a la directriz PRISMA-ScR, la cual traza sistemáticamente el modo en que las publicaciones recientes evalúan la visibilidad, el posicionamiento y la mención de marcas y referencias dentro de los motores de respuesta generativa.

«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El texto arranca a partir de una realidad que la propia muestra analizada corrobora mediante datos empíricos: los enlaces seleccionados por una herramienta generativa coinciden escasamente con los resultados del posicionamiento orgánico clásico, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un chat inteligente, lo cual invalida la extrapolación automática de métricas y exige replantificar los métodos y objetos de medición. Adicionalmente, este escenario se ve potenciado por la tendencia de «cero clics», impulsada por las respuestas sintéticas incrustadas en los propios buscadores: un porcentaje elevado de las búsquedas actuales se satisface plenamente sin que el internauta llegue a navegar por ninguna página.

«La proporción de citas constituye el indicador fundamental para el ejercicio profesional, mientras que el ámbito académico lo reduce a una sola investigación. Dicho abismo entre el sector y la academia representa un descubrimiento en sí mismo», expresó Néstor Romero.

 Las cinco preguntas de investigación junto con sus respuestas

RQ Pregunta Respuesta del estudio
RQ1 ¿Qué familias de métricas se emplean? Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador.
RQ2 ¿Sobre qué unidad de análisis se operacionalizan? Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa.
RQ3 ¿Cómo se controla la variabilidad estocástica de los motores? Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error.
RQ4 ¿Qué evidencia de fiabilidad y validez se reporta? Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta.
RQ5 ¿Existe un instrumento integrado y validado de presencia generativa? En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada.

Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints

La búsqueda combinó cuatro rutas complementarias, diseñadas para compensar los puntos ciegos de cada una: una herramienta de descubrimiento asistida por inteligencia artificial, consultas reproducibles y multilingües en OpenAlex, rastreo de citas desde nodos ancla y verificación en una base indexada (Web of Science; Scopus no resultó accesible). Tras la deduplicación por DOI —y no por título, dada la alta colisión de títulos genéricos en este campo— se cribaron los registros por resumen de forma independiente por dos revisores, y las discrepancias se resolvieron por consenso. Se evaluaron 36 informes a texto completo y se incluyeron 23 estudios primarios, más dos revisiones registradas por separado como marco conceptual.

«Una gran porción del saber producido en español acerca de este tema no logra trascender hacia los circuitos globales. Rescatarlo va más allá de un asunto de mera exhaustividad: pone de manifiesto un sesgo idiomático subyacente en la disciplina», subrayó Néstor Romero.

Siete conjuntos de métricas y ausencia de un marco unificado

El mapeo reconoce siete agrupaciones de indicadores que se superponen parcialmente —aparición o mención, visibilidad o emplazamiento, asimilación o peso, posicionamiento en listados, consistencia, tono o enfoque y porción de menciones— y que operan careciendo de un estándar unificador común. Asimismo, la investigación subraya que el límite conceptual más fructífero de esta disciplina radica en la diferenciación entre la citación, entendida como la selección de una fuente, y la asimilación, definida como la integración real de sus contenidos dentro del texto resultante; esto representa una escisión en un par de niveles de aquello que anteriormente se evaluaba de forma binaria.

El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes

No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.

Tipología de la evidencia disponible

Grado de evidencia

Casos prácticos

Incidencia en el corpus

Evaluación por benchmark

GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025)

Predominante

Métrica directa (plataformas reales)

How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026)

Escasa

Investigación aplicada / sectorial

GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026)

Restringida

Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.

La Inteligencia Artificial no contesta de forma idéntica todo el tiempo, y prácticamente nadie evalúa este fenómeno

Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.

«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el principio, y no como un simple añadido opcional», apunta Romero.

El hallazgo central: un campo que mide mucho y valida poco

El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.

Criterios de elegibilidad

Criterio

Inclusión

Exclusión

Foco

Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos

SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio

Ventana temporal

2023-2026 (campo born-digital)

Anterior a 2023

Idioma

Español e inglés

Otros idiomas sin traducción disponible

Tipo

Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas

Editoriales, artículos de opinión, contenido promocional

Estatus

Preprints admitidos bajo política de sensibilidad

Literatura gris autopublicada sin control editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del manuscrito original. Versión propia en castellano.

«Hallamos un terreno sumamente amplio pero escasamente contrastado. A las propuestas métricas, lejos de escasear, les sobra presencia; lo que escasea en realidad es consistencia conceptual y rigor contrastable. Conviene precisarlo sin rodeos, ya que equiparar un indicador estándar con una herramienta contrastada sobreestima el supuesto desarrollo metodológico de la disciplina. Precisamente ahí radica el nicho científico», sostiene Néstor Romero.

Existe una separación entre la enseñanza académica y la labor profesional

El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.

«La visibilidad en Google no anticipa la presencia en un asistente generativo. Esto anula la transferencia directa de métricas y obliga a replantearse qué evaluamos y de qué manera».

«La visibilidad generativa es manipulable, y eso traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».

La ciencia en español, invisible: una lección metodológica

Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A esto se añade otra enseñanza derivada del procedimiento: la búsqueda en un repositorio indexado arrojó 360 resultados preliminares, de los cuales se analizaron los 136 disponibles en abierto —en su mayor parte interferencias temáticas debido a coincidencias terminológicas—, sin que se sumara ninguna nueva investigación evaluable. En pocas palabras, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura deficiente en los índices convencionales; el 64 % del conjunto inicial se publica mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Proceso de elección de los estudios (PRISMA-ScR, dos vías)

Fase

Desenlace

Rama de descubrimiento (Consensus)

Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo

Rama de otros métodos

Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra

Verificación en Web of Science

Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional

Evaluación a texto completo

Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia

Inclusión final

Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los datos de identificación y cribado se consideran definitivos, mientras que los correspondientes a la evaluación a texto completo y a la inclusión tienen carácter provisional, tal como señalan los autores.

La visibilidad generativa se puede manipular

Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.

«Una prueba de rendimiento comprueba si una estrategia da resultado o si un elemento varía de posición, pero no determina si un indicador mide con validez un concepto. Mezclar ambos planos exagera la falsa sensación de madurez de la disciplina».

«Evaluar una única ejecución resulta, en este ámbito, epistemológicamente frágil, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».

Qué viene ahora: del diagnóstico al instrumento

Los investigadores concluyen que la carencia hallada —en lo referente a la validez de constructo y a la fiabilidad constatada— representa el resquicio que legitima la creación y validación formal de un indicador específico de presencia generativa, planteando dicha labor como la prolongación lógica del estudio difundido, y descartándola como una hipótesis ya ratificada. Se trata justamente de la senda en la que el grupo se encuentra laborando durante la etapa posterior.

«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.

Limitaciones expresadas por los creadores

El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.

Dichas restricciones resultan esenciales para valorar correctamente los hallazgos y entender el alcance de la información existente. Si deseas examinar con mayor detalle el procedimiento, las cifras evaluadas y las deducciones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Adrián Díaz

No te pierdas estos