
António Pedro Costa, Facultad de Psicología y Ciencias de la Educación de la Universidad de Oporto (Portugal)
António Pedro Costa es investigador en el Centro de Investigación e Intervención Educativas (CIIE) de la Facultad de Psicología y Ciencias de la Educación de la Universidad de Oporto, Portugal. Es uno de los investigadores responsables del software de apoyo al análisis cualitativo webQDA (webqda.net) y docente de metodologías de investigación. Coordina el Congreso Iberoamericano de Metodologías de Investigación (ciaiq.ludomedia.org) y la World Conference on Qualitative Research (wcqr.ludomedia.org), y es además editor jefe de la revista New Trends in Qualitative Research (NTQR). Su investigación se centra en el uso de las tecnologías en la investigación, con especial énfasis en la Inteligencia Artificial, la ética, los métodos mixtos y la curación de datos. En 2023 recibió una Mención Honorífica en el Premio Investigador de la Universidad de Aveiro y ha coordinado proyectos de investigación financiados con fondos públicos y privados por un valor superior a 3 millones de euros.
El 26 de octubre de 2026, en un taller de ECAI2025, en Bolonia, presenté una comunicación sobre el Reflexive Uncertainty Framework (RUF). La tesis plantea que, en el análisis cualitativo asistido por IA, la incertidumbre no es un defecto que haya que eliminar, sino una evidencia analítica, siempre que la hagamos metodológicamente visible.
Tres días después, a las nueve de la mañana, asistí a la sesión plenaria de Mohit Bansal. El tema: agentes de planificación fiables, uncertainty-calibrated reasoning, colaboración entre agentes y generación multimodal controlable. La sala estaba llena, con participantes procedentes mayoritariamente de las ciencias de la computación.
Durante una hora, escuché cómo una comunidad que habla otro idioma llegaba, por un camino completamente distinto, a la misma cuestión con la que yo me había encontrado días antes. Merece la pena contar dónde se encuentran ambos caminos y, sobre todo, dónde se separan.
Empiezo por lo que más me sorprendió de nuestro propio material. Los errores que me resultaron difíciles de detectar no fueron aquellos en los que el sistema vaciló. Fueron aquellos en los que estaba seguro.
Qué quiere decir la calibración y qué no puede querer decir
Calibrar, en el sentido de Bansal, es alinear la confianza que expresa un sistema con la probabilidad de que acierte. Un modelo bien calibrado que dice «80%» acierta cuatro de cada cinco veces. Es una propiedad deseable y mensurable, y en matemáticas o en programación sabemos medirla, porque existe una respuesta correcta con la que comparar.
En una entrevista, no existe una interpretación verdadera o falsa. Está más o menos fundamentada, es más o menos coherente con el marco teórico, presta más o menos atención al contexto. Trasladar literalmente la calibración a la investigación cualitativa sería importar una métrica sin el objeto que mide.
Eso no invalida la intuición que subyace a ella, solo obliga a traducirla. Si no podemos preguntar «¿Con qué frecuencia acierta este sistema?», podemos preguntar cuándo vacila, en qué vacila y qué nos dice esa vacilación sobre los datos. Ese fue el camino que seguí.
Tres momentos en los que la duda se convierte en dato
El framework que presenté, el RUF, no es un modelo autónomo; profundiza en una etapa del modelo AbductivAI, aquella en la que la máquina explicita su razonamiento y el investigador puede cuestionarlo. Documenta tres momentos:
- Primero, las salidas probabilísticas: un modelo vectorial transforma fragmentos y categorías en vectores, calcula proximidades semánticas y devuelve distribuciones de probabilidad.
- Segundo, las zonas de ambigüedad interpretativa: cuando dos categorías quedan demasiado próximas, o cuando la distribución es baja y difusa, se activa una segunda capa, en la que un LLM debe justificar discursivamente la pertinencia de las categorías en competencia.
- Tercero, el comentario reflexivo: el momento en el que el investigador escribe, de forma detallada, en qué discrepa y por qué.
Dicho así, suena a arquitectura. Vale más ver qué ocurre en un caso.
Empatía 72%, permisividad 68%
El corpus utilizado era pequeño y deliberadamente modesto: nueve redacciones de alumnos de 5.º curso que respondían a «Si yo fuera profesor». Uno de ellos decía, más o menos:
«Pararía la actividad y les dejaría hacer lo que prefiriesen.»
El modelo vectorial asignó un 72% a Empatía y un 68% a Permisividad. Cuatro puntos porcentuales entre dos lecturas que no son variaciones la una de la otra. Son teorías diferentes sobre lo que ese niño piensa que debe ser un profesor.
Al preguntarle, el LLM lo justificó: el gesto es empático, pero la ausencia de regulación puede indicar permisividad. Es decir, osciló. Y es precisamente esta oscilación la que constituye el dato. No porque el sistema esté averiado, sino porque la frase es realmente ambigua y la ambigüedad es la información. Quien decide si aquello es cuidado relacional o erosión de la autoridad es el investigador. Pero ahora decide con la tensión a la vista, en lugar de recibirla ya resuelta por un número que no sabía que estaba resolviendo nada.
Autoridad 78% y lo que el número no vio
El caso inverso es más interesante y es el que más me interesa. Otra redacción decía que los alumnos con dificultades se sentarían al fondo del aula, para no molestar a quienes querían aprender.
El sistema clasificó aquello como Autoridad, con un 78% de confianza. No está equivocado. Simplemente está mirando el lado equivocado de la frase. Lo que importa ahí no es la autoridad, sino el peso simbólico de la exclusión espacial, es decir, un niño de diez años que describe con naturalidad una pedagogía de la separación. Ningún porcentaje me lleva hasta ahí.
Obsérvese la asimetría con el caso anterior. Cuando el modelo vaciló, me avisó. Cuando tuvo confianza, «me hizo callar». Una clasificación segura y superficial es más peligrosa que una clasificación incierta, porque no deja huella. Por eso una confianza elevada no puede ser el criterio para dar por terminado el análisis, y por eso el comentario reflexivo, en el framework, es obligatorio precisamente donde la divergencia entre el ser humano y la máquina es mayor.
Lo que nadie clasificó
Hubo, sin embargo, un resultado que me incomodó más que los otros dos. En las nueve redacciones, apenas se habla de evaluación ni de planificación de las clases. Es una ausencia notable en unos niños que describen el oficio de enseñar, sobre todo, como gestión del comportamiento, y casi nunca como trabajo de preparación o de valoración. Esa ausencia es un resultado.
El sistema llegó hasta ahí y no se dio cuenta. Las categorías existían y recibieron puntuaciones: evaluación formal 22%, planificación 18%. Al preguntarle, el LLM se limitó a constatar que no había ninguna referencia explícita. Es decir, los números estaban a la vista; lo que faltaba era la operación que los interpreta. Para un clasificador, una puntuación baja es indistinguible de «esta categoría no se aplica», y para interpretarla como un silencio significativo hace falta saber qué cabría esperar encontrar en un texto sobre ser profesor. Este horizonte de expectativas no está en el modelo. Está en quien lee. Lo registramos como una limitación recurrente y, de las tres cosas que encontramos, es la que menos perspectivas tiene de resolverse con modelos más grandes. Aumentar la escala mejora la detección de lo que está presente. La ausencia no es un problema de detección.
Fue también aquí donde la plenaria me pareció más próxima y más distante al mismo tiempo. Bansal mostró el análisis multimodal de vídeo en el aula para localizar episodios y cruzar intervenciones verbales, gestos y ocupación del espacio en horas de grabación que nadie revisa íntegramente. La utilidad es evidente. Pero un silencio de cuatro segundos es un dato observable y «malestar» es una interpretación; la distancia entre ambos se recorre con un contexto que no está en el vídeo. Cuanto más eficaces sean los sistemas para identificar lo que está presente, mayor deberá ser el cuidado con lo que no deja rastro: lo que no se dijo, lo que no se enseñó, quién no habló.
Hay aquí una ironía que merece la pena señalar. En el número 3 del volumen 22 de la revista New Trends In Qualitative Research (NTQR), Nicole Brown sostiene que el rigor en la investigación cualitativa se juega en la reflexividad encarnada y no en la neutralidad desencarnada, donde el cuerpo del investigador, su atención sensorial y su respuesta a la situación forman parte del modo en que se producen los datos. Un sistema que lee cuerpos en vídeo es, por definición, lo opuesto a esto: la lectura más fina posible de los cuerpos, realizada sin cuerpo alguno. Devuelve posiciones, duraciones y trayectorias, y deja fuera precisamente aquello que Brown sitúa en el centro.
No es casual que el ejemplo que escapó al clasificador, los niños sentados al fondo del aula, sea un ejemplo de cuerpos dispuestos en el espacio por un orden institucional. Todo estaba ahí, en el texto, y lo que faltó no fue capacidad de detección, sino saber qué significa esa disposición para quien la vive. Hay un nombre más preciso para lo que falta aquí: injusticia epistémica. El sistema no representa de forma errónea la experiencia de esos niños; no tiene cómo representarla.
La persuasión funciona en ambos sentidos
Bansal hablaba de agentes que deben aceptar correcciones pertinentes y resistirse a argumentos incorrectos. En la práctica de la investigación, el problema es simétrico y nosotros somos la mitad de él.
Una respuesta fluida parece convincente incluso cuando su vínculo con los datos es débil. La prosa competente es hoy barata; la fundamentación no lo es. Y una pregunta que ya contiene la interpretación que prefiero conduce al sistema a confirmarla. «¿No crees que este silencio revela resistencia?» no es una pregunta, es una petición de conformidad. Si yo nunca discrepo del sistema y el sistema nunca discrepa de mí, alguien no está trabajando.
Esto tiene una traducción práctica y no se queda en las buenas intenciones. En el modelo AbductivAI, que sustenta este trabajo, el desacuerdo es un paso del proceso; se registra la divergencia entre el codificador humano y el agente y, sobre todo, se exige explicar esa divergencia: por qué uno elegiría la categoría X y el otro la Y. El ser humano decide los casos inciertos; el agente actúa como segundo codificador, cuya función es ofrecer una lectura alternativa. Un desacuerdo que no queda por escrito no ha ocurrido.
Añado una cautela que he aprendido a tener: la justificación que un modelo da de su propio razonamiento es una justificación plausible, no una ventana a su funcionamiento. La trato como trato la racionalización de un participante: como un dato que analizar, no como la verdad del proceso. Vale por lo que abre a la discusión, no por lo que revela del mecanismo.
La objeción que tengo que aceptar
Alguien dirá que esto es entusiasmo en busca de justificación metodológica, que estamos adaptando la epistemología a la herramienta en lugar de lo contrario. La objeción es seria y no la considero resuelta. Hay dos debilidades nuestras que declaramos en el artículo:
- La primera: el corpus es pequeño y específico. Nueve redacciones, un contexto, una lengua. Lo que describimos necesita ponerse a prueba en conjuntos mayores, multilingües y en otras tradiciones interpretativas.
- La segunda es más incómoda. Todo el valor del framework depende de que alguien sostenga de verdad la posición de coanalista al leer las justificaciones, escribir los comentarios y discrepar por escrito. Eso no se puede dar por sentado. En la práctica, la tentación es aceptar la propuesta bien formulada y seguir adelante, y un dispositivo que hace visible la incertidumbre no sirve de nada a quien no mira. Hacer que la duda pueda documentarse es una condición necesaria.
Y hay aquí una conexión que solo establecí más tarde. Tiendo a formular esta segunda debilidad como una exigencia individual: el investigador que se mantiene vigilante. Pero, si la postura de coanalista no se puede dar por sentada, tampoco puede depender únicamente de la virtud de quien analiza. En otro trabajo, con Isabel Pinho y Cláudia Pinho, propusimos pensar la gobernanza de la IA generativa en la investigación educativa en tres niveles: macro, meso y micro.
La lectura que hago hoy es que un dispositivo como el RUF se sitúa en el nivel micro y depende por completo de los otros dos. Sin exigencias de documentación en las revistas, sin formación metodológica en los programas de doctorado, sin criterios de evaluación que reconozcan el valor de documentar la incertidumbre, hacer visible la duda seguirá siendo un gesto voluntario de unos pocos. Y lo voluntario, bajo la presión de los plazos, es siempre lo primero que se abandona.
Dos comunidades, el mismo problema
Conviene decir que esto va a contracorriente. En el uso más difundido de la IA en la investigación cualitativa, la ventaja que se busca es de escala, y la propia NTQR publicó un buen ejemplo: «The End of Traditional Focus Groups? Scaling Up Qualitative Research Quick, Yet Maintaining Depth of Data with Larger Samples». Se trata de un debate en línea con cien participantes, analizado en tiempo real, en el que los autores señalan la limitación encontrada: no poder profundizar en las respuestas. Lo que propongo aquí va en sentido inverso: no utilizar la máquina para analizar más deprisa, sino para frenar precisamente donde el análisis suele acelerar.
Lo que me traje de Bolonia no fue una técnica. Fue la constatación de que dos comunidades que apenas se leen —la que mide la calibración en benchmarks y la que debate sobre reflexividad desde Bourdieu— están convergiendo en la misma pregunta desde lados opuestos: ¿qué debe hacer un sistema cuando no sabe y qué debemos hacer nosotros con ello?
Escribo este texto desde París, donde participo en la Digital Learning Week de la UNESCO (2026). La convergencia se mantiene, pero ahora aparece con otro vocabulario. La palabra que atraviesa todo el programa es fricción. Hay sesiones sobre cognitive friction through design, sobre el coste de lo que es frictionless, sobre cómo limitar la fricción inducida por la IA, y una de ellas se titula «What AI cannot tell you: Knowledge integrity, epistemic injustice and transcultural AI ethics». Reconozco el debate, aunque allí se hable sobre todo de la fricción del alumno y aquí de la fricción del investigador. La pregunta es la misma: ¿qué se pierde cuando se elimina la fricción de un proceso que la necesita para funcionar bien?
La respuesta me parece más o menos obvia: si algún día evaluamos estas integraciones, que no sea por el tiempo ahorrado, sino por la profundidad de las interpretaciones, la atención a las diferencias, la preservación de las voces de los participantes y la transparencia de las decisiones. La responsabilidad científica y ética sigue estando enteramente de nuestro lado, y esa es la única parte que ningún agente, por muy bien calibrado que esté, asumirá por nosotros.
Bibliografía
Bansal, M. (2025). Trustworthy Planning Agents for Collaborative Reasoning and Multimodal Generation. https://ecai2025.org/keynote-speakers/
Brown, N. (2026). The Body in Qualitative Research: From Disembodied Knowledge to Corporeal Praxis. New Trends in Qualitative Research, 22(3), e1472. https://doi.org/10.36367/ntqr.22.3.2026.e1472
Costa, A. P., & Bem-Haja, P. (2025). Reflexive Uncertainty AI for Qualitative Data Analysis. In E. Marengo, M. Strian, & M. IPonticorvo (Eds.), Proceedings of the 2nd International Workshop on Education for Artificial Intelligence (edu4AI2025) (pp. 13–23). European Association for Artificial Intelligence (EurAI). https://ceur-ws.org/Vol-4114/7_paper.pdf
Costa, A. P., Bryda, G., Christou, P. A., & Kasperiuniene, J. (2025). AI as a Co-researcher in the Qualitative Research Workflow: Transforming Human-AI Collaboration. International Journal of Qualitative Methods, 24. https://doi.org/10.1177/16094069251383739
Mohd Anis, A., & Olisa, N. (2024). The End of Traditional Focus Groups? Scaling Up Qualitative Research Quick, Yet Maintaining Depth of Data with Larger Samples. New Trends in Qualitative Research, 20(1), e799. https://doi.org/10.36367/ntqr.20.1.2024.e799
Pinho, I., Costa, A. P., & Pinho, C. (2025). Generative AI Governance Model in Educational Research. Frontiers in Education, 10. https://doi.org/10.3389/feduc.2025.1594343
UNESCO. (2026). Digital Learning Week 2026: Provisional programme. París, 8–11 de septiembre de 2026.