Practicar conversaciones con una IA mejora habilidades dentro de la práctica, sobre todo cuando hay feedback con criterio detrás. Pero la evidencia es corta: estudios breves, muestras pequeñas y casi todo en sanidad. Al revisarla encontré algo distinto de lo que se suele vender, y en un estudio los autores lo dejaron por escrito: la IA no enseñaba mejor, dejaba practicar más veces. Cuento eso y cómo estoy montando el mío con lo que he aprendido leyéndolo.
Actualizado el 29 de septiembre de 2026. El simulador ha cambiado bastante desde agosto, así que he reescrito la sección de cómo lo monto. La parte de la evidencia sigue igual.
El curso ha terminado.
La persona conoce la estructura: escuchar, preguntar, reformular, responder a la objeción, acordar un siguiente paso. Aprobó el test con un nueve.
Dos días después, un cliente le dice:
—Me parece demasiado caro.
Y la estructura desaparece.
No porque no la haya entendido. La reconocería sin dudar en una pregunta de test. Desaparece porque reconocer una respuesta y producirla mientras alguien te mira son dos aprendizajes distintos.
Ese hueco, entre saber qué habría que hacer y ser capaz de hacerlo, es donde han aparecido los simuladores conversacionales con IA.
Estoy construyendo uno, así que soy parte interesada y prefiero decirlo antes de empezar. Precisamente por eso me senté a leer qué dice la investigación en vez de fiarme de lo que veo en mi propia pantalla. Lo que encontré me entusiasmó menos y me convenció más.
(Las cifras de cada estudio, quién lo paga y qué no demuestra están al final, plegadas.)
¿Qué es un simulador conversacional con IA, y qué no lo es?
Es un entorno de práctica donde una IA interpreta a otra persona y responde a lo que tú haces. Un cliente que pone una objeción. Alguien de tu equipo con quien toca una conversación incómoda. No sigue un guion cerrado: la conversación cambia según lo que preguntas, lo que argumentas y lo que haces mal.
La diferencia con un chatbot está en la intención de diseño. Un chatbot quiere ayudarte. Un personaje de simulación tiene que sostener un papel, perseguir sus objetivos, callarse lo que no le has preguntado y resistirse cuando toca. Y al terminar, decirte qué has hecho en términos de conductas observables.
Sin personaje, escenario, reglas y criterios de evaluación no hay simulador. Hay una conversación con ChatGPT disfrazada de actividad formativa.
¿Qué dice la investigación?
Que es prometedor y que sabemos poco. Las dos cosas a la vez.
La revisión sistemática más reciente reúne quince estudios de pacientes virtuales con IA en formación sanitaria. Hubo mejoras en decisiones clínicas y en entrevistas. Y luego las deudas, que enumeran los propios autores: intervenciones cortas, sesiones únicas, métricas que no se parecen entre sí y ningún seguimiento a largo plazo. La heterogeneidad era tal que ni intentaron un metanálisis.
Casi todo viene de medicina y enfermería. Es razonable pensar que algunos mecanismos valgan igual para ventas o para liderazgo. No es razonable presentar esa extrapolación como si fuera una prueba. Yo la necesito para mi trabajo y, aun así, no me la creo del todo.
Debajo hay dos hallazgos viejos y sólidos que sí valen: recuperar algo activamente retiene mejor que volver a estudiarlo, y repartir los intentos en el tiempo funciona mejor que amontonarlos en una tarde. Con una salvedad que yo misma había pasado por encima: los dos se midieron sobre listas de palabras y textos cortos en laboratorio, no sobre conversaciones. Que apliquen a practicar una objeción es una apuesta razonable. Mía, no de los autores.
El dato que más me ha hecho pensar
Un ensayo de 2026 comparó a estudiantes de medicina entrenando con pacientes virtuales de IA frente a pacientes estandarizados humanos. El grupo de IA sacó mejor puntuación en comunicación. Hasta aquí, el titular esperado.
Pero los autores hicieron algo que no todos hacen: volvieron a analizar los resultados controlando el nivel de partida y el número de prácticas de cada uno.
Y la diferencia entre los dos grupos desapareció.
Su conclusión, literal, es que la ventaja aparente de los pacientes virtuales se debe más a la mayor oportunidad de práctica y al feedback estructurado que a la IA en sí.
No me parece un resultado decepcionante. Me parece el resultado. Si lo que separa a un grupo del otro es cuántas veces has podido practicar y qué te dijeron después de cada intento, la pregunta deja de ser «¿enseña más la IA?» y pasa a ser «¿cuántas veces puede practicar tu gente sin ella?». En casi todas las empresas que conozco la respuesta es: una. En el curso. Y con suerte.
¿Gana la IA o gana el role-play con personas?
El estudio más grande que he encontrado, con casi cuatrocientos estudiantes que pasaron por las dos condiciones, es bastante claro: con actores profesionales se aprendió algo más y gustó bastante más. La IA ganó en una sola cosa, el coste, donde salió a la mitad. Conviene saber que midió percepciones de los propios estudiantes, no desempeño observado desde fuera.
Aun así, la lectura no me parece «ganan los actores». Me parece esta: la interacción humana da más riqueza y gusta más; la simulación digital da más intentos por el mismo dinero. Resuelven partes distintas del problema, y las dos existen.
¿Cómo estoy montando yo mi simulador?
Con esa lectura encima de la mesa, estas son las decisiones que he tomado. Van con su porqué. Desde que publiqué esto han cambiado unas cuantas, porque el simulador va ya por la tercera versión, y no será la última.
1. La metodología va por un lado y el cliente por otro. Una plantilla recoge el método de una temática —las fases de la conversación, las habilidades que se miden, los tipos de interlocutor— y se escribe una sola vez. Cada empresa aporta lo suyo: qué vende, sus cifras, su vocabulario, sus personajes. Las fichas de los personajes las redacta la IA a partir del material del experto, cada texto queda etiquetado con su origen y se puede editar. Después las revisamos con el experto. El diseño instruccional se hace una vez y se reutiliza. Cuando el experto mejora el método, el cambio llega a todos sus clientes sin tocar nada más.
2. Cada papel sabe solo lo que le toca. Detrás de la conversación trabajan varias IA, cada una con información distinta. El personaje conoce su situación, su carácter y lo que se calla, pero no sabe la tarifa del comercial, ni hasta dónde puede bajar, ni cómo se puntúa el ejercicio. El coach conoce el método y los límites. El evaluador lo ve todo, y solo entra al final.
Lo que el personaje se calla lleva además su condición. Marta, una directora financiera que está pensando pasar su flota a renting, tiene un tope de presupuesto que solo cuenta si alguien le pregunta por su tope. Nunca lo suelta para pedir precio. Si nadie pregunta, no sale. Eso es lo que convierte la conversación en algo que hay que averiguar, igual que con un cliente de verdad.
3. El personaje tiene ánimo, y se ve. Por dentro lleva la cuenta de su interés, su confianza y su paciencia, que suben o bajan con lo que haces. En pantalla ves cómo está: neutral, interesada, molesta, escéptica. Si le repites una pregunta que ya ha contestado, se molesta. Si se le acaba la paciencia, da la reunión por terminada.
Y una reunión solo se gana cuando el personaje acepta con todas las letras. El servidor lo comprueba después, sin IA: si el personaje dice que sí pero sigue pidiendo condiciones, la reunión continúa.
4. Tu ficha, a la vista. Antes de entrar, la persona ve su objetivo, lo que ofrece, sus cifras —la tarifa y el suelo por debajo del cual no puede bajar—, las palancas con las que puede negociar y las cuatro claves del método. Dentro de la sala puede volver a abrirla y consultar qué tiene que averiguar. Un cuaderno va apuntando lo que ha descubierto. Negociar sin conocer tu margen es otra cosa, y no la que se quiere entrenar.
5. Primero con ayuda, después sin ella. En el modo de entrenamiento hay un coach que interviene en cada turno, pero después de que hayas contestado, no antes. Al principio daba pistas previas, y me di cuenta de que así le estaba haciendo el trabajo a la persona. La corrección que llega justo después del error obliga a pensar qué ha pasado: si has repetido una pregunta, si has salido del papel, si acabas de cruzar un límite. Si alguien se atasca de verdad, tiene un botón de ideas, pero tiene que pedirlas.
Después llega el Modo Pro: la misma conversación, sin coach y sin ideas, y aunque los pidas no aparecen. Es andamiaje: primero con apoyo y solo después sin él. Nadie se queda bloqueado por fallar a la primera, que es como se pierde a la gente que más lo necesita.
6. Los límites no se promedian. Cada simulador lleva sus líneas rojas. En el de renting, por ejemplo: no prometer vehículos nuevos en menos de dos semanas, no hablar mal de la competencia, no inventarse condiciones que no están en la ficha. Si alguien cruza una, el informe la marca aparte, con sus palabras exactas. Una conversación brillante que acaba con un precio por debajo del suelo no puede esconderse detrás de una media.
7. Informe al terminar, con pruebas. Se miden cuatro habilidades: preguntas que descubren, propuesta anclada a lo que dijo el cliente, concesiones con contrapartida y cierre con un siguiente paso. Cada una en tres niveles: no se ve, a medias, con claridad. Cada nivel tiene que ir con la frase de la persona que lo demuestra, y el sistema comprueba que esa frase está de verdad en la conversación. Si no está, ese nivel baja a cero. La nota sale de los niveles y la calcula el servidor, sin que la IA la decida.
Esta es la pieza que el estudio de arriba pone al lado de la cantidad de práctica. Y un evaluador que se inventa citas es peor que no tener ninguno.
8. Antes del informe, tu versión. Después, tu frase. Antes de ver cómo lo ha hecho, la persona escribe cómo cree que lo ha hecho, y el informe comenta esa autoevaluación: compara lo que creía con lo que pasó. Después de leerlo escribe qué hará distinto la próxima vez. Esa frase es privada, y se le recuerda al empezar la siguiente sesión.
En resumen
- La evidencia es prometedora y corta: intervenciones breves, muestras pequeñas y casi todo en sanidad.
- Cuando un estudio controló el nivel de partida y las veces que practicó cada uno, la ventaja de la IA desapareció. Sus autores la atribuyen a la oportunidad de practicar y al feedback, no a la IA.
- Frente a actores profesionales se aprende algo menos y gusta bastante menos. La IA gana en coste.
- Lo relacional no mejoró por tener más conversaciones. Hay que entrenarlo a propósito.
- Nadie ha medido si esto aguanta semanas después. Medir justo al terminar es medir lo que menos importa.
- Si lo que aporta es práctica con feedback, el diseño va a por eso: espaciar, no bloquear a nadie y decir después de cada intento qué ha pasado.
La persona del principio conocía la estructura y la perdió en cuanto llegó la objeción. Un simulador no garantiza que la encuentre. Pero puede ponerla otra vez delante de esa objeción mañana, la semana que viene y dentro de un mes. Dejarla fallar. Decirle dónde. Y darle otro intento.
Puede que ahí esté todo su valor. No en enseñarnos más cosas, sino en dejarnos practicarlas hasta que aparezcan cuando hacen falta.
¿Hablamos?
Cuéntame tu opinión sobre cómo se está usando la Inteligencia Artificial en tu empresa y si te resulta interesante la idea de un simulador conversacional.
Preguntas frecuentes
¿Qué es un simulador conversacional con IA?
Un entorno de práctica donde una IA interpreta a un cliente, un paciente o un colaborador y responde a lo que tú haces, sin guion cerrado. Para ser un simulador y no un chat necesita personaje, escenario, reglas y criterios de evaluación escritos antes.
¿Está demostrado que mejora el aprendizaje?
Dentro de la práctica, hay resultados positivos en estudios pequeños y casi todos sanitarios. Fuera de la práctica, no hay datos: nadie ha medido todavía si aguanta semanas después ni si llega al puesto.
¿Es mejor que un role-play con personas?
No. Frente a actores profesionales se aprende algo menos y gusta bastante menos. Lo que da la simulación es más intentos por el mismo dinero, que es otra cosa y también hace falta.
¿Cómo se mide si funciona?
Un escenario inicial con su rúbrica, la diferencia entre el primer intento y el último, un escenario nuevo sin ensayar, otro intento semanas después sin avisar y, si se llega, una muestra de conversaciones reales. Casi ningún piloto recorre la cadena entera; con los tres primeros pasos ya evitas confundir repetición con aprendizaje.
Si quieres el detalle: qué dicen los estudios y qué no
Abrir las fichas de los seis estudios
Aquí abajo va lo que me he saltado arriba para no cortar la lectura: las cifras, quién paga cada estudio y qué no demuestra. Si el post te ha valido, no hace falta que sigas.
El estudio del que sale la tesis de este post
Sun, N., Zhou, X., Yang, Z., Zhou, Y., Ma, R. y Wang, Z. (2026). Application of AI-based virtual standardized patients in physician-patient communication training: a study based on the SEGUE framework. Frontiers in Public Health, 14:1768518
Ensayo aleatorizado con 82 estudiantes de medicina de último curso: 40 entrenaron con pacientes virtuales de IA y 42 con pacientes estandarizados humanos, dos horas. Se midió con el marco SEGUE, una checklist de conductas observables de comunicación. Sin ajustar, el grupo de IA sacó 18,53 frente a 17,33 (p = 0,02) y completó más ciclos de práctica, 4,10 frente a 3,79 (p = 0,03). Los dos grupos partían del mismo nivel. Al meter la puntuación previa y la frecuencia de entrenamiento como covariables en un ANCOVA, la diferencia dejó de ser significativa: t = −1,41, gl = 80, P = 0,163. La subescala de Proceso, la más relacional, no mostró diferencia entre grupos en ningún momento.
De quién es. Financiación de la China Medical University (proyecto YDJG2025040). Los autores declaran que no hay relaciones comerciales ni financieras.
Lo que no demuestra. Dos horas de intervención, una sola institución, sin medición diferida ni transferencia a consulta real. Con 40 frente a 42 personas tampoco hay potencia para detectar diferencias pequeñas.
Por qué lo leo así. Porque el ajuste no es mío, es suyo, y su conclusión también: la ventaja se debe «más a la mayor oportunidad de práctica y al feedback estructurado que a la modalidad de IA en sí». Son dos mecanismos, no uno, y por eso en mi simulador el informe pesa tanto como la repetición.
El más grande, y el que menos gusta citar
Tyrrell, E. G. y otros (2025). Web-Based AI-Driven Virtual Patient Simulator Versus Actor-Based Simulation for Teaching Consultation Skills: Multicenter Randomized Crossover Study. JMIR Formative Research, 9:e71667
Estudio cruzado en dos facultades del Reino Unido: 396 estudiantes inscritos, 378 completaron. Cada uno pasó por las dos condiciones. Mejora autoinformada en habilidades de comunicación: 1,50 puntos con actores frente a 1,14 con IA (diferencia −0,36 a favor de los actores, p = 0,04). Satisfacción: 9,21 frente a 8,09 (p < 0,001), a favor de los actores en los seis ítems. Coste directo por estudiante: 33,48 libras la IA frente a 61,75 los actores.
De quién es. Financiado en parte por el NHS de Inglaterra, que declara no haber tenido papel en el diseño ni en el análisis. Sin conflictos declarados.
Lo que no demuestra. El resultado principal es autoinformado: son los estudiantes puntuándose a sí mismos, no una evaluación externa. Es un estudio abierto, así que sabían en qué condición estaban, cosa que pesa sobre todo en la satisfacción. Y el coste es coste directo en régimen estacionario: no incluye el desarrollo.
La revisión sistemática
Jiang, J., Ye, M. Z., Kwok, T. T. y Wong, J. Y. H. (2026). GenAI-Supported Virtual Patients in Health Care Education: Systematic Review. Journal of Medical Internet Research, 28:e82756
Quince estudios y 645 participantes en total, búsqueda en cinco bases de datos hasta marzo de 2026. Mejoras consistentes frente a los controles en toma de decisiones clínicas, anamnesis y desempeño en historia clínica.
De quién es. Sin financiación y sin conflictos declarados.
Lo que no demuestra. Son unos 43 participantes por estudio. Los propios autores describen la evidencia como intervenciones breves, sin anclaje en teoría educativa y con problemas de rigor. No hay eficacia a largo plazo ni transferencia a la práctica real.
El que separa la simulación del feedback
Lin, I. W., Sharma, A., Rytting, C. M., Miner, A. S., Suh, J. y Althoff, T. (2024). IMBUE: Improving Interpersonal Effectiveness through Simulation and Just-in-time Feedback with Human-Language Model Interaction. ACL 2024, pp. 810-840
86 participantes reclutados en plataformas de microtareas, dos brazos: solo simulación, o simulación más feedback destilado de conocimiento experto. El brazo con feedback mejoró el dominio de la habilidad un 17% respecto al de solo simulación.
De quién es. Universidad de Washington, Stanford y Microsoft Research. IMBUE es un prototipo de investigación, no un producto en venta.
Lo que no demuestra. Una sola sesión, medidas autoinformadas con preguntas únicas y participantes de crowdsourcing, no profesionales en su puesto. Los propios autores dicen que su herramienta no pretende sustituir la práctica con un experto.
Por qué lo leo así. Este 17% se cita mucho como mérito de los simuladores y no lo es: mide lo que añade el feedback experto por encima de la simulación. Es justo lo que el estudio separó con cuidado, y me parece la cifra más fácil de contar al revés de toda esta literatura.
El piloto que no encontró diferencias
Lee, H. Y. y otros (2025). Comparing AI chatbot simulation and peer role-play for OSCE preparation: a pilot randomized controlled trial. BMC Medical Education, 25:1755
19 estudiantes, 9 con chatbot y 10 con role-play entre compañeros, una sesión de una hora. Ninguna diferencia significativa tras corregir por comparaciones múltiples. Los tamaños de efecto más grandes, aunque no significativos, favorecen al role-play en exploración física y en comunicación.
Lo que no demuestra. Con 19 personas no hay potencia para detectar casi nada: aquí la ausencia de diferencia es ausencia de evidencia, no prueba de equivalencia.
Los dos clásicos, y hasta dónde llegan
Roediger, H. L. y Karpicke, J. D. (2006). Test-Enhanced Learning. Psychological Science, 17(3), 249-255 · Cepeda, N. J., Pashler, H., Vul, E., Wixted, J. T. y Rohrer, D. (2006). Distributed practice in verbal recall tasks. Psychological Bulletin, 132(3), 354-380
Roediger y Karpicke: universitarios, dos textos de menos de 300 palabras, recuerdo libre. A los cinco minutos releer gana; a la semana, hacerse pruebas gana con claridad (61% frente a 40%). Y quienes solo releían se creían los mejor preparados. Cepeda y otros: síntesis de 317 experimentos y casi 15.000 participantes en tareas de recuerdo verbal. El espaciado gana, y el hallazgo central es que el intervalo óptimo entre repasos crece con el tiempo que quieres retener.
De quién es. Los dos, financiación pública del Departamento de Educación estadounidense.
Lo que no demuestra. Memoria verbal en laboratorio, no conducta interactiva. Cepeda excluye expresamente el aprendizaje de destrezas y avisa de que ahí los patrones son distintos. El salto desde listas de palabras hasta practicar una objeción lo doy yo.
Por qué lo leo así. Con una precisión que me obliga a mí: el hallazgo de Cepeda no es «repetir consolida», es «separa las repeticiones en el tiempo». Repetir la misma conversación tres veces en la misma tarde es práctica masiva, que es la condición que sale peor. Por eso quiero que el simulador empuje a volver en días distintos. La primera versión lo hacía con retos semanales. Por ahora los he apartado, así que esa parte depende de cómo se organice la formación alrededor.
Y uno que he quitado
Este post citaba un metaanálisis de 27 ensayos y 1.480 participantes. Las cifras son exactas, pero al abrirlo resultó que no estudia simuladores conversacionales: compara simulación virtual en 2D y 3D contra maniquíes y pacientes estandarizados. Sus cuatro resultados principales son nulos y en el subgrupo de enfermería el método tradicional sale mejor. No sostiene nada de lo que se le hacía sostener, así que fuera.
Referencias
Ver las siete fuentes con enlace
- Sun, N. et al. (2026). Application of AI-based virtual standardized patients in physician-patient communication training. Frontiers in Public Health.
- Tyrrell, E. G. et al. (2025). Web-Based AI-Driven Virtual Patient Simulator Versus Actor-Based Simulation. JMIR Formative Research.
- Jiang, J. et al. (2026). GenAI-Supported Virtual Patients in Health Care Education: Systematic Review. Journal of Medical Internet Research.
- Lin, I. W. et al. (2024). IMBUE: Improving Interpersonal Effectiveness through Simulation and Just-in-time Feedback. ACL 2024.
- Lee, H. Y. et al. (2025). Comparing AI chatbot simulation and peer role-play for OSCE preparation. BMC Medical Education.
- Roediger, H. L. y Karpicke, J. D. (2006). Test-Enhanced Learning. Psychological Science.
- Cepeda, N. J. et al. (2006). Distributed practice in verbal recall tasks. Psychological Bulletin.
Deja una respuesta