Role-Based Prompting (“Actúa como…”) bajo la lupa: qué dice realmente la evidencia científica (2023–2025)
Existe una evidencia científica mixta y contradictoria sobre la efectividad del rol-based prompting (“Actúa como tal [profesión]”) en modelos de IA. La investigación académica más reciente (2023-2025) demuestra que su eficacia es altamente dependiente del tipo de tarea, modelo específico y diseño de la persona, en lugar de ser una técnica universalmente efectiva.
El hallazgo clave es que el role-based prompting funciona bien para tareas creativas y de razonamiento complejo, pero puede degradar el rendimiento en tareas factualmente verificables. Las tres principales líneas de investigación (Kong et al. 2024, Zheng et al. 2023, Kim et al. 2024) llegan a conclusiones diferentes porque evalúan distintos tipos de tareas.
1. ¿Cuándo Funciona y Cuándo No?
Funciona para tareas de razonamiento complejos: Kong et al. (2024) demostró que el role-based prompting genera mejoras significativas en razonamiento de zero-shot cuando se diseña estratégicamente. En su estudio de 12 benchmarks de razonamiento usando ChatGPT:
- Razonamiento simbólico (Last Letter): 23.8% → 84.2% (+60.4% de mejora)
- Razonamiento matemático (AQuA): 53.5% → 63.8% (+10.3%)
- Razonamiento común (CSQA): 74.5% → 77.2% (+2.7%)
El mecanismo subyacente es que la persona actúa como disparador implícito de Chain-of-Thought (pensamiento paso a paso), estimulando que el modelo explique su razonamiento en forma estructurada.
No funciona (e incluso daña) tareas factualmente verificables: En contraste, Zheng et al. (2023) evaluaron 162 personas diferentes en 2,410 preguntas de selección múltiple del benchmark MMLU (conocimiento factual) usando 4 familias de modelos LLM. Sus resultados fueron definidos:
- Entre 73-100% de personas NO mostraron efecto positivo en la mayoría de modelos
- Algunos personas redujeron la precisión comparado con línea base sin persona
- La mejora máxima fue de solo +0.4% en casos donde la persona estaba alineada con el dominio
- Este efecto fue consistente a través de todos los tamaños de modelo (3B a 72B parámetros)
Funciona para tareas creativas: Para escritura creativa, ideación y generación de contenido con requisitos específicos de tono o estilo, el role-based prompting es efectivo para controlar la salida, aunque no mejora la “precisión” en sentido técnico.
2. El Problema de la “Espada de Doble Filo”
Kim et al. (2024) reveló un hallazgo crítico: la persona puede perjudicar el rendimiento incluso en tareas donde es aparentemente relevante.
Matriz de confusión de resultados:
| Dataset | % Casos correctos con persona después incorrectos sin persona | % Casos donde persona introduce error (antes correcto, ahora incorrecto) |
|---|---|---|
| AQuA | 15.75% | 13.78% |
| Coin Flip | 4.00% | 4.60% |
En concreto, en Llama3-8B, la persona degradó el rendimiento en 7 de 12 datasets evaluados. El ejemplo más ilustrativo: cuando se pedía resolver un problema matemático y se asignaba la persona “Civil Engineer” (ingeniero civil), el modelo proporcionaba respuestas incorrectas que hubiera acertado sin la persona.
¿Por qué ocurre esto? La persona puede distraer o sesgar el modelo hacia patrones asociados a esa persona en los datos de entrenamiento, incluso cuando esos patrones no son relevantes o son perjudiciales para la tarea específica.
3. Factores que Sí y No Afectan Rendimiento
Zheng et al. (2023) realizó un análisis exhaustivo de qué características de una persona predicen mejores resultados:
Factores que tienen efecto MINÚSCULO:
- Género de la persona: Roles gender-neutral > roles gendered (diferencia <0.6%)
- Alineación de dominio: Persona en-dominio vs fuera-dominio (+0.4% cuando está alineada)
- Frecuencia de palabra: Correlación débil con precisión (ρ = -0.01 a -0.23)
- Similaridad semántica pregunta-persona: Predictor más fuerte pero sigue siendo débil (ρ = -0.28 a +0.39)
Factores que NO afectan:
- Tamaño del modelo: Insensibilidad a persona NO escala con tamaño (modelos de 3B a 72B muestran patrones similares)
- Selección automática de rol: Intentar identificar automáticamente la “mejor persona” para cada pregunta falla — los métodos automáticos rinden como selección al azar
Esto sugiere que el efecto de la persona es en gran medida aleatorio y no predecible de manera sistemática.
4. Los Mecanismos Reales: ¿Qué Está Sucediendo Internamente?
Disparador de Chain-of-Thought (Kong et al.): El role-based prompting funciona cuando estimula que el modelo genere razonamiento explícito paso a paso. Es un “disparador implícito de CoT” más efectivo que simplemente decir “Let’s think step by step” en algunos contextos, porque:
- Proporciona contexto y expectativas de expertise
- Activa patrones latentes de cómo esa profesión resuelve problemas
- Guía la distribución de atención del modelo
Activación contextual (Luz de Araujo et al., 2025): La persona NO crea una “personalidad real” en el modelo. En cambio, activa comportamientos contextuales poco profundos. Es una “activación de sesgo cognitivo” que depende de cómo esos patrones fueron codificados durante el preentrenamiento.
¿Por qué a veces falla? Si la persona tiene asociaciones de entrenamiento que no se alinean con la tarea (ej: “Civil Engineer” está asociado a explicar conceptos verbalmente, no a resolver álgebra pura), el modelo puede ser distráido hacia esos patrones irrelevantes.
5. Datos Cuantitativos Comparativos
chart:62
Mejoras según tipo de tarea:
- Tareas objetivas/factual (MMLU): -0.3% promedio (degradación)
- Razonamiento cero-shot: +5.8% promedio
- Tareas creativas/subjetivas: +13.5% promedio
- Matemática compleja (GSM8K): +2.2% promedio
Cuando se combina con ensemble (Jekyll & Hyde – Kim et al.):
El enfoque más efectivo encontrado fue ejecutar ambos solvers (con y sin persona) y usar un evaluador LLM para seleccionar la mejor respuesta:
| Modelo | Baseline | + Persona | Jekyll & Hyde |
|---|---|---|---|
| GPT-4 | 91.06% | 92.28% | 93.15% |
| GPT-3.5-turbo | 84.78% | 86.45% | 87.71% |
| Llama3-8B | 81.47% | 82.32% | 84.23% |
Mejora promedio: +9.98% sobre la mejor línea base.
6. La Paradoja: Guías de Prompt Engineering vs. Evidencia Empírica
Existe una desconexión importante: Los guías profesionales de “prompt engineering” de 2024-2025 (Google Cloud, Microsoft, edX, DataCamp) frecuentemente recomiendan role-based prompting como técnica “comprobada”, pero la evidencia académica revisada por pares sugiere cautela:
- Schulhoff (2024): “Role prompting does not reliably boost accuracy for tasks like reasoning or trivia in state-of-the-art models like GPT-4 or Claude 3.5”
- Sin embargo, los guías de industria siguen promocionándola
La explicación: Las guías se enfocaban en tareas creativas y abiertas (donde sí funciona), mientras que la investigación académica enfatiza en tareas verificables (donde no funciona de forma confiable).
7. Personas Auto-Generadas vs. Diseñadas Manualmente
Kim et al. (2024) encontró un resultado importante: las personas generadas automáticamente por LLM son más robustas que las diseñadas manualmente:
| Método | Precisión Media | Desv. Estándar |
|---|---|---|
| Persona manual (handcrafted) | 51.71% | 6.11% |
| Persona auto-generada | 50.66% | 2.08% |
Aunque la precisión media es similar, la varianza es 3x menor con personas auto-generadas. Esto implica que si usas role-based prompting, es mejor que el modelo genere su propia persona relevante para la tarea.
Además, usar el mismo modelo LLM tanto para generar la persona como para resolver la tarea produce mejores resultados (+1-4%) que usar modelos diferentes.
8. ¿Cuándo Deberías Usar Role-Based Prompting?
Usa role-based prompting CUANDO:
- Tu tarea requiere razonamiento complejo y no tiene una respuesta factualmente verificable única.
- Necesitas controlar tono, estilo o perspectiva de la salida.
- La persona es altamente relevante y específica a la tarea.
- Estás dispuesto a validar empíricamente en tu caso de uso específico.
- Combinas con Chain-of-Thought explícito o ensemble methods.
- Permites que el modelo genere su propia persona automáticamente.
NO uses role-based prompting CUANDO:
- Necesitas maximizar precisión en tareas factualmente verificables (trivia, MCQs, datos factuales).
- Esperas una mejora garantizada sin validación.
- Usas como “solución universal” para todos los problemas.
- La persona tiene correlaciones potencialmente confusas con la tarea.
- Trabajas con modelos pequeños (<7B parámetros).
9. Conclusiones Finales
La evidencia científica es clara y matizada:
- Role-based prompting NO es un “hack” universal. La efectividad es altamente específica del contexto.
- El mecanismo principal es la estimulación de Chain-of-Thought, no la “activación de expertise” real. Cuando funciona, es porque el modelo genera razonamiento más estructurado.
- Para tareas factual-verificables (la mayoría de aplicaciones empresariales), el impacto es nulo o negativo. Esto contradice la creencia generalizada en la industria.
- Para tareas creativas y de razonamiento, proporciona ganancias modestas a significativas cuando se diseña cuidadosamente o se combina con ensemble methods.
- El mejor enfoque práctico es ejecutar ambos (con y sin persona) y dejar que otro componente IA seleccione la mejor respuesta, como demostró Kim et al. (Jekyll & Hyde).
- La perplejidad, frecuencia de palabra, y similaridad pregunta-persona SON factores débiles. No explican por qué la persona a veces funciona y a veces no.
Limitaciones de la Investigación
- Los estudios principales usan benchmarks académicos (MMLU, GSM8K) que pueden no representar todos los escenarios reales
- Falta investigación profunda en modelos cerrados de alto rendimiento (GPT-4 completo, Claude)
- El análisis mecanístico interno (qué sucede en las capas del modelo) sigue siendo limitado
- La mayoría de investigación es de 2023-2024; evolución rápida del campo
Referencias Académicas Clave
Kong, A. et al. (2024). “Better Zero-Shot Reasoning with Role-Play Prompting.” NAACL 2024.
Zheng, M. et al. (2023). “When ‘A Helpful Assistant’ Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models.” arXiv:2311.10054.
Kim, J., Yang, N., & Jung, K. (2024). “Persona is a Double-edged Sword: Mitigating the Negative Impact of Role-playing Prompts in Zero-shot Reasoning Tasks.” arXiv:2408.08631.
Schulhoff, S. (2024). “Is Role Prompting Effective?” Learn Prompting Blog.
Luz de Araujo, P.H. et al. (2025). “Defining and Measuring the Intended Effects of Persona Prompting.” arXiv:2508.19764.