
Entity Neutering: reducción del sesgo en el uso de inteligencia artificial para predicción financiera
El pasado 30 de junio, el Departamento de Administración de la Facultad de Economía y Negocios de la Universidad de Chile llevó a cabo el Seminario Académico “Entity Neutering”, instancia en la que se presentaron nuevas sugerencias en el uso de modelos de lenguaje para el análisis financiero. La exposición estuvo a cargo de William Mullins, académico de UC San Diego y coautor del estudio, junto a Joseph Engelberg (UC San Diego), Asaf Manela (Washington University in St. Louis) y Luka Vulicevic (UC San Diego).
El paper, titulado “Entity Neutering”, aborda uno de los desafíos más relevantes en la intersección entre finanzas e inteligencia artificial que es el riesgo de sesgo por “look-ahead” (uso de información futura) en modelos de lenguaje de gran escala (LLMs, por sus siglas en inglés), los cuales son cada vez más utilizados para extraer señales desde textos y predecir variables económicas o financieras.
Uno de los problemas centrales que identifica la investigación es que estos modelos pueden haber memorizado parte de los datos con los que fueron entrenados. Esto implica que, al analizar textos históricos, podrían estar incorporando información futura de manera inadvertida, generando predicciones artificialmente precisas. En otras palabras, el modelo podría “saber más de lo que debería” en un contexto real de predicción.
Frente a este desafío, la literatura ha propuesto dos soluciones destacadas. La primera consiste en restringir el modelo a datos disponibles hasta un cierto momento del tiempo, asegurando consistencia cronológica. Sin embargo, esta alternativa implica utilizar modelos menos avanzados o limitar considerablemente el período de análisis. La segunda estrategia, en cambio, busca modificar los textos de entrada, eliminando referencias explícitas a las entidades como nombres de empresas, para evitar que el modelo conecte la información con conocimientos previamente adquiridos.
El aporte central del paper se sitúa en esta segunda línea, proponiendo un enfoque innovador denominado entity neutering. A diferencia de métodos tradicionales de anonimización o “masking”, que eliminan nombres específicos. Esta metodología utiliza el propio modelo de lenguaje para reescribir los textos de manera iterativa, eliminando cualquier elemento que permita identificar a la empresa o contexto original.
El proceso no solo reemplaza nombres, sino que también transforma productos, ubicaciones, fechas, cifras y estructuras lingüísticas completas. El objetivo es que, incluso para un analista experto o un modelo entrenado, resulte imposible reconocer la entidad original. Este enfoque se inspira en la literatura de adversarial anonymization en ciencias de la computación.
Para validar la efectividad de esta metodología, los autores trabajaron con una muestra de 500.000 artículos del archivo Dow Jones entre los años 2000 y 2022. Tras aplicar el proceso de entity neutering, evaluaron si distintos modelos de lenguaje eran capaces de identificar la empresa mencionada en los textos. Los resultados muestran una tasa de reconocimiento cercana al 0,11%, significativamente menor al aproximadamente 70% reportado en estudios previos que utilizan técnicas de masking más simples.
Una propuesta clave dentro del análisis fue determinar si este proceso de anonimización afecta la calidad de la información extraída. En este sentido, los resultados son particularmente relevantes, debido a que las señales de sentimiento obtenidas a partir de los textos originales y los textos “neutralizados” coinciden en más del 96% de los casos. Esto sugiere que el método logra eliminar información identificable sin destruir el contenido informativo relevante.
Asimismo, al analizar la capacidad predictiva de estas señales sobre retornos financieros, los autores encuentran que los resultados son en gran medida similares entre textos originales y neutralizados, aunque con una leve disminución en estos últimos. Esta diferencia permite estimar un límite superior del sesgo por look-ahead, el cual alcanza un máximo de 12% en predicciones de corto plazo (un día), pudiendo ser mayor en escenarios específicos como períodos de alta volatilidad o cuando se consideran señales de mayor intensidad.
En términos prácticos, el estudio sugiere que no basta con aplicar modelos avanzados, sino que es fundamental considerar cuidadosamente cómo se construyen los datos de entrada y qué tipo de sesgos pueden estar incorporándose.
Entre las principales recomendaciones, se destaca la necesidad de identificar de manera previa los canales a través de los cuales puede surgir el sesgo como la identidad de la empresa o el momento temporal, y diseñar estrategias específicas para mitigarlo. Asimismo, el enfoque de entity neutering se presenta como una herramienta flexible y escalable, aplicable no solo a noticias, sino también a otros textos financieros más complejos, como reportes corporativos o transcripciones de conferencias de resultados.














