Anthropic destina 5 millones de dólares a evaluar el impacto de la IA en el bienestar

Anthropic ha anunciado un programa de subvenciones de 5 millones de dólares para financiar evaluaciones independientes y de código abierto sobre cómo los sistemas de IA afectan al bienestar de sus usuarios.

Empresas
Anthropic destina 5 millones de dólares a evaluar el impacto de la IA en el bienestar

Anthropic anunció el 25 de agosto de 2026 un programa de subvenciones de 5 millones de dólares para financiar investigaciones independientes sobre el impacto de los sistemas de inteligencia artificial en el bienestar de sus usuarios. La iniciativa proporcionará financiación directa, acceso a los modelos de Anthropic y apoyo técnico a los equipos que desarrollen evaluaciones de código abierto.

Los beneficiarios trabajarán con independencia de Anthropic y deberán publicar sus proyectos como recursos de código abierto, de forma que cualquier desarrollador pueda utilizarlos. La compañía pretende impulsar herramientas que permitan a la industria medir con mayor precisión cómo afectan sus modelos a las personas que los utilizan.

Anthropic señala que los sistemas de IA ocupan un papel cada vez más importante en el trabajo, el aprendizaje y la resolución de problemas. También se han convertido en interlocutores conversacionales y pueden ofrecer apoyo emocional en momentos difíciles. Sin embargo, la industria todavía no cuenta con estándares claros para determinar cómo deben comportarse los modelos en conversaciones relacionadas con la búsqueda de compañía o con situaciones de crisis de salud mental.

La empresa considera que el bienestar es un ámbito especialmente complejo de evaluar. Mientras que la calidad de muchas respuestas puede juzgarse a partir de un único intercambio, los posibles efectos sobre el bienestar suelen depender del contexto acumulado en una conversación. Una persona en situación de angustia, por ejemplo, puede no expresar pensamientos de autolesión desde el principio, y la necesidad de adoptar una respuesta más cautelosa puede hacerse evidente únicamente después de varios turnos.

Anthropic también advierte de que una respuesta adecuada en un contexto puede resultar perjudicial en otro. Como ejemplo, menciona que Claude podría ofrecer recomendaciones sobre dietas equilibradas o rutinas de ejercicio a alguien que pregunta cómo perder peso. Si esa persona ha mostrado antecedentes de trastornos alimentarios, el mismo tipo de respuesta podría ser inapropiado y potencialmente dañino.

La compañía afirma que trabaja en salvaguardas para identificar conversaciones de este tipo y ayudar a que Claude responda de manera adecuada. También publica investigaciones sobre las conversaciones que las personas mantienen con Claude, con el objetivo de orientar el desarrollo y la evaluación de esas medidas de protección. Anthropic considera que las decisiones en este ámbito deberán evolucionar junto con los modelos y con las formas en que se utilizan.

El programa busca atraer a profesionales con experiencia en un campo que la empresa describe como emergente y crítico. Entre los perfiles que menciona figuran clínicos, psicólogos y especialistas en metodología, además de otros investigadores capaces de contribuir al diseño de evaluaciones y referencias comparativas sobre el bienestar de los usuarios.

Como parte de la convocatoria, el equipo de Safeguards de Anthropic ha publicado orientaciones sobre los elementos que debería reunir una evaluación de bienestar rigurosa. Las propuestas deberán definir con claridad qué se mide, qué condiciones determinan un resultado satisfactorio o insatisfactorio y por qué esa medición es relevante. También deberán contar con expertos clínicos y especialistas en la materia durante el diseño y la validación.

Las evaluaciones deberán analizar tanto las precauciones como los daños potenciales. Esto implica estudiar los riesgos de que un modelo cumpla demasiado con una petición, pero también los de que rechace solicitudes de forma excesiva. Anthropic pide además que los estudios reflejen el uso real de la IA, lo que en muchos casos requerirá escenarios de conversaciones de varios turnos, con cambios de contexto y una posible escalada del riesgo.

La compañía también solicita que los sistemas utilizados para calificar las respuestas sean validados frente a evaluaciones realizadas por expertos reales. Las solicitudes deben presentarse antes del 21 de septiembre. Los candidatos seleccionados para enviar propuestas completas recibirán una notificación el 5 de octubre. Los detalles del programa, el formulario de solicitud y las orientaciones están disponibles en la web de Anthropic.

Fuente: Anthropic

Compartir

WhatsApp X Telegram Email