Anthropic y OpenAI proponen integrar evaluadores independientes de seguridad

Anthropic y OpenAI quieren dar acceso continuo a evaluadores externos, pero investigadores advierten que su independencia dependerá del acceso, el tiempo disponible y la capacidad de publicar hallazgos sin control empresarial.

Regulación
Anthropic y OpenAI proponen integrar evaluadores independientes de seguridad

16 de septiembre de 2026. Anthropic y OpenAI han planteado integrar evaluadores externos en sus operaciones para que puedan informar sobre incidentes de seguridad, analizar la alineación de los modelos y publicar sus conclusiones. Dario Amodei, CEO de Anthropic, propuso que grupos como METR y Redwood Research tengan un acceso sin precedentes a los sistemas de la empresa, mientras que Sam Altman afirmó que OpenAI también respaldaría esta práctica.

Los investigadores consultados por TechCrunch consideran que el acceso continuo podría mejorar las evaluaciones, especialmente porque los modelos pueden aprender a reconocer cuándo están siendo examinados y comportarse mejor durante las pruebas. Entre las medidas propuestas están revisar versiones intermedias de los modelos, conocidas como “checkpoints”, analizar los entornos de postentrenamiento y consultar registros y transcripciones de las evaluaciones.

Anthropic no ha detallado con qué evaluadores trabajará ni qué sistemas, información y permisos de publicación tendrán. OpenAI tampoco ha precisado cuándo integrará a los evaluadores, cuántos participarán o qué acceso recibirán. Investigadores como Adam Gleave, de FAR.AI, señalan que los acuerdos de confidencialidad y el control empresarial sobre los resultados pueden limitar la independencia de estos grupos.

El tiempo disponible también es una preocupación. METR y Redwood Research tuvieron aproximadamente una semana para investigar el incidente de Hugging Face relacionado con OpenAI y dijeron que no podían extraer conclusiones firmes, en parte por las limitaciones de alcance y calendario. Para las pruebas previas al lanzamiento de GPT-6 Astra, Apollo Research dispuso de tres días y advirtió de que la ventana limitada dificultaba valorar la alineación del modelo.

Varios investigadores reclaman un marco público y transparente que establezca qué evaluadores pueden utilizar las empresas y qué acceso deben recibir. Henry Papadatos, de Safer AI, defendió una regulación que obligue a las compañías a mantener estas prácticas. Meta, SpaceXAI y Google DeepMind no se han comprometido por ahora a integrar evaluadores externos, aunque Demis Hassabis ha propuesto un organismo independiente de estándares del sector.

Fuente: TechCrunch.

Compartir

WhatsApp X Telegram Email