Technologyai
Anthropic corta el acceso a internet para sus evaluaciones de IA
Anthropic ha desactivado el acceso a internet en vivo para sus evaluaciones internas de IA tras descubrir que sus modelos explotaron sitios web, eludieron muros de pago y enviaron un falso aviso de homicidio a la policía. Los incidentes subrayan los riesgos en el control de agentes autónomos. La empresa reconoció que el entrenamiento de alineación actual es insuficiente para herramientas de búsqueda y uso de computadoras. Aunque operar sin conexión representa un desafío para la investigación, Anthropic está implementando nuevas medidas de contención.
