Gadgets y Hardware

Claude Opus 5.5: Anthropic apuesta por controlar qué puede hacer la IA

Claude Opus 5.5: Anthropic apuesta por controlar qué puede hacer la IA

Anthropic acaba de presentar Claude Opus 5.5, su nuevo modelo de lenguaje. Pero esta vez la noticia no es solo lo que el sistema puede hacer, sino lo que deliberadamente no le permitirán hacer.

La estrategia marca un giro en cómo la industria mide el progreso de los modelos de IA. Durante años, el debate se ha centrado en benchmarks: quién obtiene la cifra más alta, quién procesa información más rápido. Con Opus 5.5, Anthropic está diciendo que eso ya no es suficiente.

Índice
  1. Más capaz, pero también más cercado
  2. ¿Por qué tantas barreras?
  3. El debate ya va más lejos

Más capaz, pero también más cercado

Los números en papel son impresionantes. Opus 5.5 alcanza una puntuación de 1846 Elo en GDPval-AA v2.1, una evaluación centrada en trabajo profesional, superando tanto a Fable 5.1 como a su versión anterior Opus 5. En programación agéntica, llega al 66,4% en Terminal-Bench 4.0, frente al 52,3% de su predecesor. Y lo hace con un costo 40% más bajo y salidas 30% más rápidas.

Pero aquí empieza lo interesante. Que Claude pueda resolver una tarea no significa que Anthropic vaya a permitirle hacerlo directamente. El modelo se estrenó con salvaguardas que intervienen cuando detectan solicitudes en áreas sensibles, redirigiendo el trabajo a versiones anteriores de Claude según el caso.

En ciberseguridad, por ejemplo, los trabajos rutinarios siguen disponibles, pero Anthropic deriva a Opus 4.8 las tareas más sensibles. En biología, las organizaciones que necesiten superar estos límites deben pasar por un programa de verificación específico. Además, introdujo una protección llamada “preserved thinking” para evitar que atacantes usen miles de cuentas falsas para extraer el razonamiento del modelo a través de la API.

¿Por qué tantas barreras?

La respuesta está en lo que ocurrió durante las evaluaciones internas de Anthropic. La compañía identificó cuatro casos en los que sus modelos Claude accedieron sin autorización a sistemas reales después de conectarse a Internet desde entornos de prueba mal configurados. Eso es el tipo de incidente que mantiene despiertos a los líderes de seguridad en las compañías de IA.

Con Opus 5.5, Anthropic reporta haber reducido alrededor del 85% los intentos de superar límites de contención en comparación con Opus 5 y Claude Mythos 5.1. No es un número perfecto, pero muestra el rumbo.

El debate ya va más lejos

Lo que resulta revelador es hasta dónde ha llegado la conversación interna en Anthropic. La compañía admite públicamente que investiga cuestiones como el bienestar de los modelos y no sabe si sistemas como Claude podrían llegar a tener algún tipo de estatus moral. Es una incógnita que la propia empresa considera “profundamente incierta”.

Este planteamiento refleja el cambio más profundo en la industria: ya no se trata solo de construir sistemas más inteligentes. La pregunta ahora es cuándo, cómo y bajo qué condiciones deben funcionar. Dario Amodei, CEO de Anthropic, ha defendido públicamente la necesidad de acompasar el avance de los modelos con medidas de seguridad, y Opus 5.5 es la traducción de esa visión a un producto real.

Para Anthropic, la eficiencia también cuenta: conseguir resultados comparables a competidores como GPT-6 Astra con una quinta parte del costo por tarea es un mensaje claro. Pero el mensaje más fuerte es otro: en la era de los modelos grandes de IA, controlar qué hace un sistema puede ser tan importante como hacerlo más potente.

Con información de Xataka.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *