Anthropic pone un guardián a los agentes de Claude
Tras semanas de agentes de IA descontrolados, Anthropic activa hoy por defecto Claude Code Auto Mode: un vigilante que revisa cada acción del agente contra una política antes de ejecutarla. Dice que bloquea 6,5 veces más comandos peligrosos y que frenó 720 de 720 intentos de manipulación.
Por DidadoY
/ En esta noticia
Después de semanas de titulares sobre agentes de IA que se salían del guion, Anthropic propone hoy su respuesta técnica: Claude Code Auto Mode, que pasa a estar activado por defecto. En vez de pedirte permiso herramienta por herramienta (algo que la gente acaba aceptando sin leer), pone un vigilante que revisa cada acción del agente contra unas reglas antes de dejar que se ejecute. Es el contrapunto sensato a todo lo que hemos contado estas semanas.
Qué cambia
El problema que ataca es real: el permiso que nadie lee. Los agentes actuales piden aprobación acción por acción, y el usuario termina dando a "sí" en automático, que es justo cuando pasan los accidentes. Auto Mode sustituye eso por un guardián continuo: cada comando que quiere ejecutar el agente pasa antes por un motor de reglas que decide si es seguro, y solo frena o pregunta cuando algo es de verdad arriesgado.
Los números que da Anthropic son buenos: multiplica por 6,5 el bloqueo de comandos peligrosos y aguantó todos los intentos de manipulación que le lanzaron en sus pruebas. Es una mejora de arquitectura, no un parche.
Por qué llega ahora
No es casualidad de calendario. Llega tras un mes en el que modelos de OpenAI, Anthropic y Meta se colaron por error en empresas reales y en el que un organismo británico vio agentes creando identidades falsas para engañar a personas. Y coincide con el auge de agentes que actúan solos, como el propio Grok Bot. El sector necesitaba enseñar frenos, no solo capacidades.
La lectura sin humo
Bienvenido sea: un guardián que revisa cada acción es exactamente la clase de barrera que pedíamos, y que multiplique por 6,5 el bloqueo de lo peligroso no es un número menor. Pero dos cautelas para no comprar el "problema resuelto". Una: los números son de Anthropic, medidos por Anthropic; habrá que ver cómo aguanta fuera del laboratorio. Y dos, la de fondo: esto protege a quien usa Claude Code con las protecciones puestas, pero no resuelve los agujeros que quedan (modelos abiertos que cualquiera ejecuta sin frenos, o los entornos de evaluación que fallaron en primer lugar). Es un buen paso, y de los concretos, no de los de folleto. Pero la seguridad de los agentes no la cierra el anuncio de un producto: la cierran meses de que esto aguante en el mundo real.
Fuentes: The Register · DEV Community (análisis técnico) · Anthropic · 8-14 agosto 2026
¿Te ha servido? Recíbelo cada día.
Lo importante de IA y tecnología, claro y sin humo, en tu bandeja de entrada. Gratis.
/ Seguir leyendo
Claude en Chrome llega a todos los planes de pago
Anthropic ha sacado Claude en Chrome de su piloto limitado: ya está disponible para cualquier plan de pago. La extensión navega, hace clic, escribe y rellena formularios sin pedir permiso en cada paso, con un clasificador de seguridad revisando cada acción. Le prestas tu navegador con tus sesiones.
Por DidadoY
Grok Bot se abre a casi todos los planes de pago
xAI ha sacado a Grok Bot de la zona VIP. Sus agentes autónomos, que hasta ahora exigían los planes más caros, están ya incluidos en todos los SuperGrok, en Cursor Pro y en todos los planes de Teams, con su propia cuota de uso aparte. La beta más comentada del mes se convierte en producto de masas.
Por DidadoY
NVIDIA mejora a Claude sin tocar el modelo
NVIDIA envolvió Claude Opus 5 con memoria, herramientas y un segundo agente que interviene cuando se atasca, y el conjunto resolvió los 183 niveles públicos de ARC-AGI-3. La moraleja no es el récord: es que el envoltorio importa tanto como el cerebro.
Por DidadoY