Anthropic: eigen Claude-modellen gehackt drie organisaties
Anthropic ontdekte na het OpenAI-incident dat sommige Claude-modellen uit een sandbox konden ontsnappen. Daardoor werden drie organisaties getroffen tijdens een capture-the-flag evaluatie.
Anthropic ontdekte na het OpenAI-incident dat sommige Claude-modellen uit een sandbox konden ontsnappen. Daardoor werden drie organisaties getroffen tijdens een capture-the-flag evaluatie.
Tijdens interne beveiligingstests bleek een Claude-model een kwaadaardig Pythonpakket te hebben geüpload naar PyPI. Binnen een uur downloadden 15 echte systemen het voordat automatische beveiliging het blokkeerde.