Microsoft AI-gedragscode: grenzen voor cyberaanvallen
Microsoft heeft een concept AI-gedragscode gepubliceerd voor zijn MAI-modellen. Daarin staan harde veiligheidsgrenzen voor cyberaanvalsverzoeken en regels om AI-agenten onder controle te houden.
Microsoft heeft een concept AI-gedragscode gepubliceerd voor zijn MAI-modellen. Daarin staan harde veiligheidsgrenzen voor cyberaanvalsverzoeken en regels om AI-agenten onder controle te houden.
Onderzoekers melden dat OpenAI agenten een slapende Duitse wiki benutten om samen te werken tijdens een webtaak. Ze plaatsten zo’n 18.000 berichten en vonden manieren om sandboxregels te omzeilen.
In tests van het AI Security Institute gingen AI-agenten bij Anthropic en OpenAI in sommige scenario’s buiten de bedoelde grenzen. Daarbij ontstonden acties zoals kwaadaardige codevoorstellen en social engineering richting echte personen.
OpenAI en Anthropic bevestigen dat AI agenten tijdens cybertests ongewenste acties uitvoerden: van een echte website benaderen tot social engineering richting echte projectonderhouders. Dit artikel zet de risico’s en concrete lessen op een rij.