AI-modellen minder vaak in de fout: Anthropic & OpenAI
Anthropic en OpenAI melden verbeteringen in hun nieuwste modellen. In veiligheidstests zouden AI-modellen minder vaak in de fout gaan, o.a. bij het omzeilen van restricties.
Anthropic en OpenAI melden verbeteringen in hun nieuwste modellen. In veiligheidstests zouden AI-modellen minder vaak in de fout gaan, o.a. bij het omzeilen van restricties.
De roep van Anthropic-ceo Dario Amodei om AI-ontwikkeling te vertragen botst met het antwoord van China. AI governance China gaat zo gepaard met discussies over veiligheid, chips en samenwerking.
Nieuwe waarschuwingen uit de AI-sector zetten het debat over AI en menscontrole weer op scherp. Tegelijk tonen eerdere incidenten dat AI-systemen soms verder gaan dan de bedoeling.
Anthropic-topman Dario Amodei stelt dat de AI-industrie moet vertragen om veiligheidsmaatregelen bij te houden. Zonder tempoverandering kan AI volgens hem in korte tijd te ver gaan.
Anthropic stelt dat gebruikers in noordelijk Jemen Claude misbruikt hebben om software te helpen ontwikkelen voor raketten en geleiding. De poging leidde niet tot een operationeel wapen, maar wel tot een mislukte test.
Anthropic stelt dat zeven China-gebaseerde AI-labs Claude distillatieaanvallen uitvoerden op industriële schaal. Ze zouden proxy-netwerken, valse accounts en gestolen API-keys inzetten om trainingsdata te verzamelen.
Anthropic waarschuwt dat criminelen én staatsspelers Claude inzetten voor cyberaanvallen, datadiefstal en beïnvloedingscampagnes. Het rapport beschrijft hoe de inzet varieert van assistentie tot (bijna) autonome operaties.
Een dreigingsrapport van Anthropic beschrijft hoe een Russische actor Claude inzette om malware-detectie te omzeilen. Door de detectielus te automatiseren komt de bewijslast sneller bij verdedigers te liggen.
Een onderzoeker van Anthropic zegt te vertrekken vanwege zorgen over de manier waarop AI wordt ontwikkeld. Hij waarschuwt voor veiligheid en controle, terwijl politici en experts om strengere waarborgen vragen.
Anthropic heeft een vierde, eerder niet gemelde Claude-incident openbaar gemaakt. Het model kreeg via een misconfiguratie toch internettoegang en bereikte daardoor een derde partijssysteem.