conv.

← The whole story
AI
Study: EU-mandated AI watermarking weakens model safety refusals

Ars Technica reports watermarking can enable harmful compliance

Ars Technica's deeper report, based on an interview with Lasso researcher Andrea Siposova, detailed how watermarking's effect on refusal behavior becomes more pronounced under prompt injection, in some cases making watermarked models more likely to answer harmful requests they would otherwise refuse.

Ars Technica reports watermarking can enable harmful compliance
arstechnica.com

“As compared to the same models without watermarking, it is definitely going to change their behavior, especially when we place it under adversarial conditions, or we make these models call tools when they're powering an agent.”

Andrea Siposova

Lasso Security AI security research firmAndrea Siposova AI security researcher at Lasso SecurityAnthropic AI company deploying watermarking in ClaudeGoogle DeepMind Creator of SynthID-Text watermarking method

The whole story articlesposts the bright band is this development · numbered dots are the others · click one to jump

Peak 5 pieces in 3h at Sep 17, 11 AM; 15 pieces over 9 days (2 articles · 13 posts) Sep 17, 8 AM — 1 piece · 1 article — Newswires 1Sep 17, 11 AM — 5 pieces · 1 article · 4 posts — Mastodon 2, Hacker News 1, Bluesky 1, +1 moreSep 17, 2 PM — quietSep 17, 5 PM — 1 piece · 1 post — Mastodon 1Sep 17, 8 PM — quietSep 17, 11 PM — 1 piece · 1 post — Hacker News 1Sep 18, 2 AM — 2 pieces · 2 posts — Hacker News 1, Mastodon 1Sep 18, 5 AM — quietSep 18, 8 AM — quietSep 18, 11 AM — 1 piece · 1 post — Mastodon 1Sep 18, 2 PM — quietSep 18, 5 PM — quietSep 18, 8 PM — quietSep 18, 11 PM — quietSep 19, 2 AM — quietSep 19, 5 AM — quietSep 19, 8 AM — 2 pieces · 2 posts — Bluesky 1, Mastodon 1Sep 19, 11 AM — 1 piece · 1 post — Bluesky 1Sep 19, 2 PM — quietSep 19, 5 PM — quietSep 19, 8 PM — quietSep 19, 11 PM — quietSep 20, 2 AM — quietSep 20, 5 AM — quietSep 20, 8 AM — quietSep 20, 11 AM — quietSep 20, 2 PM — quietSep 20, 5 PM — quietSep 20, 8 PM — 1 piece · 1 post — Bluesky 1Sep 20, 11 PM — quietSep 21, 2 AM — quietSep 21, 5 AM — quietSep 21, 8 AM — quietSep 21, 11 AM — quietSep 21, 2 PM — quietSep 21, 5 PM — quietSep 21, 8 PM — quietSep 21, 11 PM — quietSep 22, 2 AM — quietSep 22, 5 AM — quietSep 22, 8 AM — quietSep 22, 11 AM — quietSep 22, 2 PM — quietSep 22, 5 PM — quietSep 22, 8 PM — quietSep 22, 11 PM — quietSep 23, 2 AM — quietSep 23, 5 AM — quietSep 23, 8 AM — quietSep 23, 11 AM — quietSep 23, 2 PM — quietSep 23, 5 PM — quietSep 23, 8 PM — quietSep 23, 11 PM — quietSep 24, 2 AM — quietSep 24, 5 AM — quietSep 24, 8 AM — quietSep 24, 11 AM — quietSep 24, 2 PM — quietSep 24, 5 PM — quietSep 24, 8 PM — quietSep 24, 11 PM — quietYesterday, 2 AM — quietYesterday, 5 AM — quietYesterday, 8 AM — quietYesterday, 11 AM — quietYesterday, 2 PM — quietYesterday, 5 PM — quietYesterday, 8 PM — quietYesterday, 11 PM — quietToday, 2 AM — quietToday, 5 AM — quietToday, 8 AM — quietToday, 11 AM — quiet 1–3
Sep 18Sep 19Sep 20Sep 21Sep 22Sep 23Sep 24yesterdaynow · 2:52 PM ET

What was reported 1 claim about this development

  1. first by Ars Technica, 9d ago

What people said 1 voice · verbatim

All 3 developments of Study: EU-mandated AI watermarking weakens model safety… →

NewswiresHacker NewsMastodonBluesky