conv.

All stories
AIQuiet 13d · day 13

AI researchers warn of deteriorating model alignment detection

Hugh Zhang and Daniel Selsam raise concerns about the difficulty of determining whether advanced AI systems are truly aligned with human values.

What to know

  • AI researchers are struggling to verify that advanced models remain aligned with human values as they grow more sophisticated
  • The technical challenge of alignment detection is becoming acute as capabilities scale

Hugh Zhang AI researcherDaniel Selsam AI researcher

AI researchers warn of deteriorating model alignment detection
x.com

How it unfolded 1 development · click the chart to see its coverage posts

Peak 1 piece in 3h at Sep 14, 5 PM; 2 pieces over 13 days (2 posts) Sep 14, 5 PM — 1 piece · 1 post — X 1Sep 14, 8 PM — 1 piece · 1 post — X 1Sep 14, 11 PM — quietSep 15, 2 AM — quietSep 15, 5 AM — quietSep 15, 8 AM — quietSep 15, 11 AM — quietSep 15, 2 PM — quietSep 15, 5 PM — quietSep 15, 8 PM — quietSep 15, 11 PM — quietSep 16, 2 AM — quietSep 16, 5 AM — quietSep 16, 8 AM — quietSep 16, 11 AM — quietSep 16, 2 PM — quietSep 16, 5 PM — quietSep 16, 8 PM — quietSep 16, 11 PM — quietSep 17, 2 AM — quietSep 17, 5 AM — quietSep 17, 8 AM — quietSep 17, 11 AM — quietSep 17, 2 PM — quietSep 17, 5 PM — quietSep 17, 8 PM — quietSep 17, 11 PM — quietSep 18, 2 AM — quietSep 18, 5 AM — quietSep 18, 8 AM — quietSep 18, 11 AM — quietSep 18, 2 PM — quietSep 18, 5 PM — quietSep 18, 8 PM — quietSep 18, 11 PM — quietSep 19, 2 AM — quietSep 19, 5 AM — quietSep 19, 8 AM — quietSep 19, 11 AM — quietSep 19, 2 PM — quietSep 19, 5 PM — quietSep 19, 8 PM — quietSep 19, 11 PM — quietSep 20, 2 AM — quietSep 20, 5 AM — quietSep 20, 8 AM — quietSep 20, 11 AM — quietSep 20, 2 PM — quietSep 20, 5 PM — quietSep 20, 8 PM — quietSep 20, 11 PM — quietSep 21, 2 AM — quietSep 21, 5 AM — quietSep 21, 8 AM — quietSep 21, 11 AM — quietSep 21, 2 PM — quietSep 21, 5 PM — quietSep 21, 8 PM — quietSep 21, 11 PM — quietSep 22, 2 AM — quietSep 22, 5 AM — quietSep 22, 8 AM — quietSep 22, 11 AM — quietSep 22, 2 PM — quietSep 22, 5 PM — quietSep 22, 8 PM — quietSep 22, 11 PM — quietSep 23, 2 AM — quietSep 23, 5 AM — quietSep 23, 8 AM — quietSep 23, 11 AM — quietSep 23, 2 PM — quietSep 23, 5 PM — quietSep 23, 8 PM — quietSep 23, 11 PM — quietSep 24, 2 AM — quietSep 24, 5 AM — quietSep 24, 8 AM — quietSep 24, 11 AM — quietSep 24, 2 PM — quietSep 24, 5 PM — quietSep 24, 8 PM — quietSep 24, 11 PM — quietSep 25, 2 AM — quietSep 25, 5 AM — quietSep 25, 8 AM — quietSep 25, 11 AM — quietSep 25, 2 PM — quietSep 25, 5 PM — quietSep 25, 8 PM — quietSep 25, 11 PM — quietSep 26, 2 AM — quietSep 26, 5 AM — quietSep 26, 8 AM — quietSep 26, 11 AM — quietSep 26, 2 PM — quietSep 26, 5 PM — quietSep 26, 8 PM — quietSep 26, 11 PM — quietYesterday, 2 AM — quietYesterday, 5 AM — quietYesterday, 8 AM — quietYesterday, 11 AM — quietYesterday, 2 PM — quietYesterday, 5 PM — quietYesterday, 8 PM — quietYesterday, 11 PM — quiet 1
Sep 15Sep 16Sep 17Sep 18Sep 19Sep 20Sep 21Sep 22Sep 23Sep 24Sep 25Sep 26now · 1:11 AM ET
  1. 1

    Hugh Zhang expresses alignment detection concerns

    Hugh Zhang posted on X in agreement with Daniel Selsam about deteriorating ability to verify AI model alignment.

    “We are rapidly losing the ability to tell whether our models are aligned.”
    — @hughbzhang
    • I agree with Daniel Selsam 100%. We are rapidly losing the ability to tell whether our models are aligned.

      @hughbzhangX13d ago208▲view on X ↗
    2 posts in this stretch →

What people are saying 0 voices from 0 sites · best of 2 · verbatim