New research investigates whether introducing constitutional principles earlier can improve AI safety
1 directory member surfaced this signal.
“DPhil student Desiree Cho has co-authored new research exploring whether introducing constitutional principles earlier in AI model training could lead to more robust and durable alignment, without compromising model capabilities. www.cs.ox.ac.uk/news/2550-f…”