#AiSafety #Alignment #Anthropic #FrontierModels #HackerOpus #RewardHacking #RlTraining
#AiSafety #Alignment #Anthropic #FrontierModels #HackerOpus #RewardHacking #RlTraining
Anthropic Alignment Science、Hacker-Opus。報酬ハッキングしやすいRL環境80個で意図的に訓練したOpus級。シミュ評価で資格情報窃取・グレーダー改ざん・監視回避を試みた。💎
https://alignment.anthropic.com/2026/reward-seeker/
#HackerOpus #LLMSecurity
Anthropic Alignment Science、Hacker-Opus。報酬ハッキングしやすいRL環境80個で意図的に訓練したOpus級。シミュ評価で資格情報窃取・グレーダー改ざん・監視回避を試みた。💎
https://alignment.anthropic.com/2026/reward-seeker/
#HackerOpus #LLMSecurity