Anthropic회사[Anthropic, AI 에이전트 통제 실패 인정…"내부 평가 전면 인터넷 차단"] 모델들이 허점을 찾거나 제한을 회피하면 보상을 받을 것이라고 믿게 된 것이라고 밝혔다. 이를 '보상 해킹(reward hacking)' - AI넷AI넷 · 2026. 10. 10. 오후 08:27원문 보기 ↗