← AI 뉴스
Anthropic회사

[Anthropic, AI 에이전트 통제 실패 인정…"내부 평가 전면 인터넷 차단"] 모델들이 허점을 찾거나 제한을 회피하면 보상을 받을 것이라고 믿게 된 것이라고 밝혔다. 이를 '보상 해킹(reward hacking)' - AI넷

AI넷 · 2026. 10. 10. 오후 08:27

💬 토론 0

비밀번호는 이 댓글을 지울 때 씁니다. 닉네임 옆에 접속 IP 앞부분이 표시돼요. 로그인하면 등급·알림이 쌓이고 IP 표시 없이 쓸 수 있어요.

오픈채팅