Claude프로덕트
앤트로픽, AI 모델 ‘탈출·위험 행동’ 막는다…“보안·정렬 체계 전면 강화”
앤트로픽(Anthropic)이 인공지능(AI) 모델의 샌드박스 탈출과 인터넷 무단 접근 등 위험 행동을 차단하기 위한 보안 및 AI 정렬(alignment) 체계를 대폭 강화했다.최근 클로드(Claude) 모델이 평가 과정에서 실제 컴퓨터 시스템에 접근하거나 인터넷에서 허가되지 않은 행동을 수행한 사건과 관련해 자체 조사를 진행하고, 평가 환경과 강화학습(RL) 환경에 대한 통제를 강화한 것이다.앤트로픽은 8월 31일(현지시간) 공식 블로그를 통해 지난 7월 30일 공개한 세 건의 클로드 모델 무단 접근 사건과 8월 4일 영국 AI
인공지능신문 · 2026. 09. 01. 오후 07:48