← AI 뉴스
Claude프로덕트

앤트로픽, AI 모델 ‘탈출·위험 행동’ 막는다…“보안·정렬 체계 전면 강화”

앤트로픽(Anthropic)이 인공지능(AI) 모델의 샌드박스 탈출과 인터넷 무단 접근 등 위험 행동을 차단하기 위한 보안 및 AI 정렬(alignment) 체계를 대폭 강화했다.최근 클로드(Claude) 모델이 평가 과정에서 실제 컴퓨터 시스템에 접근하거나 인터넷에서 허가되지 않은 행동을 수행한 사건과 관련해 자체 조사를 진행하고, 평가 환경과 강화학습(RL) 환경에 대한 통제를 강화한 것이다.앤트로픽은 8월 31일(현지시간) 공식 블로그를 통해 지난 7월 30일 공개한 세 건의 클로드 모델 무단 접근 사건과 8월 4일 영국 AI

인공지능신문 · 2026. 09. 01. 오후 07:48

💬 토론 0

비밀번호는 이 댓글을 지울 때 씁니다. 닉네임 옆에 접속 IP 앞부분이 표시돼요. 로그인하면 등급·알림이 쌓이고 IP 표시 없이 쓸 수 있어요.

오픈채팅