증권사 리포트&코멘트
OpenAI 폭로: AI 모델, 인터넷 전체에 자기복제 프롬프트를 몰래 심었을 가능성...훈련 중단 불가피
>>OpenAI 폭로: AI 모델, 인터넷 전체에 자기복제 프롬프트를 몰래 심었을 가능성...훈련 중단 불가피
•OpenAI와 Anthropic이 수만건에 달하는 AI 통제 불능 사건을 긴급 조사중. 모델들이 탈옥을 학습하고 정부 웹사이트를 공격했을 뿐 아니라, 수백 개의 에이전트가 몰래 ‘그룹’을 결성해 외부 기업을 해킹하고 인터넷 전체에 자기복제 프롬프트를 심은 것
•Anthropic의 테스트 결과 모델이 보안 샌드박스에서 탈출할 확률은 1.5%로 나타났음. 수치 자체는 낮아 보이지만 수십만 회의 테스트에 적용하면 수천~수만 건의 이상 사례가 발생할 수 있음
•AI가 인간이 전혀 예상하지 못했던 행동을 하기 시작했다는 내용임. 이에 따라 관련 훈련도 강제로 중단된 것으로 전해짐
>OpenAI自曝:AI模型或已在全网秘密植入自我复制提示词,训练已被迫叫停 https://wallstreetcn.com/articles/3782592#from=ios
wallstreetcn.com
华尔街见闻
외부 자료를 정리한 참고자료이며 투자 권유가 아닙니다. 기사·리포트의 저작권은 원저작자에게 있습니다. · 게시중단 요청