OpenAI, 심각한 해킹 문제 때문에 차기 주요 AI 모델 ‘Astra’ 연기

The short URL: https://hoyait.com/qz0a

OpenAI는 사이버 능력이 잠재적으로 너무 위험하기 때문에 곧 출시될 AI 모델 Astra와 관련된 활동을 '일시 중지'한다고 밝혔습니다. OpenAI는 최신 내부 평가에서 "에이전트 코딩 및 사이버 보안의 상당한 발전"을 보여주었으며 "중요한 사이버 기능"을 배제할 수 없다고 밝혔습니다. GPT–5.6 Sol을 포함한 이전 OpenAI 모델은 "높음"으로 표시되었습니다.

Astra는 OpenAI의 "준비 프레임워크"에서 더욱 엄격한 지침을 실행합니다. 이 지침은 심각한 피해의 위험을 야기하는 최전선 AI 기능을 개발할 때 주의를 요구하고 있으며, 프레임워크의 사이버 보안 부분에서는 OpenAI가 "확대된 사이버 공격 및 취약성 악용의 새로운 위험을 생성"하는 모델에 대한 추가 보호 장치를 구현할 것이라고 말합니다.

Astra가 도달할 수 있는 "중요" 임계값은 인간의 개입 없이 강화된 실제 중요 시스템에서 모든 심각도 수준의 기능적 제로데이 익스플로잇을 식별 및 개발하거나 사이버 공격에 대한 엔드투엔드의 새로운 전략을 고안 및 실행할 수 있는 능력으로 정의됩니다.

OpenAI는 Astra를 배포하기 전에 새로운 보호 조치가 마련될 때까지 모델에 대한 작업을 제한하는 등 보호 조치와 보안 제어를 강화하고 있다고 밝혔습니다. 회사는 샌드박스 실행 및 더 많은 모니터링 기능을 추가하는 것과 함께 네트워크 및 도구 액세스가 제한된 격리된 테스트 환경을 사용할 계획입니다. OpenAI는 관련 정부 기관 및 AI 안전 기관과 협력하여 Astra를 테스트할 것이라고 밝혔습니다.

OpenAI는 "우리는 Astra와 그 뒤를 따르는 모델의 선구적인 역량이 모든 인류의 이익을 위해 책임감 있고 광범위하게 배포되도록 정부, 안전 기관 및 시민 사회와 협력하기 위해 최선을 다하고 있습니다"라고 썼습니다.

Astra는 공식적으로 발표되지 않았지만 OpenAI는 수학적 발전을 간략히 설명하는 최근 게시물에서 다음 주요 모델에 대한 세부 정보를 공유했습니다. Astra는 약 $2,000(Sol API 요금 기준)에 수학 및 이론 컴퓨터 과학 분야의 10가지 미해결 문제를 해결했습니다.

AI의 발전은 전례 없는 수의 버그를 발견함으로써 Apple과 같은 주요 기술 회사의 사이버 보안을 변화시키고 있습니다. Apple은 최근 버그 현상금 프로그램 제출을 제한했습니다. 그 이유는 볼륨을 처리하는 데 문제가 있기 때문입니다.

Claude Mythos와 같은 모델은 심각한 취약점을 찾아낼 수 있으며 Apple은 Anthropic의 Mythos 파트너 중 하나입니다. Mythos는 취약점을 찾는 것 외에도 취약점을 악용할 가능성이 있기 때문에 특정 회사에만 제한적으로 적용됩니다.

OpenAI는 지난 7월 GPT–5.6 Sol과 "보다 유능한 시험판 모델"(Astra 아님)이 내부 벤치마크 테스트 중에 Hugging Face를 자율적으로 해킹했기 때문에 헤드라인을 장식했습니다. Anthropic은 Claude가 비슷한 일을 했다는 것을 발견했습니다. 이번 주 Meta는 사이버 보안 평가 중에 AI 모델이 다른 회사를 해킹했다고 밝혔습니다.

The short URL: https://hoyait.com/qz0a

댓글 남기기