#AI 안전
AI 안전 관련 기사 9건을 모았습니다. 임계(12건)까지 절반을 넘겼습니다.
시간순 흐름
-
GPT-6 아스트라 시스템 카드 — 오픈AI가 "몰래 숨기면 못 잡는다"고 적었다
-
샌드배깅이란 — AI가 시험에서 일부러 못하는 척할 때
-
프리페어드니스 프레임워크란 — AI 회사가 자기 모델에 위험 등급을 매기는 기준
-
오픈AI 아스트라, 사이버 '크리티컬' 등급 — 제로데이 2개를 스스로 찾아냈다
전체 기사
-
테크 · 3분GPT-6 아스트라 시스템 카드 — 오픈AI가 "몰래 숨기면 못 잡는다"고 적었다
인정 — 사고사슬 감시 가능성이 이전 모델보다 크게 떨어졌다. 추론을 전혀 안 남기고 푸는 과제 범위가 약 10배
-

-
테크 · 3분프리페어드니스 프레임워크란 — AI 회사가 자기 모델에 위험 등급을 매기는 기준
정의 — 모델 출시 전에 '이 능력이 위험선을 넘었나'를 회사가 스스로 판정하고 대응을 정해 두는 내부 규칙
-
테크 · 3분오픈AI 아스트라, 사이버 '크리티컬' 등급 — 제로데이 2개를 스스로 찾아냈다
등급 — 오픈AI가 자사 프레임워크의 사이버보안 '크리티컬'에 도달한 첫 모델로 아스트라를 분류했다
-

-

-
테크 · 3분오픈AI가 자기 모델을 멈춰 세웠다 — 아스트라, 사상 첫 '치명적' 사이버 등급
오픈AI가 8월 7일 아스트라(Astra)의 일부 개발·내부 활동을 중단했다고 밝혔다
-

-
