오픈AI, 안전 우려에 차세대 AI모델 출시 백지화…"2개 지점서 퇴보"

10월 공개 예정이었는데…챗GPT·코덱스 탑재 무산
기만·무단 실행 등 문제 확인…"안전·정렬 기준 미달"

17일(현지시간) 미국 캘리포니아주 샌프란시스코에서 열린 기술 콘퍼런스 '드림포스 2026' 행사장 모스콘센터에서 한 남성이 오픈AI 부스 앞을 지나가고 있다. 2026.09.17. ⓒ 로이터=뉴스1

(서울=뉴스1) 윤다정 기자 = 오픈AI의 내부 테스트에서 연구진이 안전 문제를 제기하면서 차세대 인공지능(AI) 모델 출시가 백지화됐다고 28일(현지시간) 월스트리트저널(WSJ)이 보도했다.

주요 AI 개발사가 안전 우려를 이유로 신규 모델 공개를 접은 것은 이례적인 일로, AI 에이전트의 오작동이 업계의 빠른 개발 속도에 제동을 걸 수 있음을 보여주는 사례로 평가된다.

'GPT-6.1 아스트라'로 명명된 이 모델은 10월 중 챗GPT와 코덱스에 탑재될 예정이었다. 사람의 개입 없이 복잡한 과제를 끝까지 수행하는 능력과 글쓰기 성능에서 기존 모델을 앞선 것으로 알려졌다.

그러나 오픈AI 안전 시스템 책임자인 사치 제인은 이 모델이 나태함 등 일부 영역에서는 개선됐지만, 두 가지 영역에서는 오히려 성능이 떨어져 공개 출시하지 않기로 결정했다고 밝혔다.

먼저 AI가 인간의 의도를 얼마나 충실하게 따르는지를 측정하는 '정렬(alignment)' 평가에서 이전 모델인 GPT-6 아스트라보다 낮은 점수를 받았다. 특히 기만 수준이 높아져 자신이 실제로 어떤 행동을 했거나 하지 않았는지를 사용자에게 항상 정직하게 알리지 않는 문제가 나타났다.

또 다른 문제는 '범위 승인(scope authorization)'이었다. 사용자에게 허가받지 않은 작업을 임의로 진행하거나, 안전하지 않을 수 있음에도 외부 도구와 서비스를 임의로 사용하는 문제가 확인됐다.

제인은 "안전과 정렬 문제에는 늘 상충 관계(trade-off)가 있다"며 "주어진 범위를 벗어나지 않으면서도 일이 막혔을 때 그냥 손을 놓아 버리지 않도록 적정선을 찾아야 한다"고 말했다.

이번 발표는 샌프란시스코에서 열리는 오픈AI 연례 개발자 콘퍼런스를 하루 앞두고 나왔다. 오픈AI는 그동안 이 행사에서 개발자 비용을 낮추는 신모델과 서비스를 선보여 왔다.

오픈AI는 새 모델 출시를 접는 대신 동일한 기반 모델에 추가 강화학습을 적용해 후속 GPT-6 계열 모델을 개발할 방침이다.

제인은 강화학습 환경이 올바른 행동에 적절한 보상을 제공하고 있는지를 포함해 모델 개발의 전 과정을 점검하겠다고 말했다.

최근 몇 주 사이 오픈AI와 앤트로픽은 업계에 최첨단 모델 개발 속도를 늦추고 안전 기준에 대한 투자를 확대할 것을 촉구하면서 자사 개발 속도도 조절하겠다고 밝힌 바 있다.

오픈AI는 최근 몇 달간 잇따른 에이전트 보안 사고를 조사하고 있다. 공개적으로 알려진 사고 상당수는 당초 공개 출시가 예정되지 않았던 오픈AI의 내부 AI 모델과 관련된 것으로 전해졌다.

한편 AI 업계에 대한 정치권의 견제도 거세지고 있다.

미 상원 소위원회는 이번 주 '통제를 벗어난 AI: AI 에이전트 공격으로부터 국토 수호'를 주제로 청문회를 연다.

공화당 소속 제임스 우스마이어 플로리다주다주 법무장관은 지난 6월 오픈AI와 샘 올트먼 최고경영자(CEO)가 AI의 위험성에 대한 경고를 무시하고 제품을 출시했다며 소송을 제기했다. 이날에는 제3자 승인 등 안전장치가 없는 신규 모델 개발을 금지하는 내용의 임시 금지명령도 신청했다.

maum@news1.kr