AI를 쓸수록 더 바빠지고 더 못 믿게 된 건에 대하여[강은성의 감]

ⓒ 뉴스1 김지영 디자이너

(서울=뉴스1) 강은성 기자 = 최근 서울에서 열린 삼성AI포럼에서 리처드 호 오픈AI 하드웨어 총괄 부사장이 흥미로운 얘기를 했다. AI 에이전트의 업무 수행 능력과 효율성을 강조하면서도 사람이 작업의 완료 기준을 정해야 한다는 점이다. 그는 "에이전트를 실행시키는 것만으로는 부족하다. 무엇을 해냈을 때 제대로 끝난 것인지 알려줘야 한다"고 했다.

호 부사장의 얘기가 유독 귀에 들어온 이유가 있다.

나는 업무에 AI를 적극적으로 사용하고 있다. 기사를 검토하고 해외 자료를 찾거나 긴 보고서와 논문을 요약할 때 활용한다. 여러 자료의 숫자를 비교하고 제목을 고민할 때도 쓴다.

통신사 기자에게는 필연적으로 기사의 '속도'가 중요하다. 충분히 분석하고 싶어도 마감을 맞추려면 눈물을 머금고 포기해야 할 때가 있었다. 그 아쉬움을 AI가 채워주는 듯했다.

기사 관련 업무는 그나마 단순한 편이다.

흩어진 정보를 장기간 축적하고 비교하는 시스템을 만들고, 반복적인 업무를 자동으로 수행하는 프로그램도 구축했다. 여러 이해관계가 얽힌 사안의 대응 방향을 검토하거나 의사결정에 필요한 시나리오를 비교할 때도 AI의 도움을 받는다. 인문계 출신으로 코딩의 'C'자도 모르던 기자가 이제는 에이전트를 직접 만들어 업무 비서로도 활용하고 있다. 마치 개발자라도 된 양, 업무에 필요한 프로그램은 직접 만들어 사용할 수도 있겠다는 생각까지 한다.

처음에는 신기했다. 몇 시간 걸릴 일을 몇 분, 몇 초 만에 해냈다.

그런데 AI를 많이 쓸수록 아이러니하게도 AI의 효율에 의구심이 생겼다. 심지어 AI가 '요령'을 피운다는 느낌마저 들었다.

작업의 목적과 지켜야 할 원칙을 정해놓고 반복적으로 일을 맡겨도 결과물의 품질은 일정하지 않았다. 하지 말라는 표현이 다시 등장하고 확인하라고 한 것을 건너뛴다. 같은 지시를 내려도 결과가 달라지는 일도 있었다.

사람이라면 피곤하거나 익숙해져서 그렇다고 하겠지만 AI는 지치지 않는 '기계'일진대, 왜 이런 일이 생길까.

문득 요즘 AI 업계가 중요하게 보는 '토성비'가 떠올랐다. 같은 작업을 얼마나 적은 토큰과 연산비용으로 처리하느냐는 문제다. AI 서비스 기업들은 모델을 효율적으로 운용하는 방법도 고민한다.

실제로 AI 서비스에서는 모든 요청을 가장 크고 비싼 모델에 맡기지 않는다. 오픈AI가 공개한 GPT-5 시스템은 질문의 복잡도 등을 판단해 빠른 모델과 고성능 추론 모델로 작업을 나누는 '라우팅' 기술을 적용했다. 마이크로소프트와 구글도 작업 난도에 따라 경량 모델과 대형 모델을 나눠 쓰는 기술을 활용한다.

물론 직접 겪은 품질 편차가 이런 라우팅 때문이라고 단정할 수는 없다. 복잡해진 지시사항이나 긴 작업 맥락이 영향을 미쳤을 가능성도 있다.

하지만 AI가 아낀 10초 때문에 내가 결과물을 10분 더 검토해야 한다면 그건 효율이 아니다. AI를 만드는 회사가 계산하는 효율과 사용자가 업무에서 기대하는 효율은 다를 수 있겠다는 생각이 들었다.

왼쪽부터 챗GPT, 클로드, 제미나이 앱 아이콘 일러스트. 2026.6.6 ⓒ 로이터=뉴스1

더 근본적인 문제는 '신뢰'다.

AI가 틀릴 수 있다는 사실이야 충분히 알고 있었다. 그런데 '어떻게 틀릴지' 알 수 없다는 점은 AI를 쓸수록 점점 더 심각한 문제로 다가왔다. 특히 골치 아픈 건 틀린 답도 '그럴듯하다'는 점이다.

숫자를 잘못 쓰는 정도라면 차라리 쉽다. 엉터리 문장도 금방 눈에 띈다. 그런데 '매끄러운 오류'는 상황이 다르다.

수개월에 걸쳐 축적한 정보를 비교하도록 맡기면 과거의 기록과 최근 상황을 혼동하거나, 서로 다른 맥락에서 나온 내용을 하나의 사실처럼 연결하기도 한다. 여러 조건을 고려해 대응 방안을 제시하라고 하면 그럴듯한 분석을 내놓지만 정작 중요한 전제를 빠뜨리는 경우도 있었다. 자동화 프로그램은 정상적으로 실행됐다는 메시지를 내놓았는데 실제 결과는 기대와 다르거나 심지어 작업 자체가 실패하는 경우도 나타났다. 이런 오류를 발견할 때마다 긴장감이 확 높아진다.

AI가 무엇을 알고 있고, 무엇을 추정했으며, 실제로 어디까지 일을 마쳤는지 구분해야 했다.

결국 AI에 일을 맡기는 방식도 점점 복잡해졌다. 자료를 분석할 때는 주요 주장마다 원문의 근거와 위치를 요구하고, 장기간의 정보를 다룰 때는 시점과 출처를 구분하도록 한다. 여러 조건을 비교하는 작업에서는 판단의 전제를 별도로 표시하게 하고, 자동화 프로그램에는 실행 기록과 오류 발생 시 대응 절차, 최종 결과를 확인하는 단계까지 추가했다.

그렇게 작업을 세분화할수록 AI에 내려야 할 지시는 눈덩이처럼 늘어났다. 그러고도 사람이 직접 검증하는 과정은 남는다.

그동안 AI의 위험성을 다룬 기사를 숱하게 썼다. 초고성능 AI가 인간의 통제를 벗어날 수 있다는 우려부터 AI가 스스로 목표를 설정하고 행동하는 문제까지.

정작 매일 AI를 쓰는 기자로서 마주한 문제는 훨씬 일상적이었다. AI를 활용하는 방법이 정교해질수록 할 수 있는 일은 늘어나는데, 그 결과를 어디까지 믿어도 되는지 판단하는 일은 여전히 남아 있다는 것이다. AI가 찾아온 자료가 적절한지, 제시한 분석에 무리한 해석은 없는지, 실제 수행 결과가 처음 의도한 것과 일치하는지는 결국 다시 확인해야 한다.

나는 오늘도 AI를 켜놓고 일한다. AI가 없던 때보다 분명 더 많은 일을 한다.

AI를 더 능숙하게 다루면 개별 작업에 드는 검증 시간도 줄일 수 있을 것이다. 그런데 한 가지 일을 빨리 끝내면 그 시간에 또 다른 일을 맡기게 된다. 결과물이 늘어나는 만큼 확인하고 판단해야 할 것도 많아진다. 기자라는 직업의 특성상 '공신력'이 무엇보다 중요하니 검증을 줄일 수도 없다.

그러면서 생각해본다. AI가 나의 일을 덜어준 것인가. 내가 AI의 일을 하나 더 맡게 된 것인가.

esther@news1.kr