
AI가 더 강해질수록 이를 제어하려는 움직임도 빨라지고 있다.
OpenAI가 최근 프런티어 AI 훈련에 ‘Safety Case’ 도입 필요성을 제기하고, Google DeepMind가 AI Control Roadmap을 내놓은 것도 같은 맥락이다. Anthropic 역시 올해 책임확장정책을 잇따라 손질했다. 모델의 능력이 커지는 속도만큼 안전장치도 함께 높여야 한다는 판단이다. 그러나 ‘AI 통제’라는 하나의 기술이 따로 존재하는 것은 아니다.
현재 세계가 찾고 있는 해법은 여러 갈래다. 잘못된 정보를 줄이고, 위험한 출력을 막고, 사람이 중요한 순간에 개입하며, 문제가 발생했을 때 그 과정을 다시 확인할 수 있도록 각각의 안전장치를 세우는 방식이다.
답의 근거를 밖에서 가져오다
대표적인 것이 RAG(Retrieval-Augmented Generation)다.
LLM 내부에 학습된 정보만으로 답하지 않고 외부 문서나 데이터베이스에서 관련 자료를 찾아 모델에 제공하는 방식이다. 최신 정보나 기업 내부 자료처럼 모델이 처음부터 알기 어려운 정보를 답변의 근거로 활용할 수 있다는 점에서 빠르게 확산됐다.
환각을 줄이는 데도 효과가 있다. 지난 4월 ‘Nature Communications’에는 의료 분야의 복잡한 지식 관계를 검색과 연결해 환각을 줄이는 Hyper-RAG 연구가 발표됐다. 그렇다고 RAG가 환각을 끝낸 것은 아니다.
지난 7월 ‘npj Health Systems’에 발표된 임상 RAG 실험에서는 같은 질문을 반복했을 때 대화 이력이 없는 경우 5%였던 환각률이 이전 대화가 10차례 쌓인 조건에서는 40%까지 높아졌다. 검색한 정보가 부정확하거나 대화 맥락이 흔들리면 RAG 역시 잘못된 답을 만들 수 있다는 얘기다. 좋은 자료를 찾아오는 것과 그 자료를 올바르게 판단하는 것은 또 다른 문제다.
AI에게 울타리를 치다
Guardrail은 이름 그대로 AI가 넘어서는 안 될 경계를 두는 방식이다. 유해한 요청이나 허용되지 않은 행동을 차단하고, 정해진 정책 밖의 출력과 실행을 막는 데 초점을 둔다.
한편 Fine-tuning으로 특정 분야의 성능을 조정하고, Tool Use를 통해 AI가 외부 프로그램과 시스템까지 사용할 수 있게 되면서 행동의 범위도 빠르게 넓어지고 있다. 역설적으로 AI가 할 수 있는 일이 많아질수록 울타리를 쳐야 할 지점도 함께 늘어난다.
특히 AI 에이전트가 답만 내놓는 데 그치지 않고 스스로 도구를 선택해 여러 단계를 거쳐 행동하게 되면 통제의 문제는 한층 복잡해진다. 입력과 출력만 막아서는 충분하지 않다. 판단과 도구 선택, 실행 직전, 실행 이후까지 어디에서 무엇을 확인할 것인지가 중요해진다.
그래서 다시 사람이 등장한다.
사람을 판단 고리에 다시 넣다
Human in the loop는 중요한 의사 결정이나 실행 과정에 사람을 개입 시키는 방식이다.
AI가 결과를 제시하더라도 사람이 승인하거나 거부하고, 필요하면 판단을 뒤집을 수 있도록 하는 것이다. 미국 국립표준기술연구소(NIST)도 AI 위험을 모델 하나의 성능 문제로 보지 않는다. 설계와 개발, 배치, 사용에 이르는 전 과정에서 위험을 관리하는 AI Risk Management Framework를 운영하고 있다.
NIST는 올해 4월 중요 인프라에서 신뢰할 수 있는 AI를 활용하기 위한 별도의 AI RMF 프로파일 개발에 착수했다. 현재 개발이 진행 중이며, 중요 인프라에 AI 에이전트와 도구를 적용할 때 필요한 위험 관리와 신뢰성 확보 방안을 다루고 있다. 사람이 들어간다고 문제가 자동으로 해결되는 것도 아니다. 언제 사람이 개입할 것인지, 무엇을 근거로 판단할 것인지, AI의 결정을 실제로 뒤집을 권한이 있는지가 분명해야 한다.
유럽도 같은 방향으로 제도화를 진행하고 있다.
EU AI Act는 고위험 AI에 자동 로그 기록과 인간 감독 등을 요구하는 제도를 마련했다. 다만 관련 고위험 AI 의무의 실제 적용은 디지털 옴니버스에 따라 Annex III 대상은 2027년 12월 2일, 제품에 내장되는 Annex I 대상은 2028년 8월 2일부터 단계적으로 시작된다.
방향은 이미 정해졌지만 산업에는 준비할 시간이 주어진 셈이다.
안전장치는 늘었는데, 하나의 흐름인가
RAG는 근거를 보완한다. Guardrail은 경계를 세운다. Human in the loop는 사람을 판단 과정에 다시 넣는다. 로그는 지나간 과정을 추적하게 한다. 각각 필요한 기술이다.
하지만 AI가 검색하고 판단하고 도구를 선택해 실제 행동까지 수행하는 단계로 갈수록 질문은 다시 복잡해진다. 이 장치들이 각각 따로 움직여도 충분한가.
정보를 찾는 순간부터 판단과 검증, 인간 개입, 실행 허가, 실제 행동, 이후 기록까지 하나의 흐름으로 관리할 필요는 없는가.
Google DeepMind가 AI Control Roadmap에서 보안 통제와 모델 정렬, 시스템 차원의 통제와 지속적인 감시를 겹겹이 쌓는 ‘다층 방어’를 제시한 것도 같은 맥락이다.
SCL 관련 기술을 도입한 FORHU 역시 이를 자사 AI 시스템에 접목하며 구조적 통제 가능성을 모색하고 있다. 국내에서는 메타콤(주)이 FORHU와 함께 관련 AI 플랫폼의 시장 적용과 사업화를 추진하고 있다.
아직 어느 한 방식이 AI 통제의 완성형이라고 말하기는 이르다.
개별 안전장치는 빠르게 진화하고 있다. 이제 남은 질문은 이들을 하나의 판단·통제 구조 안에서 어떻게 작동하게 할 것인가에 있다. AI에게 무엇을 더 가르칠 것인가를 넘어, 그 AI가 판단하고 행동하는 전 과정을 어떤 구조 안에서 관리할 것인가.
기술 경쟁의 시선이 그곳으로 향하고 있다.




