728x90

100여 개 기술·보안 기관이 경고한 모델 성능 고도화와 기존 보안의 한계

우리가 평소 스프레드시트에서 고객 데이터를 정리하거나 여러 단계를 거쳐야 하는 복잡한 작업을 지시할 때, 최근의 인공지능은 질문에 답하는 수준을 넘어 스스로 계획을 세우고 도구를 호출하며 움직입니다. 오픈에이아이나 앤트로픽 같은 주요 기업부터 크라우드스트라이크, 포티넷을 포함한 100여 개 기관이 연합해 방어 체계를 촉구한 배경이 여기에 있습니다. 에이전트 소프트웨어 개발 도구 안내서를 살펴보면, 모델은 전문가 시스템 간에 협력하며 긴 작업을 마칠 때까지 작업 상태를 스스로 유지하는 방식으로 작동합니다. 성능이 아주 빠르게 발전하면서 혼자 판단하고 실행하는 영역이 넓어지다 보니, 과거의 방어벽이나 보안 규칙만으로는 새롭게 만들어지는 공격 패턴을 막아내기 어렵다는 원인이 분명하게 드러났습니다.

모델이 외부 도구를 다룰 때 사용자의 요청과 도구 설명을 바탕으로 언제 그 기능을 쓸지 결정하고, 그 결과로 구조화된 호출을 내보내면 이를 받아 실제 애플리케이션 실행으로 이어지는 작동 방식으로 움직입니다. 모델이 외부 시스템과 직접 맞닿아 기능하는 구조상, 관련 기업들은 현장에 배포하기 전에 모델의 결과물이 사전에 지정해 둔 형식과 내용 기준에 맞는지 점검하는 평가 과정을 거칩니다. 평가 응용 프로그램 인터페이스를 코드로 직접 구성하여 모델이 기대치에 맞게 판단을 내리는지 확인하는 행동이 가장 대표적인 확인 방법입니다. 인공지능을 새로 도입하거나 새 모델의 성능을 판가름할 때 적절한 검증 절차가 없다면, 모델의 잘못된 결정이 곧바로 금융기관이나 인터넷 기반 시설에 직접적인 영향을 미치게 됩니다.

 

다단계 작업 완수를 위한 에이전트의 상태 보존과 도구 호출 메커니즘

고객이 보낸 문의 메일을 읽고 환불 규정을 찾아 답변을 작성한 뒤 발송 버튼을 누르는 과정을 떠올려 보세요. 우리가 여러 단계를 거쳐 일을 마무리하듯, 에이전트 역시 다단계 작업을 완수하기 위해 현재 어디까지 일을 진행했는지 상태를 보존하고 다음 계획을 세우는 애플리케이션입니다. 앤트로픽의 공식 문서를 보면 클로드 모델은 사용자의 요청과 주어진 도구의 설명을 바탕으로 언제 도구를 호출할지 스스로 결정합니다. 여기서 인공지능이 직접 메일을 보내는 코드를 실행하는 것은 아닙니다. 모델은 단지 어떤 기능이 필요한지 구조화된 호출 형태를 반환하여 행동을 제안할 뿐이며, 실제 코드를 실행하고 그 결과를 바탕으로 화면을 확인하는 역할은 사용자의 애플리케이션이 담당하여 권한의 경계를 명확히 나눕니다.

이렇게 역할의 경계를 나누더라도 모델이 도구를 호출하고 결과를 판단하는 작동 방식이 기대한 대로 흘러가는지 지속적으로 파악해야 합니다. 오픈AI의 평가 가이드 문서는 에이전트가 내놓은 결과물이 개발자가 미리 지정해 둔 문체와 내용의 제한 조건을 제대로 충족하는지 테스트하는 검증 방법을 안내합니다. 특히 새로운 인공지능 모델을 시도하거나 시스템을 판올림할 때 애플리케이션이 얼마나 안정적으로 동작하는지 파악하려면, 평가 API를 활용하여 프로그래밍 방식으로 테스트를 구성하는 방법이 유용합니다. 이 검증 단계를 거쳐 모델이 상황에 맞지 않는 엉뚱한 행동을 제안하지 않는지 확인함으로써, 여러 단계의 작업이 오류로 빠지는 원인을 미리 차단하고 믿고 쓸 수 있는 서비스를 완성하게 됩니다.

 

사용자 요청과 설명서에 기반한 도구 호출 판단 및 구조화된 명령 실행

사용자가 채팅창에 사이버 위협 의심 주소를 추적하라고 글을 남기면, 에이전트는 미리 정의된 외부 도구 호출 기능을 꺼내며 대응을 시작합니다. 앤트로픽의 설명서를 보면 모델은 사용자의 요청 내용과 각 도구에 적힌 설명서를 꼼꼼히 비교하여 언제 어떤 함수를 사용할지 스스로 판단합니다. 이후 모델이 정해진 형식에 맞춰 구조화된 호출 명령을 반환하면, 개발자가 만든 애플리케이션 실행 환경에서 실제 코드가 처리되는 작동 방식을 거칩니다. 영상 시연에서는 크라우드스트라이크와 포티넷 같은 기업이 기존 보안 체계의 한계를 넘어 공동 방어 체계를 구축하는 과정을 보여줍니다. 연결하는 도구가 늘어날수록 모델이 잘못된 함수를 고르지 않게 명확한 지시문을 써주는 작업 순서가 뒤따릅니다.

여러 전문가의 협업이 필요한 다단계 업무로 넘어가면 에이전트의 상태 유지 능력이 개입합니다. 오픈AI의 에이전트 소프트웨어 개발 도구(SDK)를 살펴보면, 프로그램은 스스로 다음 작업 순서를 계획하고 진행 상황을 기억하며 최종 목표를 향해 나아갑니다. 하지만 인공지능 모델의 성능이 빠르게 높아지면서 기존의 허술한 보안 기준으로는 예상치 못한 출력 오류를 만들어낼 원인이 되기도 합니다. 이를 확인하기 위해 평가(Evals) 응용 프로그램 인터페이스(API)를 활용하여 결과물이 사전에 지정한 스타일과 내용 기준을 충족하는지 검증하는 절차를 밟습니다. 코드 기반으로 평가 기준을 설정해 두면, 새로운 모델을 도입할 때마다 의도한 행동 경계를 벗어나지 않는지 곧바로 테스트할 수 있어 안정성을 높여줍니다.

 

Evals API를 활용한 출력 신뢰성 평가 기준 설계와 도구 실행 권한 제약

새로운 언어 모델로 버전을 올리거나 서비스를 배포하기 전, 우리는 에이전트가 만든 결과물을 꼼꼼히 뜯어보는 과정부터 거칩니다. 이때 오픈에이아이가 제공하는 이발스 API를 활용하여 평가 기준을 코드로 직접 짜넣을 수 있습니다. 우리가 미리 정해둔 문장투나 내용 조건에 모델의 답변이 정확히 들어맞는지 프로그램이 자동으로 시험하는 방식입니다. 낯선 기술을 적용할 때 그 평가 도구는 믿을 수 있는 애플리케이션을 완성하는 기초적인 검증 수단이 됩니다. 작업자는 사람이 일일이 화면을 확인하는 대신, 도구를 통해 에이전트가 예상을 벗어난 대답을 내놓지 않는지 알아채고 걸러냅니다.

에이전트가 외부 도구를 사용할 때도 권한을 나누어 사고를 막는 경계선이 필요합니다. 앤트로픽의 클로드는 사용자의 요청과 도구의 설명서를 비교한 뒤 언제 기능을 쓸지 스스로 결정합니다. 하지만 모델이 곧바로 명령을 내리는 것이 아니라, 어떤 작업을 하겠다는 구조화된 호출 신호만을 먼저 돌려보냅니다. 이후 실제 애플리케이션 실행은 우리 측 클라이언트 환경에서 맡거나 서버가 담당하게 됩니다. 외부의 신뢰할 수 없는 페이지에서 들어온 위험한 입력이 곧바로 시스템을 조작하지 못하도록 차단하는 방법입니다. 코드를 움직이는 권한을 모델과 분리해 두었기 때문에, 꼭 필요한 순간에는 사람이 직접 승인을 내리는 안전장치를 두기가 수월해집니다.

 

본격적인 애플리케이션 구축 전 Agents SDK 설치 및 단일 에이전트 구동 점검

자동화 프로그램을 처음부터 거창하게 짜기보다는, 방금 쓴 코드가 의도대로 움직이는지 애플리케이션을 직접 실행해 보는 작은 검증부터 출발합니다. 에이전트는 앞으로의 계획을 세우고 여러 역할을 오가며 작업을 마칠 때까지 필요한 상태를 잃지 않고 유지하는 소프트웨어입니다. 문서의 퀵스타트 안내에 따라 에이전트 에스디케이(Agents SDK)를 설치하고, 단일 에이전트를 정의해 구동해보는 것이 그 첫걸음입니다. 사용자가 지시를 내리면 모델은 도구 설명을 읽고 언제 외부 기능을 쓸지 판단해 구조화된 호출 데이터를 돌려줍니다. 이후 여러분이 만든 애플리케이션이나 서버가 이 데이터를 넘겨받아 실제 명령을 수행하며, 가장 기초적인 도구의 동작 메커니즘을 확인하게 됩니다.

하나의 에이전트가 무사히 구동되는 것을 확인했다면, 그제야 다음 기능으로 넘어가 애플리케이션에 필요한 요소를 하나씩 덧붙입니다. 하지만 본격적인 배포에 앞서 결과물이 우리가 지정한 문체와 내용 기준을 만족하는지 평가하는 이벌스(Evals) 과정을 거쳐야 합니다. 크라우드스트라이크나 옥타 같은 기술 보안 기업들이 기존 방어망만으로는 대응이 벅차다고 입을 모을 만큼, 최신 모델의 성능과 그에 따른 위협이 가파르게 올라가고 있기 때문입니다. 에이피아이(API)를 활용해 프로그래밍 방식으로 평가 기준을 꼼꼼히 설정해 두면, 새로운 모델로 교체할 때 예상치 못한 결함을 미리 발견하여 훨씬 믿고 쓸 수 있는 안전한 환경을 지켜낼 수 있습니다.

 

바로 써볼 체크리스트

 

시작 전에 확인할 것

도입 전후로 아래 항목만 확인해도, 자동화가 예상 밖으로 움직일 가능성을 크게 줄일 수 있습니다.

  • AI 에이전트가 외부 도구를 호출하기 전에 사용자 요청과 도구 설명에 기반하여 생성된 입력값이 사전에 정의된 안전 기준과 예상 포맷을 정확히 준수하는지 검증하는 절차를 실행해야 합니다.
  • 에이전트가 클라이언트 도구 또는 서버 도구를 실행할 때, 해당 작업에 필요한 최소한의 권한만을 부여받았는지 확인하고 인가되지 않은 시스템 리소스에 접근할 수 없도록 권한 경계를 설정해야 합니다.
  • 에이전트를 프로덕션 환경에 배포하기 전에 Evals API 등을 활용하여 모델의 출력값이 사전에 지정된 스타일 및 콘텐츠 기준을 충족하는지 확인하는 자동화된 평가 시스템을 구축하고 테스트해야 합니다.
  • 다단계 작업을 수행하는 에이전트의 상태 변화와 도구 호출 내역을 포함하여 모든 활동을 상세하게 기록하는 로깅 시스템을 점검하고, 문제 발생 시 즉각적으로 원인을 파악할 수 있도록 추적성을 확보해야 합니다.
  • 에이전트가 예상치 못한 오류를 발생시키거나 비정상적인 도구 호출 패턴을 보일 경우, 시스템이 즉각적으로 작업을 중단하고 안전한 이전 상태로 롤백할 수 있는 자동화된 복구 및 중단 메커니즘을 작동시켜야 합니다.
  • 글로벌 공동 방어 체계와 연관된 중요 인프라 변경이나 민감한 데이터를 다루는 도구 실행 시, 자동화된 처리 이전에 반드시 지정된 보안 담당자의 명시적인 검토 및 최종 승인을 거치도록 워크플로우를 구성해야 합니다.

참고 자료

728x90
반응형

+ Recent posts