728x90

경량 라우팅에서 Apigee와 Agent 플랫폼으로 확장되는 AI 게이트웨이 스펙트럼

구글 시트에 정리된 사내 데이터를 기반으로 작은 인공지능 챗봇을 만들어 처음 애플리케이션 실행을 시도할 때, 모델과 외부 도구를 어떻게 연결할지 결정해야 합니다. 처음부터 무거운 시스템을 다루기 부담스러울 때, 영상 시연에서는 Google Cloud API Gateway의 모델 라우팅 공개 평가판(Public Preview) 기능을 통해 가볍게 출발하는 모습을 보여줍니다. 사용자의 요청과 도구 설명서를 바탕으로 언어 모델이 클라이언트나 서버 측 함수를 언제 부를지 판단하면, 이 라우팅 기능이 중간에서 목적지를 안내하는 작동 방식을 거칩니다. 처음에는 하나의 에이전트만 정의하는 소프트웨어 개발 키트(SDK) 빠른 시작 절차를 따라 최소한의 도구만 연결하고, 의도한 대로 결과가 나오는지 화면 확인을 거치며 기초를 다집니다.

초기 앱을 완성한 뒤 여러 전문가 역할을 맡은 에이전트들이 서로 협력하며 다단계 작업을 완수해야 하는 상황이 찾아옵니다. 영상 시연에서는 이렇게 가볍게 시작한 환경에서 출발해, 넓은 범위의 API 관리를 돕는 Apigee나 제미나이 엔터프라이즈 에이전트 플랫폼(Gemini Enterprise Agent Platform) 안의 에이전트 게이트웨이로 점차 넓혀가는 방향을 제안합니다. 다루는 영역이 넓어져 새로운 모델로 교체하거나 도구를 추가할 때는 늘어난 요청이 오류 없이 처리되는지 평가해야 하는 원인이 생깁니다. 이때 Evals API를 활용해 프로그램 내부에서 직접 평가 기준을 설정하는 작업 순서를 거치면, 모델이 내놓은 결과물이 처음에 의도한 문체와 내용 기준을 계속 만족하는지 안전하게 검증할 수 있습니다.

 

사용자 요청과 도구 설명에 기반한 상태 유지 및 클라이언트·서버 간 도구 호출 흐름

고객이 복잡한 질문을 던지거나 여러 단계의 작업이 필요한 요청을 남겼을 때, 에이전트는 이전 대화의 맥락과 현재 상태를 잃지 않고 유지하며 문제를 해결할 계획을 세웁니다. 사용자의 요청이 시스템에 들어오면 모델은 코드를 곧바로 실행해 결과를 만드는 것이 아니라, 먼저 자신이 사용할 수 있도록 정의된 도구들의 설명을 꼼꼼히 읽어봅니다. 이 과정에서 모델은 사용자의 의도와 도구 설명을 바탕으로 언제 어떤 도구를 호출할지 스스로 판단하고 적절한 행동 제안을 내놓습니다. 결정이 끝나면 모델은 직접 도구를 작동시키는 대신, 어떤 함수를 어떤 매개변수와 함께 실행해야 하는지 명시한 구조화된 호출 데이터를 반환합니다. 즉, 에이전트는 다양한 전문가 도구 사이에서 협업을 조율하고 전체 작업이 완료될 때까지 필요한 상태를 유지하는 데 집중하며, 실제 물리적인 동작을 수행하기 직전의 준비 단계까지만을 자신의 역할 경계로 삼습니다.

모델이 구조화된 데이터를 넘겨주면 비로소 실제 애플리케이션 실행과 결괏값 검증이 시작됩니다. 권한과 설계 방식에 따라 여러분이 만든 클라이언트 애플리케이션이 직접 코드를 실행할 수도 있고, 제공자의 서버 측에서 도구를 실행한 뒤 응답만 받아올 수도 있습니다. 관련 영상 시연에서는 모델 라우팅을 지원하는 게이트웨이와 Apigee 인프라를 활용해 광범위한 도구 관리가 어떻게 연동되는지 구체적인 화면 확인 과정으로 보여줍니다. 도구 실행이 끝난 후에는 모델이 내놓은 최종 결과물이 사전에 지정한 내용과 스타일 기준을 충족하는지 반드시 평가해야 합니다. 평가 API를 코드 레벨에서 프로그래밍 방식으로 구성하여 출력을 테스트하면, 새로운 환경을 도입할 때에도 전체 시스템이 기대한 대로 안정적으로 작동하는지 객관적으로 검증할 수 있습니다.

 

SDK 퀵스타트를 통한 단일 에이전트 실행부터 다중 단계 작업 확장까지의 적용 순서

개발 환경을 열고 터미널에 첫 번째 코드를 입력해 단일 에이전트를 정의하는 행동부터 전체 구축 흐름이 시작됩니다. 거창한 구조를 먼저 설계하기보다, SDK 퀵스타트를 따라 하나의 에이전트를 만들고 애플리케이션을 실행해 보는 작업 순서가 권장됩니다. 이 기본 환경에서 에이전트는 사용자의 요청 내용과 도구의 설명을 비교한 뒤, 언제 어떤 외부 기능을 쓸지 스스로 판단하는 작동 방식을 거칩니다. 모델이 형식에 맞춘 호출 명령을 내보내면, 이를 받아 실제 연산을 처리하는 역할은 클라이언트 애플리케이션이나 서버가 담당합니다. 하나의 에이전트가 작업 계획을 세우고 상태를 유지하며 도구를 다루는 전체 과정이 무사히 끝나는 것을 확인하고 나서야 비로소 다음 단계의 필요 기능을 추가할 수 있습니다.

단일 에이전트가 완성된 후에는 다중 단계 작업이나 다른 전문가 모델과의 협업으로 범위를 넓히게 됩니다. 구글 클라우드의 관련 영상 시연에서는 모델 라우팅 기능을 퍼블릭 프리뷰로 제공하는 API 게이트웨이를 연결해 가벼운 환경에서 출발하는 모습을 확인할 수 있습니다. 나중에 요구 사항이 늘어나면 아피지(Apigee)를 도입해 여러 도구를 관리하거나, 제미나이 엔터프라이즈 에이전트 플랫폼 안에서 거버넌스 전체를 통제하는 방향으로 넘어갑니다. 시스템 덩치를 키울 때는 모델의 출력 결과가 우리가 정한 문체와 내용 기준을 만족하는지 확인하는 작업이 뒤따라야 합니다. 이벌스(Evals) API로 평가 기준을 코드로 짜두면, 모델을 바꾸거나 애플리케이션을 판올림할 때 생기는 오류 원인을 찾아내고 결과물의 질을 일정하게 유지할 수 있습니다.

 

새로운 Model 도입과 업그레이드 시 Evals API를 활용한 출력 결과물 평가와 검증 체계

언어 모델 애플리케이션에 새로운 모델을 도입하거나 기존 모델을 업그레이드할 때 가장 먼저 할 일은 출력 결과물이 기대치에 맞는지 확인하는 것입니다. 눈으로 직접 화면을 확인하는 대신 Evals API를 활용하여 프로그래밍 방식으로 평가를 구성할 수 있습니다. 해당 기능은 모델이 내놓은 답변이 미리 지정해 둔 어조나 내용 기준을 정확히 충족하는지 테스트합니다. 나아가 신뢰할 수 없는 페이지에서 들어온 예상치 못한 입력값에도 모델이 안전하게 반응하는지 격리 환경에서 점검하는 역할을 합니다. 코드를 통해 평가 기준을 세워두면 새로운 버전을 적용할 때마다 애플리케이션이 어떻게 작동하는지 파악할 수 있어, 배포 전 발생할 수 있는 위험을 줄여줍니다.

평가를 통과한 애플리케이션이 여러 단계의 업무를 수행하려면 외부 도구를 호출하는 과정의 권한 경계를 명확히 해야 합니다. 사용자의 요청과 도구 설명을 바탕으로 모델이 특정 함수를 부르기로 결정하면, 이를 여러분의 애플리케이션이 클라이언트 환경에서 직접 실행할지 아니면 제공자의 서버에서 실행할지 나뉘게 됩니다. 영상 시연에서는 구글 클라우드 API 게이트웨이의 모델 라우팅을 기반으로 아피지(Apigee)를 통해 도구를 관리하고, 제미나이 엔터프라이즈의 에이전트 게이트웨이로 전체 통제를 돕는 과정을 보여줍니다. 가볍게 시작해서 점차 범위를 넓혀가는 운영 환경에서는, 모델이 임의의 함수를 실행하기 전에 사람 승인을 거치도록 검증 절차를 마련하여 시스템을 안전하게 다룹니다.

 

연동을 시작하기 전 agent가 사용할 함수 정의와 애플리케이션 내 실행 주체 파악하기

처음 코드에 에이전트를 심고 어떤 일을 맡길지 정할 때는, 상태를 유지하며 여러 단계를 계획하는 무거운 작업보다 단일 에이전트 하나를 띄워보는 동작부터 시작합니다. 사용자가 특정 작업을 지시하면 클로드는 우리가 작성해 둔 도구 설명을 바탕으로 언제 그 기능을 꺼내 쓸지 스스로 판단합니다. 이때 모델이 직접 외부 시스템을 건드리는 것이 아니라 구조화된 호출을 반환할 뿐이며, 이후의 실제 애플리케이션 실행은 우리가 만든 클라이언트 쪽 도구가 수행하거나 앤스로픽 측의 서버 장치가 처리하는 방식으로 동작합니다. 판단을 내리는 쪽과 행동하는 쪽이 나뉘어 있으므로, 첫 검증은 에이전트 SDK 퀵스타트를 따라 가장 가벼운 단위로 설치를 마치고 원하는 대로 동작하는지 눈으로 확인하는 과정이 됩니다.

위 과정을 거쳐 정상적으로 도구를 불러왔다면, 그다음은 모델의 반환값이 우리가 미리 지정한 문체와 내용 기준을 잘 따르는지 평가할 차례입니다. 평가 단계는 Evals 인터페이스를 써서 코드로 직접 구성할 수 있으며, 새 언어 모델을 도입하거나 애플리케이션을 바꿀 때 결과물이 기대한 대로 나오는지 추적하는 역할을 합니다. 영상 시연에서는 구글 클라우드 API 게이트웨이가 공개 미리보기로 제공하는 모델 라우팅 기능을 써서 첫 환경을 가볍게 시작하는 모습을 보여줍니다. 처음에는 작은 기능으로 검증을 마치고 점차 요구사항이 늘어나면, Apigee로 외부 자원 관리를 넓히고 제미나이 엔터프라이즈 에이전트 플랫폼에 속한 에이전트 게이트웨이로 전체 통제권을 쥐는 쪽으로 크기를 키워갈 수 있습니다.

 

바로 써볼 체크리스트

 

시작 전에 확인할 것

도입 전후로 아래 항목만 확인해도, 자동화가 예상 밖으로 움직일 가능성을 크게 줄일 수 있습니다.

  • 모델 라우팅을 위해 API 게이트웨이로 들어오는 모든 요청과 반환되는 구조화된 도구 호출에 대해 사전에 정의된 함수 스키마를 바탕으로 입력 데이터를 엄격하게 검증하는지 담당자가 직접 확인한다.
  • 사용자의 요청과 도구의 설명을 기반으로 모델이 클라이언트 또는 서버 도구를 호출할 때, 정해진 권한 경계 내에서만 애플리케이션 도구 실행이 이루어지는지 담당자가 직접 확인한다.
  • 신뢰성 있는 애플리케이션 구축을 위해 Evals API를 활용하여 평가를 프로그래매틱하게 구성하고, 모델 출력이 지정된 스타일 및 콘텐츠 기준을 충족하는지 담당자가 면밀하게 테스트하고 평가한다.
  • 다양한 전문가 모델 간 협력과 다중 단계 작업을 완료하기 위해 에이전트가 충분한 상태를 유지하는지 추적할 수 있도록, 모든 도구 호출 과정에 대한 상세한 로그 기록이 존재하는지 담당자가 확인한다.
  • 새로운 모델 도입 등에서 시스템의 기댓값과 다르게 동작하거나 평가 기준 미달로 실패가 발생할 경우, 모델 라우팅을 즉각 중단하고 이전 상태로 안전하게 되돌리는 조치가 마련되었는지 담당자가 확인한다.
  • 다중 단계 작업을 수행하는 에이전트가 애플리케이션이나 외부 서버 도구에 대해 구조화된 호출을 실행하기 전, 반드시 지정된 담당자의 직접적인 사람 승인 단계를 거치도록 워크플로우가 설계되었는지 확인한다.

참고 자료

728x90
반응형

+ Recent posts