화면 동작을 학습하는 방식, Record Replay의 작동 원리 이해하기
매일 여러 웹사이트에서 최신 AI 소식을 모아 구글 스프레드시트에 정리하고, 다시 노션 데이터베이스에 저장하는 작업을 자동화한다고 가정해 봅시다. 복잡한 코딩이나 단계별 프롬프트 설명 없이도 이 모든 과정을 시스템이 학습하게 만드는 것이 바로 ‘보여주는 자동화’ 원리입니다. 오픈 AI의 코덱스가 새롭게 추가한 레코드 앤 리플레이 기능은 사용자가 실제로 수행하는 화면 동작을 지켜보는 것만으로 작업을 이해합니다. 예를 들어, 시연 과정에서는 먼저 플러그인 스킬 검색에서 컴퓨터 유즈 플러그인을 설치하고, 이후 레코드 앤 리플레이 플러그인을 설정하여 프로젝트를 초기화한 뒤 녹화를 시작했습니다. 이 방식은 사용자가 구글 스프레드시트를 생성하거나 제목을 수정하는 등 평소의 워크플로우를 직접 수행하면, 코덱스가 그 화면과 동작 흐름 전체를 기록하고 분석합니다. 이렇게 수집된 정보는 나중에 재사용 가능한 '스킬' 형태로 저장되어, 다음에 같은 작업을 할 때 이 스킬을 불러와 즉시 활용할 수 있게 됩니다.
이렇게 학습된 자동화 스킬은 단순히 녹화된 영상을 재생하는 것을 넘어, 실제 시스템이 사용자의 컴퓨터를 제어하는 방식으로 작동합니다. 코덱스는 화면의 스크린샷을 검사하고(inspect screenshots), 그 인터페이스에서 필요한 행동들을 파악하여 코드가 실행할 수 있는 구체적인 동작 목록으로 반환합니다. 이처럼 시각적 정보와 프로그램적 상호작용이 혼합된 하네스(harness)를 통해 여러 단계를 거치는 복잡한 작업을 처리할 수 있습니다. 예를 들어, 하나의 자동화 과정에서 웹사이트별로 데이터를 가져와 구글 스프레드시트에 소스별로 정리하고, 그 결과를 다시 노션 데이터베이스에 저장하는 다단계 작업이 가능합니다. 이는 모델이 단순히 클릭 순서를 따라가는 것이 아니라, 여러 전문 영역을 아우르는 에이전트처럼 계획을 세우고 도구들을 호출하며 상태를 유지하기 때문에 가능한 결과물입니다.
Computer Use 플러그인을 활용한 브라우저 및 데스크톱 상호작용 설계
새로운 웹 페이지를 열고 복잡한 정보를 입력해야 할 때, 시스템이 사용자의 눈과 손을 대신하여 정확하게 다음 단계를 안내해 준다면 작업 속도가 크게 향상될 것입니다. 이러한 화면 기반 자동화는 단순히 녹화된 동작을 반복하는 것을 넘어, 현재 보고 있는 화면의 상태를 이해하고 다음에 취할 행동까지 제안하는 방식으로 작동합니다. 이 과정에서 'Computer Use' 플러그인이 핵심적인 역할을 수행하는데, 이는 시스템이 사용자가 보는 스크린샷 자체를 분석(inspect screenshots)하여 인터페이스가 어떤 구조인지 파악하게 합니다. 예를 들어, 특정 버튼을 눌러야 하는지, 아니면 텍스트 필드에 정보를 입력해야 하는지를 화면의 시각적 정보만으로 확인하는 것이죠. 이처럼 시스템은 사용자의 실제 동작 흐름을 학습한 후에도, 단순히 코드를 실행하는 대신 사용자 인터페이스(UI)와 상호작용할 수 있는 '인터페이스 액션(interface actions)'을 반환하여 다음 행동을 제안합니다. 이는 마치 사람이 옆에서 "여기서 이 버튼을 누르세요"라고 말해주는 것과 같으며, 자동화가 불필요한 오작동 없이 사용자가 의도하는 경로를 따라 움직이도록 돕는 기반 메커니즘입니다.
자동화된 시스템이 제안한 행동을 실제로 실행할 때는 안전성과 신뢰성이 최우선으로 고려됩니다. 따라서 모든 애플리케이션 상호작용은 격리 환경(isolated environment) 내에서 처리되거나, 혹은 사용자에게 명확하게 확인받는 절차를 거칩니다. 만약 시스템이 여러 단계를 거쳐 복잡한 작업을 수행해야 할 때, 단순히 일괄적으로 실행하는 것이 아니라 '사람의 승인(human approval)' 지점을 설계하여 중간 검토가 필요합니다. 예를 들어, 데이터를 가져와서 구글 스프레드시트에 정리하고 노션 데이터베이스에 저장하는 다단계 작업 과정에서, 시스템은 각 단계별로 필요한 권한을 확인하며 진행 상황을 사용자에게 보고합니다. 이러한 방식으로 작동하면, 자동화된 에이전트(agent)가 아무리 복잡하게 계획을 세우고 도구를 호출하더라도, 사용자가 모든 단계를 명시적으로 승인하거나 검토할 수 있는 안전장치가 마련됩니다. 궁극적으로 이는 시스템의 동작 범위를 제한하고, 예측 불가능한 오류를 최소화하여 신뢰도 높은 업무 자동화를 가능하게 합니다.
녹화된 스킬을 실제 업무에 적용하고 재사용하는 워크플로우 절차
매일 아침 여러 웹사이트에서 최신 AI 소식을 가져와서 구글 시트에 정리하고, 그 내용을 노션 데이터베이스에 저장하는 반복적인 업무가 있습니다. 이처럼 복잡한 수동 작업을 자동화하기 위해 오픈AI 코덱스의 레코드 앤 리플레이(Record & Replay) 기능을 활용할 때의 초기 과정은 녹화를 통해 스킬을 생성하는 단계부터 시작합니다. 먼저 코덱스 앱을 실행하고 좌측 플러그인 메뉴에서 '컴퓨터 유즈' 플러그인을 설치하여 시스템이 컴퓨터 동작을 감지할 수 있도록 환경을 준비해야 합니다. 이후 레코드 앤 리플레이 플러그인을 설치한 후, 새 프로젝트를 추가하고 녹화를 시작합니다. 사용자는 평소와 동일하게 빈 구글 스프레드시트를 열고 제목 설정이나 시트 이름 수정 같은 실제 워크플로우를 직접 수행하며 모든 동작을 보여주어야 합니다. 이 과정에서 코덱스는 단순히 화면의 이미지를 캡처하는 것을 넘어, 스크린샷을 검사하고 인터페이스 액션(interface actions)을 분석하여 사용자가 취한 일련의 행동 패턴과 그 순서를 학습합니다. 이렇게 수동으로 수행된 모든 절차는 추후 재사용 가능한 '스킬' 형태로 코덱스 내부에 저장됩니다.
이렇게 한번 녹화되어 스킬로 만들어진 자동화 루틴은 실제 업무에 적용하여 여러 번 반복 실행할 때 진가를 발휘합니다. 예를 들어, 다양한 소스의 AI 뉴스 기사를 수집하고 이를 구글 시트의 '소스별 정리'라는 구조에 맞춰 입력하는 작업이 있다고 가정해 봅시다. 녹화를 통해 학습된 스킬을 불러와 재사용하면, 코덱스가 여러 단계에 걸쳐 작업을 계획하고 필요한 도구(tools)를 호출하며 상태를 유지합니다. 즉, 한 소스에서 가져온 데이터를 시트에 정리한 후, 이 정보를 다음 단계인 노션 데이터베이스 저장 과정으로 넘겨주는 것처럼 복수 단계를 거치게 됩니다. 이때 코덱스는 단순히 명령을 수행하는 것이 아니라, 여러 전문가처럼 협업(collaborate across specialists)하며 필요한 상태를 기억하고 작업 흐름을 이어갑니다. 만약 중요한 정보가 입력되는 지점이라면, 시스템은 사람이 최종적으로 내용을 확인하고 승인할 수 있는 검증 단계를 포함하도록 설계되어 데이터의 정확성을 높일 수 있습니다.
다단계 자동화를 위한 상태 관리와 사람의 승인(Approval) 지점 구현
복잡하게 얽힌 업무 과정을 자동화로 처리할 때, 시스템은 단순히 녹화된 동작을 반복하는 수준을 넘어 여러 단계에 걸쳐 계획하고 도구를 호출하며 정보를 관리해야 합니다. 예를 들어, 외부 데이터를 수집하여 내부 데이터베이스에 저장한 후, 그 결과를 바탕으로 보고서를 생성하는 다단계 작업이 필요하다면, 에이전트(Agent)는 이 모든 과정을 스스로 설계하고 진행할 만큼의 상태(State)를 유지해야 합니다. 이때 중요한 것은 시스템이 어느 단계에서 어떤 도구를 사용했는지 정확히 파악하고 다음 행동을 계획하는 능력입니다. 만약 중간 과정에서 예상치 못한 오류가 발생하거나, 사람이 개입하여 판단을 내려야 하는 지점이 생기면, 자동화는 반드시 멈추고 사용자에게 확인을 요청해야 합니다. 이러한 '사람의 승인(Human Approval)' 지점은 시스템이 임의로 다음 단계를 진행하는 것을 막아주고, 복잡한 작업 흐름 속에서 필요한 정보를 안전하게 추적할 수 있도록 도와주는 일종의 이정표 역할을 하는 것입니다.
민감한 정보가 포함된 환경에서 자동화를 실행하려면 권한과 보안을 최우선으로 고려해야 합니다. 특히 로그인 과정이나 개인 식별 정보(PII)를 다루는 경우, 녹화 범위 설정 자체가 중요한 안전장치가 됩니다. 실제로 사례 시연에서는 구글 계정처럼 민감한 정보를 입력하는 '로그인 화면 자체'는 녹화에 포함하지 않는 것이 안전하다고 안내되었습니다. 또한 자동화 모델이 단순히 동작을 따라 하는 것을 넘어, 스크린샷을 검사하고 그 결과를 기반으로 실행할 인터페이스 행동(interface actions)을 코드가 수행하도록 제안하는 방식도 활용됩니다. 이는 시스템이 사용자 화면의 시각적 정보를 분석하여 어떤 버튼을 눌러야 할지 판단하고, 이 과정을 외부 도구 호출이나 커스텀 하네스(custom harness)를 통해 조합함으로써 안전하게 작동할 수 있도록 설계된 것입니다. 즉, 자동화가 실행되는 환경 자체를 격리하거나, 중요한 행동 직전에 사용자에게 반드시 확인 절차를 거치게 함으로써 위험 요소를 사전에 차단하는 것이 핵심입니다.
Codex 기반 자동화 도입 전 필수 권한 및 환경 설정 점검 사항
웹사이트에서 데이터를 가져오거나 반복적인 업무를 시작할 때, 코덱스가 화면의 움직임을 정확히 이해하는지 먼저 확인해야 합니다. 자동화 시스템을 구축하기 전, 가장 먼저 해야 할 일은 Codex가 단순히 녹화된 동작을 따라 하는 것이 아니라 현재 보고 있는 인터페이스의 상태와 사용자의 의도를 종합적으로 파악하도록 환경을 점검하는 것입니다. 예를 들어, 코덱스 앱에서 플러그인을 검색하여 '컴퓨터 유즈' 기능을 설치하고, 이후 '레코드 앤 리플레이'를 통해 실제 업무 흐름을 녹화할 때, 이 과정 자체가 필수적인 선행 조건이 됩니다. 여기서 중요한 작동 방식은 Codex가 스크린샷을 검사(inspect screenshots)하는 능력입니다. 즉, 사용자가 특정 버튼을 누르거나 필드를 채우는 동작을 보여주면, 코덱스는 그 화면의 시각적 정보와 함께 해당 인터페이스에서 어떤 행동(interface actions)이 가능한지 분석하여 자동화 스킬로 변환합니다. 이 초기 검증 단계에서는 녹화에 포함시키지 않도록 주의해야 할 로그인 화면 자체 같은 민감한 영역을 제외하고, 실제 데이터 처리 과정을 중심으로 작업 흐름을 보여주어 코덱스가 정확하게 동작의 맥락을 학습하도록 유도하는 것이 필수입니다.
자동화된 스킬이 여러 단계를 거쳐 복잡한 업무를 수행해야 하는 상황이라면, 단순 녹화를 넘어선 에이전트(Agent)로서의 설계가 필요합니다. 이는 단순히 동작을 따라 하는 것을 넘어, 목표 달성을 위해 스스로 계획을 세우고 필요한 도구들을 호출하며 상태를 유지하는 능력을 의미합니다. 예를 들어, 여러 웹사이트에서 정보를 가져와 구글 시트에 정리하고 노션 데이터베이스에 저장하는 복합적인 시나리오를 가정할 때, 이 과정은 한 번의 녹화로 끝날 수 없습니다. 따라서 자동화를 실행하기 전에 반드시 '플러그인 스킬 검색' 등을 통해 필요한 모든 외부 연동 도구(Tool)가 제대로 정의되었는지 확인해야 합니다. 또한, 시스템이 임의로 중요한 데이터를 수정하거나 전송하는 것을 막기 위해 격리된 환경에서 충분히 테스트를 거쳐야 하며, 최종적으로는 사람이 개입하여 결과를 검토하고 승인하는 지점(Human Approval)을 설계에 포함시켜야 합니다. 이렇게 해야 코덱스가 계획-도구 호출-상태 관리의 순환 구조를 통해 오류 없이 업무를 완료할 수 있습니다.
바로 써볼 체크리스트
시작 전에 확인할 것
도입 전후로 아래 항목만 확인해도, 자동화가 예상 밖으로 움직일 가능성을 크게 줄일 수 있습니다.
- 모든 외부 입력 데이터에 대해 스키마 검증 및 보안 취약점 분석을 수행하여 자동화 프로세스 오작동을 예방하는지 확인한다.
- 에이전트가 호출할 수 있는 도구 및 API의 범위를 최소 권한 원칙에 따라 엄격하게 제한하고 접근 정책을 검토한다.
- 복수 단계 작업(multi-step work) 시나리오를 포함하여 전체 워크플로우가 계획대로 완벽하게 실행되는지 검증한다.
- 에이전트의 모든 상태 변화(State Management), 도구 호출 과정 및 최종 결과를 추적할 수 있도록 상세 로그를 확보했는지 확인한다.
- 프로세스 중간 단계에서 예외 발생 시 작업을 즉시 중단하고 시스템 상태를 이전의 안전한 지점으로 되돌리는 복구 메커니즘을 검증한다.
- 자동화가 민감하거나 중요한 결정을 내려야 하는 모든 지점에 반드시 사용자 승인(Human Approval) 게이트를 삽입했는지 확인한다.
참고 자료
- Codex 신규 기능 떴다ㅣ말 대신 화면으로 보여주는 업무자동화 (이동훈의 루트AI) https://www.youtube.com/watch?v=rsJRChaf6vE
- Computer use (OpenAI developer documentation) https://developers.openai.com/api/docs/guides/tools-computer-use
- Agents guide (OpenAI developer documentation) https://developers.openai.com/api/docs/guides/agents