Skip to content

Latest commit

 

History

History
100 lines (66 loc) · 4 KB

File metadata and controls

100 lines (66 loc) · 4 KB

Orbit 운영 흐름 가이드

Orbit의 운영 흐름은 다음 세 단계를 분리하는 것을 원칙으로 한다.

자산 정의 → 평가 빌드 조합 → 실행 관찰 및 판단

각 단계가 서로의 설정을 직접 수정하지 않도록 하면, 재사용성·감사 가능성·운영 안전성을 함께 확보할 수 있다.

1. 자산

자산은 여러 평가 빌드에서 재사용하는 운영 재료를 관리하는 카탈로그다. 목록에서 항목을 선택해 수정하고, 추가 버튼으로 새 항목을 등록한다.

AI 모델 프로필

  • 목적: 감독자 평가에 사용할 모델, 연결 정보, 인증 방식을 정의한다.
  • 사용: 평가 빌드에서 프로필 하나를 선택한다.
  • 원칙: 모델 인증과 연결 설정은 평가 빌드마다 복제하지 않는다.

관리자 프롬프트 템플릿

  • 목적: 감독자의 판단 기준과 구조화된 응답 형식을 정의한다.
  • 사용: 평가 빌드에서 템플릿 하나를 선택한다.
  • 원칙: 평가별 조건은 템플릿이 아니라 평가 빌드 또는 워크플로에 둔다.

대상 AI 고정 테스트 케이스

  • 목적: 대상 AI에 보낼 고정 입력과 통과 근거를 재사용 가능한 세트로 관리한다.
  • 구성: 세트 이름, 설명, 케이스별 ID·이름·고정 프롬프트·승인 근거.
  • 사용: 평가 빌드에서는 세트를 수정하지 않고 풀다운에서 선택만 한다.
  • 원칙: 동일한 검증 기준이 필요한 빌드는 같은 세트를 참조한다.

워크플로

  • 목적: 평가 파이프라인의 실행 생명주기와 셸 명령을 정의한다.
  • 구성: init → setup → run → eval → teardown 단계별 스크립트.
  • 생성: 첫 페이지에서 기본 정보와 기반 워크플로를 고르고, 두 번째 페이지에서 단계별 셸 스크립트를 입력한다.
  • 원칙: 워크플로 설명은 해당 실행의 태스크 지시문 역할을 한다.

2. 평가 빌드

평가 빌드는 자산을 특정 평가 목적에 맞춰 조합하는 실행 단위다. 자산을 편집하는 곳이 아니라, 선택하고 실행 정책을 정하는 곳이다.

설정 항목

  • 저장소와 평가 목적
  • 워크플로
  • 관리자 프롬프트 템플릿
  • 대상 AI 고정 테스트 케이스 세트
  • AI 모델 프로필
  • 평가 기준, 프롬프트 소스, 시간대, 반복 간격, 실행 제한, 승인 점수, 실행기

목록의 저장소 상태

  • 저장소 칼럼은 로컬 경로 대신 Git 저장소 이름을 표시한다.
  • 정상 Git 저장소는 초록색 원형 체크로 표시한다.
  • Git 작업 트리가 아니거나 경로가 잘못된 경우 주황색 경고 삼각형을 표시한다.
  • 경고 아이콘에 마우스를 올리면 원인을 확인할 수 있다.

3. 실행 중 평가

실행 중 평가는 실행을 제어하고, 결과를 관찰하며, 감독자 판단을 검토하는 화면이다.

목록

목록에서는 다음 정보를 빠르게 판단한다.

  • 실행 상태와 현재 단계
  • 시작 시각과 경과 시간
  • 제안된 개선·승인된 개선·보고된 문제 수
  • 개별 실행 중지

행을 선택하면 실행 상세를 연다.

실행 상세

실행 상세는 다음 정보를 제공한다.

  • 상태, 단계, 경과 시간, 점수, 평가 결정 요약
  • 전체 로그
  • 감독자 평가 결과
  • 개선 제안 목록: 보고 시각, 내용, 효과 점수, 개선 시도 상태
  • 보고된 문제 목록: 보고 시각과 내용

로그는 모달 전체가 아닌 로그 영역에서 독립적으로 스크롤한다.

후속 작업

실행 결과에는 각 워크플로 단계의 phase가 저장된다. 이를 이용해 실행 상세에 CodeBuild 형태의 다음 탭 구성을 완성한다.

워크플로 로그
  init | setup | run | eval | teardown

로그
평가 결과

워크플로 로그에서는 선택한 단계의 셸 실행 출력만 보여 주며, 로그는 전체 실행 출력을, 평가 결과는 감독자 판단과 개선·문제 목록을 제공한다.