OpenAI가 2026년 10월 2일 GPT-6 제품군을 고르고 운영하는 방법을 설명한 공식 가이드를 공개했다. 이 문서는 새 모델 출시 발표가 아니라, 이미 제공되는 Astra·6.1 Sol·Luna를 작업 난도와 비용·속도에 맞춰 선택하는 실무 안내다. 따라서 특정 모델이 항상 더 낫다는 뜻으로 읽기보다, 같은 대표 작업을 여러 설정으로 시험해 성공률과 지연 시간, 성공한 작업 한 건당 비용을 비교하는 기준으로 쓰는 편이 맞다. 출처
먼저 작업 성격으로 모델을 좁힌다
OpenAI는 GPT-6 Astra를 가장 어려운 추론 작업, GPT-6.1 Sol을 복잡한 코딩·조사·컴퓨터 사용, GPT-6 Luna를 분류나 구조화 요약처럼 목표가 분명하고 반복되는 대량 작업에 맞는 선택지로 설명한다. 시작점은 ‘최고 성능’이 아니라 오류 비용과 작업 복잡도다. 정답 형식이 명확한 반복 업무라면 Luna부터 검증하고, 여러 저장소나 외부 도구를 오가며 판단해야 한다면 Sol을, 가장 높은 수준의 추론이 실제로 필요한 경우에 Astra를 비교 대상으로 두는 방식이다. 이 구분은 OpenAI의 권장 용도다. 실제 품질과 비용은 별도의 대표 작업 평가로 검증해야 한다. 출처
모델을 정한 뒤에는 reasoning effort를 함께 조정한다. 가이드는 추출이나 작은 수정에는 Low, 계획이나 비교처럼 판단이 필요한 작업에는 Medium, 어려운 디버깅과 정밀 검토에는 High를 예로 든다. Extra high나 Max는 지원되는 경우에만 시험하고, High보다 나아진 결과가 늘어난 시간과 비용을 정당화할 때 유지하라는 취지다. API에서는 대화 중 reasoning effort를 바꿔도 캐시를 유지할 수 있다고 설명하지만, 실제 지원 모델과 최신 가격은 공식 모델·가격 문서에서 다시 확인해야 한다. 출처
속도 옵션은 별도의 비용 선택이다
Fast는 Standard보다 더 빠르고 일관된 응답 시간을 목표로 하지만 토큰당 가격이 더 높다. Ultrafast는 reasoning effort와 별개로 생성 속도를 높이는 옵션이며, 가이드 기준으로 Codex와 API의 GPT-6 Astra에서 제공된다. 지연 시간이 중요한 채팅이나 빠른 코딩 반복이라면 후보가 될 수 있지만, 모든 요청에 기본 적용하기 전에 같은 입력으로 전체 응답 시간과 성공 작업당 비용을 비교해야 한다. 속도 모드와 reasoning 단계는 별도 설정이며 정답률 보장도 제공되지 않는다. 출처
반복 호출에서는 안정적인 지침과 참고 자료를 프롬프트 앞부분에 두고 도구 정의를 일관되게 유지하면 prompt caching을 활용하기 쉽다. OpenAI는 모델에 따라 캐시된 입력 토큰 비용이 캐시되지 않은 입력보다 최대 95% 낮을 수 있다고 설명한다. 다만 ‘최대’ 수치이므로 모든 요청의 총비용이 95% 줄어든다고 해석하면 안 된다. 긴 대화는 compaction으로 필요한 상태를 보존하면서 문맥 크기를 줄일 수 있고, 배포 전에는 대표 작업의 성공률·지연 시간·성공 건당 비용과 데이터 제어 설정을 함께 점검해야 한다. 출처
장기 작업은 중간 개입 경로를 설계한다
API의 mid-turn steering은 Responses WebSocket API에서 실행 중 수정 지시를 대기열에 넣는 방식이며, 이미 실행 중인 도구를 취소하거나 완료된 작업을 되돌리지 않는다. asynchronous tool calling은 느린 도구가 도는 동안 독립 작업을 계속할 수 있지만, 의존 단계는 결과를 기다려야 한다. GPT-6.1 Sol의 다중 에이전트 위임은 베타로 안내됐다. Codex에서 GPT-6 Astra는 작업 중 질문과 방향 전환을 지원하므로, 어떤 결정은 자동 진행하고 어떤 결정은 사용자 입력을 기다릴지 미리 경계를 정하는 것이 중요하다. 출처
마지막으로 컴퓨터 사용은 API나 연결 도구로 직접 처리할 수 없는 화면 조작에만 두는 편이 낫다. 가이드는 API 또는 연결 도구가 일을 직접 수행할 수 있으면 그것을 우선하고, 화면 읽기·클릭·양식 입력이 필요할 때 컴퓨터 사용을 선택하라고 권한다. 배포 전 체크리스트는 모델, reasoning, 속도 모드를 각각 바꾸며 대표 작업을 재현하고, 실패 조건과 승인 경계, 모니터링, 데이터 제어를 문서화하는 순서로 정리할 수 있다. 출처