AI AGENT GUILD
길드 소개길드 모임북극성 프로젝트 · BETA
AI 트렌드훈련 도크 · 세미나기업·기관 맞춤 교육포럼 & 어워드
AI 에이전트 항구자료실기업 컨설팅바운티 보드
로그인
트렌드로 돌아가기

LOGBOOK · WEEKLY BRIEFING

항해일지 · 위클리 브리핑

GPT-6 Astra, 하네스도 다시 써야 한다

2026년 9월 13일
공유

모델은 바꿨는데, 일하는 규칙은 그대로인가요? GPT-6 Astra는 코드를 쓰는 데서 그치지 않고 도구를 사용하며 긴 작업을 이어갑니다. 이전 모델에 맞춰 쌓아 둔 지침도 점검할 때입니다. 하네스는 AI의 작업을 이끄는 지침과 도구, 검증 절차를 뜻합니다. 이번 호에서는 Skills, AGENTS.md와 작업 프롬프트를 어떻게 정리할지 살펴봅니다.

한눈에 보기

지침은 역할별로, 완료와 승인은 분명하게

작업 도구, 보호 규칙과 완료 조건을 나타내는 세 문서가 계산 장치로 연결되고 사람이 완성된 설계도를 승인하는 동판화

Skills는 반복 작업을, AGENTS.md는 공통 규칙을, 작업 프롬프트는 이번 목표를 맡습니다. 구현과 검증은 이어지되 중요한 외부 행동 앞에서는 사람이 승인합니다.

길드의 관점

절차는 가볍게, 권한 경계는 그대로

규칙을 무조건 줄이자는 뜻은 아닙니다. 개인정보와 승인 기준은 유지하고, 모든 작업에 붙여 둔 반복 지시는 필요한 곳으로 옮깁니다.

아래 성능과 제품 동작은 공식 자료를 요약했습니다. 지침을 세 역할로 나누는 방법과 30분 점검은 이를 바탕으로 한 길드의 실무 제안입니다.

성능은 얼마나 달라졌나

OpenAI가 공개한 코딩 평가 결과입니다. 아래 숫자는 공식 출시 글의 평가표를 기준으로 2026년 9월 15일 다시 확인했습니다.

평가GPT-6 AstraGPT-5.6 SolClaude Fable 5.1
Terminal-Bench 4.057.9%37.3%55.8%
DeepSWE v1.174.1%72.7%67.4%
FrontierCode 1.1 Main53.3%47.5%50.9%
데이터베이스 마이그레이션 과제63.9%42.7%57.8%

데이터베이스 마이그레이션은 OpenAI 내부 평가입니다. 이 숫자만으로 Astra가 모든 개발 환경에서 가장 뛰어나다고 말할 수는 없습니다. 평가에 따라 다른 모델과 차이가 작거나 순위가 바뀌기도 합니다.

중요한 변화는 따로 있습니다. 이제 상위 모델은 코드 한 조각보다 여러 단계가 이어지는 작업을 더 오래 맡을 수 있습니다.

컴퓨터 사용 평가인 OSWorld 2.0에서 Astra는 72.6%, GPT-5.6 Sol은 65.7%를 기록했습니다. OpenAI의 시뮬레이션에서는 과제당 시간도 약 75분에서 40분으로 줄었습니다. 긴 문맥 평가의 512K~1M 구간에서는 각각 96.3%와 73.8%를 기록했습니다.

모델이 더 많은 문서를 읽고 더 많은 행동을 할수록 하네스는 더 중요해집니다. 잘못된 지침도 더 오래 따라갈 수 있기 때문입니다.

긴 지시보다 충돌 없는 지시

OpenAI의 모델 가이드는 Astra가 긴 지시를 잘 따르지만, 문맥 속 정보에도 민감하다고 설명합니다. Skill의 내용이 모호하거나 서로 충돌하면 작업을 일찍 멈추거나 불필요한 승인을 요구할 수 있습니다.

다음과 같은 하네스는 다시 살펴봐야 합니다.

  • 작은 수정에도 모든 문서를 먼저 읽게 합니다.
  • 모든 변경에서 전체 테스트를 반복합니다.
  • 구현 전에 긴 계획만 작성하고 멈춥니다.
  • 되돌릴 수 있는 작업까지 매번 승인받습니다.
  • 여러 Skill이 같은 작업의 책임을 겹쳐 가집니다.

안전해 보이지만 실제로는 우선순위를 흐립니다. 에이전트가 결과보다 절차에 매달리거나, 할 수 있는 일도 시작하기 전에 멈추게 됩니다.

1. Skills: 설명은 짧고 경계는 분명하게

Codex는 처음부터 모든 SKILL.md를 읽지 않습니다. 먼저 Skill의 이름과 설명을 보고, 현재 작업과 맞을 때 전체 지침을 엽니다.

따라서 Skill 설명에는 두 가지가 바로 보여야 합니다.

  • 언제 사용하는가
  • 언제 사용하지 않는가

설치된 Skill이 많으면 초기 목록에서 긴 설명이 줄어들 수 있습니다. 핵심 용도와 발동어를 앞부분에 써야 하는 이유입니다.

나쁜 설명

문서, 조사, 검토, 발행 및 여러 관련 작업을 종합적으로 지원합니다.


좋은 설명

위클리 브리핑을 쓰기 전에 원문 링크와 주장 귀속을 검증합니다.
문구만 다듬는 요청에는 사용하지 않습니다.

SKILL.md에는 공통 절차와 입력·출력만 둡니다. 자세한 정책은 references/, 반복 실행은 scripts/, 템플릿은 assets/로 연결합니다. 필요한 작업에서만 자세한 자료를 열게 하는 방식입니다.

길드에서는 Skill 하나에 조사, 작성, 승인과 배포를 모두 넣기보다 책임을 나누는 방식을 권합니다. 출처 검증, 원고 작성, 배포 검증을 나누면 실패한 지점을 찾기 쉽습니다.

2. AGENTS.md: 모든 작업의 백과사전이 되지 않게

AGENTS.md는 프로젝트의 공통 규칙을 알려주는 문서입니다. Codex는 프로젝트 루트에서 현재 작업 폴더까지 내려오며 지침을 합칩니다. 작업 폴더에 가까운 지침이 상위 지침보다 우선합니다.

합쳐지는 문서의 기본 한도는 32KiB입니다. 루트 파일에 모든 규칙을 몰아넣으면 중요한 지침이 묻히거나 잘릴 수 있습니다.

루트 AGENTS.md에는 프로젝트 전체에 적용되는 규칙만 남깁니다.

  • 보안과 개인정보
  • 되돌리기 어려운 작업의 승인 기준
  • 저장소 전체에서 사용하는 기본 도구
  • 공통 완료 기준

특정 서비스의 테스트 명령, 화면 디자인 규칙, 문서 작성법은 관련 폴더 가까이에 둡니다. 모든 작업에서 관련 없는 문서를 읽게 하지 말고, 필요한 작업에서 가까운 AGENTS.md나 Skill이 열리게 합니다.

중요한 규칙을 삭제하자는 뜻은 아닙니다. 안전 규칙은 짧고 단단하게 남깁니다. 작업 방식에는 무조건적인 명령보다 조건을 씁니다.

과한 규칙

모든 변경에서 전체 테스트를 반드시 두 번 실행합니다.


다듬은 규칙

변경과 직접 관련된 검사를 실행합니다.
새 실패나 미해결 문제가 있을 때만 검사 범위를 넓힙니다.

3. 작업 프롬프트: 끝난 상태부터 보여주기

Astra 같은 코딩 에이전트에는 작업 순서를 세세하게 적기보다 무엇을 만들고, 어디까지 확인하며, 언제 사람에게 물어야 하는지 알려주는 편이 낫습니다. 다음 구성은 공식 모델 가이드의 작업 지속성과 지침 충돌에 관한 설명을 바탕으로 길드가 정리한 예시입니다.

프롬프트에는 다음 세 가지를 분명히 적습니다.

  • 목표: 무엇을 만들어야 하는가
  • 완료 조건: 어디까지 확인해야 끝나는가
  • 중단 지점: 언제 작업을 멈추고 사람에게 물어야 하는가

구현부터 검증까지 맡기는 작업이라면 작업 범위도 함께 적습니다.

  1. 목표
  2. 완료 조건
  3. 중단 지점
  4. 필요한 경우 작업 범위

예를 들어 트렌드 페이지의 썸네일 잘림을 고친다고 해보겠습니다.

목표

트렌드 목록의 썸네일이 데스크톱과 모바일에서 잘리지 않게 고칩니다.


완료 조건

- 비율이 다른 이미지도 핵심 내용이 보입니다.
- 카드 높이와 링크 동작은 유지됩니다.
- 대표 화면을 브라우저에서 확인합니다.
- 문제가 남으면 수정하고 다시 확인합니다.


작업 범위

원인 확인, 구현, 실행, 화면 검증과 필요한 수정까지 포함합니다.


중단 지점

배포와 데이터 변경 전에는 멈추고 승인받습니다.
기존 디자인을 바꿔야 해결된다면 선택안을 준비한 뒤 질문합니다.

이렇게 쓰면 에이전트가 구현만 하고 멈추지 않습니다. 실행하고 확인한 뒤, 문제가 있으면 고치는 단계까지 완료 범위에 들어갑니다.

반대로 배포처럼 영향이 큰 행동에서는 사람에게 돌아옵니다.

어디까지 진행하고 어디에서 멈출까

중단 지점이 많다고 더 안전한 것은 아닙니다. 계속할 일과 멈출 일을 나눠야 합니다.

계속 진행사람에게 확인
자료 읽기와 원인 분석배포와 외부 공개
되돌릴 수 있는 코드 수정결제와 외부 발송
승인된 범위의 실행과 검증권한과 계정 변경
실패 원인 수정 후 재검증중요한 요구사항 충돌

가능한 작업을 먼저 끝내고, 검토할 수 있는 결과를 준비한 뒤 승인을 받는 편이 좋습니다. 사람은 계획보다 실제 수정안과 검증 결과를 보고 판단할 수 있습니다.

하네스는 짧아져도 권한 경계는 유지한다

강한 모델에 맞춰 지침을 줄인다고 권한까지 넓혀서는 안 됩니다. 실행력이 커질수록 권한은 더 정확히 나눠야 합니다.

  • 읽기와 제안은 자동으로 진행합니다.
  • 코드 수정과 검증은 승인된 작업 안에서 진행합니다.
  • 배포, 결제, 외부 발송과 권한 변경은 사람이 승인합니다.
  • 실행 결과와 판단 근거는 다시 확인할 수 있게 남깁니다.

OpenAI는 Astra의 범위 준수가 개선됐다고 설명합니다. 동시에 강해진 사이버 역량과 장기 실행에 맞춰 감시와 보호 장치도 강화했습니다. 모델의 판단이 좋아졌다는 이유로 조직의 승인 절차를 없앨 수는 없습니다.

비용도 확인해야 합니다. 2026년 9월 15일 기준 Astra의 API 표준 텍스트 단가는 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러입니다. 입력이 272K 토큰을 넘으면 요율이 달라지며 캐시와 도구 사용 비용도 따로 확인해야 합니다. 단가만으로 작업 전체 비용을 비교할 수는 없습니다. 복잡하고 긴 작업과 단순 반복 작업을 나눠 실제 비용과 성공률을 함께 측정해 보세요.

이번 주에 할 30분 점검

  1. Skill 설명의 첫 두 문장을 읽습니다. 용도와 제외 범위가 바로 보이지 않으면 줄입니다.
  2. SKILL.md의 긴 배경 설명을 찾습니다. 필요할 때만 읽을 자료는 references/로 옮깁니다.
  3. 루트 AGENTS.md에서 특정 폴더에만 필요한 규칙을 표시합니다.
  4. “항상”, “절대”, “모든 작업”을 검색합니다. 정말 예외가 없는 규칙인지 확인합니다.
  5. 자주 쓰는 작업 프롬프트에 목표, 완료 조건, 범위와 중단 지점을 넣습니다.
  6. 같은 과제를 개편 전후로 실행합니다. 조기 중단, 도구 호출, 재작업과 최종 성공 여부를 비교합니다.

모델이 강해질수록 끝을 더 정확히 써야 한다

GPT-6 Astra는 코드를 잘 쓰는 모델에서 일을 이어서 마치는 에이전트로 한 걸음 더 나아갔습니다. 과거의 긴 대본을 그대로 건네면 향상된 판단을 제대로 쓰기 어렵습니다.

Skills의 설명은 짧게 씁니다. AGENTS.md는 필요한 범위에 둡니다. 작업 프롬프트에는 구현, 실행, 검증과 수정이 끝난 상태를 적습니다. 중요한 외부 행동 앞에서만 사람이 확인합니다.

하네스는 사라지지 않습니다. 가볍게 시작하고, 필요할 때 자세한 지침을 열며, 마지막 판단의 주인을 분명히 하는 구조로 바뀝니다.

참고한 공식 자료

  • GPT-6 Astra: A new generation of intelligence
  • GPT-6 Astra model
  • Model guidance
  • Build skills
  • Custom instructions with AGENTS.md

SUBSCRIBE

새 항해일지를 받아보세요

뉴스레터를 구독하시면 항해일지를 이메일로 받아보실 수 있습니다.

뉴스레터 구독하기
AI 에이전트 길드

AI 에이전트를 배우고 실험하며, 실제 업무와 프로젝트로 연결하는 길드입니다.

항로 / Routes

  • 홈
  • AI 트렌드
  • 길드 커뮤니티

기항지 / Ports

  • 기업 컨설팅
  • AI 에이전트 항구
  • 북극성 프로젝트
  • 길드 소개

© 2026 AI 에이전트 길드 · Catalogue Raisonné

바운티 운영약관

All Dimensions Approximate