원본 hyperresearch(Claude) vs hyperresearch-codex(lean) · 같은 질문

2026-09-13 · 질문: DRB #67 "sparse rewards·constraints 하의 RL 탐색 연구 진전과 궤적 계획 시사점" · 평가자: Claude 세션이 두 보고서를 읽고 RACE 4축으로 판단(비공식, Codex 사용량 0)

한 줄 결론
같은 질문에 원본은 11,209단어·출처 97개·약 2시간(Opus 4.7, Full 16단계)짜리 "서베이"를, 우리 lean은 1,978단어·출처 12개·11분·입력 127만 토큰짜리 "브리프"를 냈다. 포괄성·통찰은 원본이 확실히 위, 지시 준수·가독성·검증 가능성은 우리가 앞선다. "원본을 이겼다"고 말하면 안 되고, "같은 돈의 10분의 1 이하로 결정용 브리프를 낸다"가 정직한 문장이다.

0. 이 비교의 한계

1. RACE 4축 비교 (평가자 판단)

축원본hyperresearch-codex lean판정
포괄성6개 대절, 97개 출처, 두 탐색 체제(희소 보상·제약)를 각각 방법 계보까지 정리12개 출처(arXiv 9·PMLR 3, 전부 1차)로 두 체제와 궤적 계획 시사점을 각 2~4문단원본 압승. 출처 8배
통찰"희소 보상은 커버리지 문제, 제약은 표현 문제"라는 프레이밍, noisy-TV 같은 실패 양상 설명"목표 지향 커리큘럼·불확실성 인식 계획·안전 제어기"로 정리, 결합 보장은 없다고 선 그음원본 우세. 우리는 정리에 가깝다
지시 준수질문의 두 부분(연구 진전·궤적 계획 시사점) 모두 답함. 다만 시사점 절이 전체의 일부첫 줄에 질문 원문, 답→근거→반대 근거·한계→다음 행동 구조로 두 부분에 직접 답함우리 소폭 우세(구조가 질문을 따라감)
가독성길고 밀도 높음. 전문가에겐 좋고 결정권자에겐 부담2천 단어, 결론 먼저, 한계 목록화우리 우세(용도가 다름)
검증 가능성(RACE 밖)인용 번호 97개, 일부는 제목만인용 표본 6/6 지지, 출처 상세표(게시일·독립 묶음·인용 여부), 한계에 "확인 안 됨" 명시우리 우세

2. 비용·시간

원본우리 lean
모델Opus 4.7 + Sonnet 4.6, Claude Codegpt-6-astra, codex exec
호출·시간16단계 다수 서브에이전트, 약 2시간14회, 모델 시간 11.2분
토큰미공개입력 1,273,850(캐시 767,488)·출력 17,692·요금 상한 $13.6

3. 이번 실행에서 잡은 결함과 조치 (토큰 0)

4. 그래서 어느 수준인가