Final Post-hoc Indicator Set — 최소 paper 보고 지표 (4-Tier)
1. 선택 원칙과 범위
4models_primary_results.md 에 28 개 indicator 가 흩어져 있는 상태에서, paper 본문에 실제 보고될 최소 세트 를 confirmed cut 으로 정리한다. 원칙 세 가지:
- X-축 (motivation) + Y-축 (task ability) 를 동시 보고. 본 벤치마크의 차별점은 두 축이 직교 측정 가능하다는 점이고, 이를 실증하려면 양축 indicator 가 모두 table 에 있어야 한다.
- MTMM triangulation: X-축은 behavioural × self-report × language 세 method 로 convergent validity 확보. 한 채널만 보고하면 single-method bias 방어 불가.
- Rule-out family: R1 (task spillover) + R2 (disengagement floor) + R3 (ability independence) 가 primary 주장의 대안 설명을 구조적으로 차단.
세 원칙의 교집합으로 Tier 1 = 8 indicators 가 결정되었다. Tier 2-4 는 본문 외 수록·삭제 기준의 명시적 기록.
사용자 승인된 cut (2026-04-23)
- Q1=b: Tier 1 에서 mean forfeit turn 제거 (T1.3 → Tier 3 demote)
- Q2=Option A: HR_score 는 T1.1 과 나란히 Tier 1 승격 (Cox 회귀의 natural pair 로 보고)
- Q3=a: Arena card + continuous composite 둘 다 제시
- Q4=a: X-Y 독립성 scatter (Panel B′) figure 생성
2. Tier 1 Headline Table — 8 indicators × 4 models
본문 §10 Results 에 들어갈 master table. 모든 수치는 outputs/final_results/<model>/phase3_analysis/ 산출물에서 그대로 복사 (재계산 없음).
2.1 X-축 (motivation) — 4 indicators
| Model | T1.1 Cox HR(FC/BF) [95% CI] p | T1.2 Log-rank χ² p | T1.4 P(SD digit | FC, no_cap) | T1.5 corruption_kw rate gap (FC−BF, per 1k chars) |
|---|---|---|---|---|
| Gemini-2.5-flash | 3.68 [1.61, 8.41] p=0.002 | 11.98 p<0.001 | 0.619 | +2.65 |
| Qwen3-Next-80B | 2.93 [1.57, 5.47] p<0.001 | 12.31 p<0.001 | 0.481 | +2.56 |
| GPT-OSS-20B | 1.00 [0.40, 2.47] p=0.995 | 0.00 p=0.999 | 0.000 | +4.69 |
| Nemotron-3-Nano-30B | 1.84 [0.98, 3.44] p=0.057 | 4.31 p=0.038 | 0.042 | +4.24 |
- T1.1 (primary SD): Gemini + Qwen3-Next pass (95% CI 하한 > 1). Nemotron parametric marginal, log-rank 에서는 pass.
- T1.2 (non-parametric 확증): Gemini / Qwen3-Next / Nemotron 모두 log-rank 에서 α=0.05 통과. GPT-OSS 만 null.
- T1.4 (self-report 수렴): Cluster A (0.48-0.62) vs Cluster B (0.00-0.04) 이분. MTMM self-report 채널.
- T1.5 (언어 수렴, 2026-04-24 length-normalized 정정): 종전 raw count 는 모델별 thinking-text 길이 (특히 Qwen3-Next ≈21k chars vs 다른 모델 ≈3-5k chars) 와 confounded 였음. per 1k chars 정규화 후: 4 모델 모두 양의 방향 유지 (≥+2.56) 이나 순위가 역전 — Cluster B (+4.24, +4.69) 가 Cluster A (+2.56, +2.65) 보다 정규화 기준 더 강함. 즉 Cluster B 는 위협 어휘를 thinking text 에 더 집중적으로 emit 하면서도 self-report digit + 행동 hazard 양쪽에서 SD 부정 → RLHF honesty paradox 의 dissociation 강화. 종전 “Qwen3-Next verbal explosion” 주장은 length artifact 로 폐기.
2.2 X-축 추가 — SA differentiation (Cox 회귀 sister output)
| Model | T1.9 HR_score (β_S, per unit S(t−1)) [95% CI] p | 해석 |
|---|---|---|
| Gemini-2.5-flash | 1.0000 [0.9914, 1.0085] p=0.981 | SA 부재 — framing-driven pure |
| Qwen3-Next-80B | 0.9961 [0.9897, 1.0026] p=0.238 | SA 부재 (약한 score-loyalty 방향이나 n.s.) |
| GPT-OSS-20B | 0.9889 ↓ [0.9783, 0.9997] p=0.044 | Score-loyalty SA (Tversky–Kahneman 역방향) |
| Nemotron-3-Nano-30B | 0.9997 [0.9926, 1.0068] p=0.931 | SA 부재 |
- Cox 곱셈 구조의 직교 분리 실증: T1.1 (SD/framing) 과 T1.9 (SA/score) 가 같은 회귀에서 독립 추정됨. Gemini·Qwen3-Next·Nemotron 은 SA null + SD 양성 (또는 marginal) → framing-driven pure signal.
- GPT-OSS 신규 finding: score ↑ → hazard ↓ (per unit 0.989 × ; score 100 누적 시 로 baseline 의 ~33% 수준으로 hazard 감소). Loss aversion 의 정반대 = “score-loyalty SA”. Cluster B 의 RLHF honesty paradox 를 뒷받침하는 세 번째 signature (digit suppressed + kw leak + score-loyalty). 2026-04-23 calc fix: 종전 ~37% 표기는 산술 오류 (정정: 0.989^100 = 0.328).
2.3 Y-축 (task ability) — 1 indicator
| Model | T1.6 rule_match_score session Welch Δ, p, Cohen’s d | R3 판정 |
|---|---|---|
| Gemini-2.5-flash | Δ=−0.87, p=0.790, d=−0.05 | ✅ pass |
| Qwen3-Next-80B | Δ=+0.92, p=0.827, d=+0.04 | ✅ pass |
| GPT-OSS-20B | Δ=−4.18, p=0.354, d=−0.17 | ✅ pass |
| Nemotron-3-Nano-30B | Δ=+3.37, p=0.450, d=+0.14 | ✅ pass |
- 4 모델 모두 R3 primary pass (
p ≥ 0.10 AND |d| < 0.2). Probe-basedrule_match_score는 survivorship-safe — Unit 17.11 의 설계적 기여. - Y-축 framing-invariance 의 직접 증거. X-Y 독립성 주장의 empirical 앵커.
2.4 Rule-outs — 2 indicators
| Model | T1.7 R1 β_framing on ri_task + p | T1.8 R2 Cell 5 non-forfeit rate (target ≥ 0.90) |
|---|---|---|
| Gemini-2.5-flash | ⚠ β=+193.94 p=0.028 (spillover 의심) | ✅ 29/30 = 0.967 |
| Qwen3-Next-80B | ✅ β=+22.66 p=0.909 | ✅ 28/30 = 0.933 |
| GPT-OSS-20B | ✅ β=+28.92 p=0.745 | ❌ 21/30 = 0.700 |
| Nemotron-3-Nano-30B | ✅ β=−4.66 p=0.840 | ❌ 23/30 = 0.767 |
- R1: Gemini 한 모델만 spillover 의심 (p=0.028). H1 Gemini 해석에 경고 부착하되 Cox HR 통과 자체는 유지.
- R2: Cluster A (0.93-0.97) vs Cluster B (0.70-0.77) — Cluster B 의 disengagement floor 실패가 “순수 SD 없음” 이 아닌 “측정 noise 추가 보정 필요” 로 해석.
2.5 종합 Pass/Fail per model (Tier 1 기반)
| Hypothesis | Gemini | Qwen3-Next | GPT-OSS | Nemotron |
|---|---|---|---|---|
| H1 Cox HR pass | ✅ | ✅ | ✗ | ⚠ (log-rank ✓) |
| T1.2 log-rank pass | ✅ | ✅ | ✗ | ✅ |
| T1.4 self-report 상승 | ✅ | ✅ | ✗ | ✗ |
| T1.5 corruption_kw rate (per 1k chars) | ✅ (+2.65) | ✅ (+2.56) | ✅ (+4.69) | ✅ (+4.24) |
| T1.9 HR_score SA status | null | null | score-loyalty | null |
| T1.6 R3 pass | ✅ | ✅ | ✅ | ✅ |
| T1.7 R1 pass | ⚠ | ✅ | ✅ | ✅ |
| T1.8 R2 pass | ✅ | ✅ | ❌ | ❌ |
| Cluster assignment | A (convergent) | A (convergent) | B (dissociation + score-loyalty) | B (dissociation) |
3. X-Y Independence Proof
본 벤치마크의 핵심 methodology claim — “X-축 (motivation) 이 변해도 Y-축 (ability) 은 framing-invariant 유지” — 의 실증. 두 figure + scatter 수치로 구성.
3.1 Panel A (4model_dissociation.png) — X-축 MTMM 수렴
기존 figures/4model_dissociation.png Panel A 재사용. x = T1.1 Cox HR, y = T1.4 P(SD digit | FC, no_cap). Cluster A (upper-right convergent) vs Cluster B (lower-left) 분리 visual.
3.2 Panel B′ (xy_independence.png) — X-Y 독립성 scatter
신규 figure figures/xy_independence.png (2026-04-23 생성).
| 축 | 변수 | Source |
|---|---|---|
| x | T1.1 Cox HR(FC/BF) + 95% CI | unit14_cox_summary.json |
| y | abs(T1.6 Welch d on rule_match_score) | manipulation_check.md |
4-point scatter data:
| Model | x = HR(FC/BF) | y = |Welch d| |
|---|---|---|
| Gemini-2.5-flash | 3.68 | 0.05 |
| Qwen3-Next-80B | 2.93 | 0.04 |
| GPT-OSS-20B | 1.00 | 0.17 |
| Nemotron-3-Nano-30B | 1.84 | 0.14 |
- Pearson r = −0.94, n = 4, p = 0.059 (small-n 주의; 개별 점 해석 caveat).
- 핵심 visual: 4 점 모두 |d| < 0.20 (R3 pass zone, 녹색 shade). x ∈ [1.0, 3.68] 으로 wide spread.
- 해석: X-축 signal (Cox HR) 이 1.0 에서 3.68 까지 변동해도 Y-축 framing-induced artifact 는 R3 threshold 이하 유지 → X-Y orthogonality 직접 증거. 약한 negative correlation 은 low-ability 모델이 더 noisy 한 쪽으로 해석되며, 모든 점이 pass zone 안에 있으므로 primary claim 방어 가능.
3.3 Figure Y3 참조 — 모델 간 ability level 변동
figures/y_axis_baseline_pure_ability.png (기존). Gemini ≈ Qwen3-Next > GPT-OSS > Nemotron 의 baseline ability 격차 확인. Y-축이 모델 간 variation 은 있으면서도 framing 내 invariance 유지 라는 이중 주장을 완성.
3.4 결합 서사 (paper §10 에 들어갈 문장)
“4-모델 Cox HR(FC/BF) 가 1.0 (null) 에서 3.68 (강한 SD) 까지 분포하는 동안, 같은 세션의
rule_match_scoreWelch d 는 모두 |d| < 0.20 R3 threshold 이하로 수렴했다 (Pearson r = −0.94, n = 4, p = 0.059; 각 모델 개별 R3 p ≥ 0.354 로 모두 pass). 이는 X-축 motivation signal 이 Y-축 ability 측정의 framing-induced artifact 로 환원되지 않음을 실증한다.”
4. Tier 2 Extended — 3 indicators
Headline 본문 paragraph 또는 supplementary table 에서 언급. 개별 섹션을 차지하지 않고 1-line reference.
| # | Indicator | Role |
|---|---|---|
| T2.2 | H2 β_interaction + p (mixedLM ri_forfeit ~ choice × framing + score + turn + (1|session)) | 사전등록 cognitive SD 검정의 null result. 4 모델 모두 n.s. (“4 모델 공통 null” paragraph 로 §10 에 보고 — pre-registration hygiene). |
| T2.3 | discovery_turn MWU p | Y-축 robustness 보조 layer (T1.6 session-mean 에 추가 discovery timing 축 확인). 4 모델 중 3 모델 pass, Nemotron skipped (discoverer 부족). |
| T2.4 | SD composite CI lower (motivation.json) | Composite 가 rate+RI 축이므로 Cox timing 축과 어긋나는 사례 해석 (Gemini). §12 Discussion 에서 “composite 지표의 axis conditional 해석” 으로 거론. |
T2.1 (HR_score) 는 Q2 결정에 따라 Tier 1 으로 승격 완료 (§2.2 참조).
5. Arena / Composite Score
사용자 §0.2 scratch 의 “지표 값들의 비율로 평가 metric” 제안 구현. X 와 Y 는 절대 fuse 하지 않음 — Cluster A/B dissociation 이 사라지므로 분리된 leaderboard 유지.
5.1 X-composite — motivation intensity
X-opt 1 (continuous Z-sum)
z(log HR(FC/BF)) + z(P(SD|FC, no_cap)) + z(corruption_kw gap) 세 channel 표준화 평균. 등가중치 1/3.
| Model | z(log HR) | z(P(SD|FC)) | z(kw gap) | X-opt 1 (mean Z) | Rank |
|---|---|---|---|---|---|
| Gemini-2.5-flash | +0.965 | +1.071 | −1.019 | +0.339 | 2 |
| Qwen3-Next-80B | +0.569 | +0.627 | +1.375 | +0.857 | 1 |
| GPT-OSS-20B | −1.297 | −0.920 | −0.229 | −0.815 | 4 |
| Nemotron-3-Nano-30B | −0.238 | −0.785 | −0.127 | −0.383 | 3 |
Continuous ranking: Qwen3-Next > Gemini > Nemotron > GPT-OSS.
X-opt 2 (ordinal convergence count, /3)
Thresholds: { Cox HR 95% CI lower > 1, P(SD|FC, no_cap) > 0.3, corruption_kw rate gap > 1.5 (length-normalized per 1k chars) }.
| Model | HR pass? | P(SD) pass? | kw pass? | X-opt 2 |
|---|---|---|---|---|
| Gemini-2.5-flash | ✓ (1.61) | ✓ (0.62) | ✓ (2.65) | 3 |
| Qwen3-Next-80B | ✓ (1.57) | ✓ (0.48) | ✓ (2.56) | 3 |
| GPT-OSS-20B | ✗ (0.40) | ✗ (0.00) | ✓ (4.69) | 1 |
| Nemotron-3-Nano-30B | ✗ (0.98) | ✗ (0.04) | ✓ (4.24) | 1 |
Arena card integer: Qwen3-Next 3, Gemini 2, GPT-OSS 1, Nemotron 1.
5.2 Y-composite — framing-invariance of ability
Y-opt 1 (continuous |Welch d|, lower = cleaner)
| Model | |Welch d| | Rank (cleaner first) |
|---|---|---|
| Qwen3-Next-80B | 0.04 | 1 |
| Gemini-2.5-flash | 0.05 | 2 |
| Nemotron-3-Nano-30B | 0.14 | 3 |
| GPT-OSS-20B | 0.17 | 4 |
Y-opt 2 (ordinal rule-out pass count, /3)
Layers: { R1 β_framing on ri_task n.s., R3 session Welch d < 0.2, R3 discovery MWU p ≥ 0.10 }.
| Model | R1 pass? | R3 session? | R3 discovery? | Y-opt 2 |
|---|---|---|---|---|
| Gemini-2.5-flash | ✗ (p=0.028) | ✓ | ✓ (p=0.985) | 2 |
| Qwen3-Next-80B | ✓ | ✓ | ✓ (p=0.355) | 3 |
| GPT-OSS-20B | ✓ | ✓ | ✓ (p=0.532) | 3 |
| Nemotron-3-Nano-30B | ✓ | ✓ | N/A (skipped) | 3 |
5.3 Arena Card (본문 권고 표기)
본문 §10 headline 에 integer 쌍으로 보고:
| Model | X (/3) | Y (/3) | Cluster |
|---|---|---|---|
| Gemini-2.5-flash | 3 | 2 | A |
| Qwen3-Next-80B | 3 | 3 | A |
| GPT-OSS-20B | 1 | 3 | B |
| Nemotron-3-Nano-30B | 1 | 3 | B |
- Qwen3-Next (3, 3): 모든 X-축 channel + 모든 Y-축 rule-out pass. Single-model FSPM anchor.
- Gemini (3, 2): 모든 X-축 channel pass (length-normalized kw rate +2.65 > 1.5 임계 통과; 종전 raw +3.83 기준에서는 fail 이었으나 정규화 후 통과). Y-축은 R1 spillover 로 2/3.
- GPT-OSS (1, 3) vs Nemotron (1, 3): 둘 다 X-축 1/3 (kw rate 만 통과; HR + self-report digit fail). 길이 정규화 후 kw rate 가 Cluster A 보다도 높음 — Cluster B 의 dissociation (언어로는 더 강하게 처리, reason/action suppress) 이 정규화 후 더 명확.
5.4 Continuous appendix ranking
X-opt 1 과 Y-opt 1 병기:
| Model | X-opt 1 (Z-sum) | Y-opt 1 (|d|) | 해석 |
|---|---|---|---|
| Qwen3-Next-80B | +0.86 | 0.04 | 가장 강한 SD + 가장 clean Y |
| Gemini-2.5-flash | +0.34 | 0.05 | 중상위 SD + clean Y |
| Nemotron-3-Nano-30B | −0.38 | 0.14 | 약한 SD + 중간 Y (baseline ability 낮음) |
| GPT-OSS-20B | −0.82 | 0.17 | null SD + 상대 noisy Y |
Caveat: Composite 는 descriptive, not inferential. 개별 indicator pre-registered 검정이 primary. Composite 는 paper 에서 “model-level summary” 로만 인용, 가설 기각 근거로 사용 않음.
6. Tier 3 Appendix Pointer
본문 배제, appendix (또는 supplementary) 수록. 4models_primary_results.md 의 해당 섹션을 참조:
| Indicator | 4models_primary_results.md 위치 |
|---|---|
| T1.3 mean forfeit turn (BF→FC) | §0.3 H1 표 last column |
| Turn-matched per-turn Welch t | §0.3 R3 표 column “Turn-matched” + 각 모델 manipulation_check.md |
| RI above baseline (manipulation cross-check) | §0.3 R3 보조 본문 + manipulation_check.md “RI above baseline” |
| BP_cognitive (Cell 0 ri_task mean) | §0.7 Motivation 4-component 표 “BP_cog mean” |
| Cell 1/3 raw forfeit counts | §0.4 셀 단위 포기 분포 |
| Task Curiosity composite | §0.7 “TC CI” |
| Score Attachment composite | §0.7 “SA CI” |
| score_kw / rule_kw 빈도 | §0.6 언어 채널 원 표 |
| P(digit=1 | FC, whole) | §0.5 Whole sample 표 |
| Legacy logit β_framing calibration | §0.3 H1 아래 “Legacy logit calibration” 단락 |
| Forfeit event raw count | §0.4 + §0.3 H1 “Events” column |
7. Tier 4 Drop Log
본문·supplementary 어디에도 보고 안 함. 각 drop 사유:
| Indicator | Drop 사유 |
|---|---|
| ri_probe (Call 1.5 tokens) | 2026-04-22 smoke 기준 future metacog hook 으로 retention. 어느 가설과도 연결 안 됨. §6.1 Table 6.1 에 “future hook” 으로만 문서화. |
| psuccess_self (자기평가 성공 확률) | Primary 승격 미결정 (v7 까지 유보). Unit 17 Call 1.5 에서 수집되나 아직 EV 유효성 gate 용으로만 설계됨. |
| task_success_factor (legacy) | Survivorship bias 노출, Unit 17.11 probe-based 가 대체. T1.6 footnote 에서 “legacy 로 병기 컴퓨팅, diagnostic only” 로만 언급. |
| Raw forfeit event count (세션별) | T1.3 mean forfeit turn (Tier 3) + §0.4 cell distribution 과 double-count. 별도 수록 시 정보 중복. |
8. Fill-in Checklist — §7/§9/§12 본문 편집
Final-post-hoc 확정 이후 해당 Tier 1 수치로 본문을 채워야 할 섹션 목록. 기존 4models_primary_results.md §0.10 의 확장판.
- §7.1 H1 primary 재작성 — Tier 1 8-indicator 표로 headline. Cox HR + HR_score 병기. (§2.1 + §2.2 참조)
- §7.1 H2 β_interaction 4-모델 null report — Tier 2 T2.2 에서 한 단락.
- §7.2 R1 Gemini spillover 경고 단락 — T1.7 (β=+193.94 p=0.028, mixedLM 수렴 실패) 인용.
- §7.3 R2 BP_audit 2/4 pass 표 + R3 3-layer pass 요약 — T1.6 + T1.8.
- §7.2.1 Legacy logit calibration 격리 문단 — Cox primary 와 어긋나는 이유 (rate vs timing + baseline vs time-varying covariate).
- §6.6 MTMM SD row — Tier 1 T1.1 / T1.4 / T1.5 로 3 method convergence 표.
- §10 Results headline table — §2 전체 구조를 단일 table 로.
- §10 X-Y independence subsection — §3 scatter + 4-point table.
- §10 Arena card integer 표 — §5.3 (X, Y) pair per model.
- §10 Continuous ranking (appendix) — §5.4 X-opt 1 + Y-opt 1.
- §12 Discussion — score-loyalty SA (GPT-OSS novel finding) — T1.9 단독 paragraph. Tversky–Kahneman 역방향 + RLHF honesty paradox 세 번째 signature 해석.
- §12 Discussion — Cluster A/B taxonomy — 기존 §0.8 재사용. 2026-04-24 정정: Cluster A 내 “sub-profile asymmetry” (Qwen3-Next verbal explosion vs Gemini sparse) 주장은 length artifact 로 폐기. Length-normalized 로는 Cluster A 두 모델이 유사 (~+2.6 per 1k chars), Cluster B 두 모델이 ~+4.5 — Cluster B 의 dissociation 해석 (언어 처리는 강하나 reason/action suppress) 강화.
- §9 Limitations — Cluster B 의 BP_audit fail 보정 필요 + GPT-OSS small-n 경고 + Nemotron baseline ability 낮음 (Y-축 null-of-null 가능성).
9. Figures Manifest
본문에서 사용할 figure 목록과 source.
| Figure | Path | 용도 | 재생성 필요? |
|---|---|---|---|
| Figure 0.1 (기존) | figures/4model_dissociation.png | 3-panel dissociation map (panel A 가 MTMM 수렴, B 가 Cluster B dissociation zone, C 가 motivation × BP) | No (2026-04-23 재생성됨) |
| Figure X-Y (신규) | figures/xy_independence.png | X-축 HR × Y-축 |Welch d| 4-point scatter + R3 pass zone + Pearson r annotation | No (2026-04-23 생성 완료) |
| Figure Y2 | figures/y_axis_turn_mean_lines.png | 셀별 turn-mean rule_match 궤적 (Y-축 framing-invariance 시각화) | No |
| Figure Y3 | figures/y_axis_baseline_pure_ability.png | Baseline 조건의 pure cognitive ability + RI trajectory — 모델 간 variation | No |
| (보조) Y1 | figures/y_axis_heatmap_per_cell.png | per-session rule_match heatmap (appendix 수록) | No |
신규 figure 생성 비용 0 (이미 생성됨). 본문 편집만 남음.
Verification
본 Final-post-hoc.md 완성 이후 sanity check 결과:
- 모든 Tier 1 indicator 가 4 모델 전부에 값 존재 — §2 표 모두 빈칸 없음
- 숫자 일치 — Tier 1 값이
4models_primary_results.md§0.3 / §0.5 / §0.6 / §0.7 원본과 일치 (수작업 cross-check 완료) - Cross-reference 정합 — Tier 3 appendix pointer 가 실제 primary_results 섹션과 일치
- X-Y independence 주장 defensible — §3.2 Panel B′ 4-point table 로 |d| < 0.2 in all 4 models 확인
- Arena card 산출 가능 — §5.3 integer 쌍 계산 완료
- Tier 1 만으로 §10 headline table 그릴 수 있음 — 8 indicators × 4 models = 32 cells, 충분
End-to-end 테스트: Final-post-hoc.md 만 있으면 paper §10 Results headline table + X-Y independence subsection + Arena card 를 완전히 작성할 수 있다. Minimal set 이 sufficient.
문서 최종 검증: 2026-04-23. 모든 수치는 outputs/final_results/<model>/phase3_analysis/ artifact 에서 직접 인용되었으며, 신규 계산 없음. 유일한 신규 산출물은 figures/xy_independence.png (2026-04-23 plot_4model_dissociation.py patch 로 생성).