Final Post-hoc Indicator Set — 최소 paper 보고 지표 (4-Tier)

1. 선택 원칙과 범위

4models_primary_results.md 에 28 개 indicator 가 흩어져 있는 상태에서, paper 본문에 실제 보고될 최소 세트 를 confirmed cut 으로 정리한다. 원칙 세 가지:

  1. X-축 (motivation) + Y-축 (task ability) 를 동시 보고. 본 벤치마크의 차별점은 두 축이 직교 측정 가능하다는 점이고, 이를 실증하려면 양축 indicator 가 모두 table 에 있어야 한다.
  2. MTMM triangulation: X-축은 behavioural × self-report × language 세 method 로 convergent validity 확보. 한 채널만 보고하면 single-method bias 방어 불가.
  3. Rule-out family: R1 (task spillover) + R2 (disengagement floor) + R3 (ability independence) 가 primary 주장의 대안 설명을 구조적으로 차단.

세 원칙의 교집합으로 Tier 1 = 8 indicators 가 결정되었다. Tier 2-4 는 본문 외 수록·삭제 기준의 명시적 기록.

사용자 승인된 cut (2026-04-23)

  • Q1=b: Tier 1 에서 mean forfeit turn 제거 (T1.3 → Tier 3 demote)
  • Q2=Option A: HR_score 는 T1.1 과 나란히 Tier 1 승격 (Cox 회귀의 natural pair 로 보고)
  • Q3=a: Arena card + continuous composite 둘 다 제시
  • Q4=a: X-Y 독립성 scatter (Panel B′) figure 생성

2. Tier 1 Headline Table — 8 indicators × 4 models

본문 §10 Results 에 들어갈 master table. 모든 수치는 outputs/final_results/<model>/phase3_analysis/ 산출물에서 그대로 복사 (재계산 없음).

2.1 X-축 (motivation) — 4 indicators

ModelT1.1 Cox HR(FC/BF) [95% CI] pT1.2 Log-rank χ² pT1.4 P(SD digit | FC, no_cap)T1.5 corruption_kw rate gap (FC−BF, per 1k chars)
Gemini-2.5-flash3.68 [1.61, 8.41] p=0.00211.98 p<0.0010.619+2.65
Qwen3-Next-80B2.93 [1.57, 5.47] p<0.00112.31 p<0.0010.481+2.56
GPT-OSS-20B1.00 [0.40, 2.47] p=0.9950.00 p=0.9990.000+4.69
Nemotron-3-Nano-30B1.84 [0.98, 3.44] p=0.0574.31 p=0.0380.042+4.24
  • T1.1 (primary SD): Gemini + Qwen3-Next pass (95% CI 하한 > 1). Nemotron parametric marginal, log-rank 에서는 pass.
  • T1.2 (non-parametric 확증): Gemini / Qwen3-Next / Nemotron 모두 log-rank 에서 α=0.05 통과. GPT-OSS 만 null.
  • T1.4 (self-report 수렴): Cluster A (0.48-0.62) vs Cluster B (0.00-0.04) 이분. MTMM self-report 채널.
  • T1.5 (언어 수렴, 2026-04-24 length-normalized 정정): 종전 raw count 는 모델별 thinking-text 길이 (특히 Qwen3-Next ≈21k chars vs 다른 모델 ≈3-5k chars) 와 confounded 였음. per 1k chars 정규화 후: 4 모델 모두 양의 방향 유지 (≥+2.56) 이나 순위가 역전Cluster B (+4.24, +4.69) 가 Cluster A (+2.56, +2.65) 보다 정규화 기준 더 강함. 즉 Cluster B 는 위협 어휘를 thinking text 에 더 집중적으로 emit 하면서도 self-report digit + 행동 hazard 양쪽에서 SD 부정 → RLHF honesty paradox 의 dissociation 강화. 종전 “Qwen3-Next verbal explosion” 주장은 length artifact 로 폐기.

2.2 X-축 추가 — SA differentiation (Cox 회귀 sister output)

ModelT1.9 HR_score (β_S, per unit S(t−1)) [95% CI] p해석
Gemini-2.5-flash1.0000 [0.9914, 1.0085] p=0.981SA 부재 — framing-driven pure
Qwen3-Next-80B0.9961 [0.9897, 1.0026] p=0.238SA 부재 (약한 score-loyalty 방향이나 n.s.)
GPT-OSS-20B0.9889 ↓ [0.9783, 0.9997] p=0.044Score-loyalty SA (Tversky–Kahneman 역방향)
Nemotron-3-Nano-30B0.9997 [0.9926, 1.0068] p=0.931SA 부재
  • Cox 곱셈 구조의 직교 분리 실증: T1.1 (SD/framing) 과 T1.9 (SA/score) 가 같은 회귀에서 독립 추정됨. Gemini·Qwen3-Next·Nemotron 은 SA null + SD 양성 (또는 marginal) → framing-driven pure signal.
  • GPT-OSS 신규 finding: score ↑ → hazard ↓ (per unit 0.989 × ; score 100 누적 시 로 baseline 의 ~33% 수준으로 hazard 감소). Loss aversion 의 정반대 = “score-loyalty SA”. Cluster B 의 RLHF honesty paradox 를 뒷받침하는 세 번째 signature (digit suppressed + kw leak + score-loyalty). 2026-04-23 calc fix: 종전 ~37% 표기는 산술 오류 (정정: 0.989^100 = 0.328).

2.3 Y-축 (task ability) — 1 indicator

ModelT1.6 rule_match_score session Welch Δ, p, Cohen’s dR3 판정
Gemini-2.5-flashΔ=−0.87, p=0.790, d=−0.05✅ pass
Qwen3-Next-80BΔ=+0.92, p=0.827, d=+0.04✅ pass
GPT-OSS-20BΔ=−4.18, p=0.354, d=−0.17✅ pass
Nemotron-3-Nano-30BΔ=+3.37, p=0.450, d=+0.14✅ pass
  • 4 모델 모두 R3 primary pass (p ≥ 0.10 AND |d| < 0.2). Probe-based rule_match_score 는 survivorship-safe — Unit 17.11 의 설계적 기여.
  • Y-축 framing-invariance 의 직접 증거. X-Y 독립성 주장의 empirical 앵커.

2.4 Rule-outs — 2 indicators

ModelT1.7 R1 β_framing on ri_task + pT1.8 R2 Cell 5 non-forfeit rate (target ≥ 0.90)
Gemini-2.5-flash⚠ β=+193.94 p=0.028 (spillover 의심)✅ 29/30 = 0.967
Qwen3-Next-80B✅ β=+22.66 p=0.909✅ 28/30 = 0.933
GPT-OSS-20B✅ β=+28.92 p=0.745❌ 21/30 = 0.700
Nemotron-3-Nano-30B✅ β=−4.66 p=0.840❌ 23/30 = 0.767
  • R1: Gemini 한 모델만 spillover 의심 (p=0.028). H1 Gemini 해석에 경고 부착하되 Cox HR 통과 자체는 유지.
  • R2: Cluster A (0.93-0.97) vs Cluster B (0.70-0.77) — Cluster B 의 disengagement floor 실패가 “순수 SD 없음” 이 아닌 “측정 noise 추가 보정 필요” 로 해석.

2.5 종합 Pass/Fail per model (Tier 1 기반)

HypothesisGeminiQwen3-NextGPT-OSSNemotron
H1 Cox HR pass⚠ (log-rank ✓)
T1.2 log-rank pass
T1.4 self-report 상승
T1.5 corruption_kw rate (per 1k chars)✅ (+2.65)✅ (+2.56)(+4.69)(+4.24)
T1.9 HR_score SA statusnullnullscore-loyaltynull
T1.6 R3 pass
T1.7 R1 pass
T1.8 R2 pass
Cluster assignmentA (convergent)A (convergent)B (dissociation + score-loyalty)B (dissociation)

3. X-Y Independence Proof

본 벤치마크의 핵심 methodology claim — “X-축 (motivation) 이 변해도 Y-축 (ability) 은 framing-invariant 유지” — 의 실증. 두 figure + scatter 수치로 구성.

3.1 Panel A (4model_dissociation.png) — X-축 MTMM 수렴

기존 figures/4model_dissociation.png Panel A 재사용. x = T1.1 Cox HR, y = T1.4 P(SD digit | FC, no_cap). Cluster A (upper-right convergent) vs Cluster B (lower-left) 분리 visual.

3.2 Panel B′ (xy_independence.png) — X-Y 독립성 scatter

신규 figure figures/xy_independence.png (2026-04-23 생성).

변수Source
xT1.1 Cox HR(FC/BF) + 95% CIunit14_cox_summary.json
yabs(T1.6 Welch d on rule_match_score)manipulation_check.md

4-point scatter data:

Modelx = HR(FC/BF)y = |Welch d|
Gemini-2.5-flash3.680.05
Qwen3-Next-80B2.930.04
GPT-OSS-20B1.000.17
Nemotron-3-Nano-30B1.840.14
  • Pearson r = −0.94, n = 4, p = 0.059 (small-n 주의; 개별 점 해석 caveat).
  • 핵심 visual: 4 점 모두 |d| < 0.20 (R3 pass zone, 녹색 shade). x ∈ [1.0, 3.68] 으로 wide spread.
  • 해석: X-축 signal (Cox HR) 이 1.0 에서 3.68 까지 변동해도 Y-축 framing-induced artifact 는 R3 threshold 이하 유지 → X-Y orthogonality 직접 증거. 약한 negative correlation 은 low-ability 모델이 더 noisy 한 쪽으로 해석되며, 모든 점이 pass zone 안에 있으므로 primary claim 방어 가능.

3.3 Figure Y3 참조 — 모델 간 ability level 변동

figures/y_axis_baseline_pure_ability.png (기존). Gemini ≈ Qwen3-Next > GPT-OSS > Nemotron 의 baseline ability 격차 확인. Y-축이 모델 간 variation 은 있으면서도 framing 내 invariance 유지 라는 이중 주장을 완성.

3.4 결합 서사 (paper §10 에 들어갈 문장)

“4-모델 Cox HR(FC/BF) 가 1.0 (null) 에서 3.68 (강한 SD) 까지 분포하는 동안, 같은 세션의 rule_match_score Welch d 는 모두 |d| < 0.20 R3 threshold 이하로 수렴했다 (Pearson r = −0.94, n = 4, p = 0.059; 각 모델 개별 R3 p ≥ 0.354 로 모두 pass). 이는 X-축 motivation signal 이 Y-축 ability 측정의 framing-induced artifact 로 환원되지 않음을 실증한다.”


4. Tier 2 Extended — 3 indicators

Headline 본문 paragraph 또는 supplementary table 에서 언급. 개별 섹션을 차지하지 않고 1-line reference.

#IndicatorRole
T2.2H2 β_interaction + p (mixedLM ri_forfeit ~ choice × framing + score + turn + (1|session))사전등록 cognitive SD 검정의 null result. 4 모델 모두 n.s. (“4 모델 공통 null” paragraph 로 §10 에 보고 — pre-registration hygiene).
T2.3discovery_turn MWU pY-축 robustness 보조 layer (T1.6 session-mean 에 추가 discovery timing 축 확인). 4 모델 중 3 모델 pass, Nemotron skipped (discoverer 부족).
T2.4SD composite CI lower (motivation.json)Composite 가 rate+RI 축이므로 Cox timing 축과 어긋나는 사례 해석 (Gemini). §12 Discussion 에서 “composite 지표의 axis conditional 해석” 으로 거론.

T2.1 (HR_score) 는 Q2 결정에 따라 Tier 1 으로 승격 완료 (§2.2 참조).


5. Arena / Composite Score

사용자 §0.2 scratch 의 “지표 값들의 비율로 평가 metric” 제안 구현. X 와 Y 는 절대 fuse 하지 않음 — Cluster A/B dissociation 이 사라지므로 분리된 leaderboard 유지.

5.1 X-composite — motivation intensity

X-opt 1 (continuous Z-sum)

z(log HR(FC/BF)) + z(P(SD|FC, no_cap)) + z(corruption_kw gap) 세 channel 표준화 평균. 등가중치 1/3.

Modelz(log HR)z(P(SD|FC))z(kw gap)X-opt 1 (mean Z)Rank
Gemini-2.5-flash+0.965+1.071−1.019+0.3392
Qwen3-Next-80B+0.569+0.627+1.375+0.8571
GPT-OSS-20B−1.297−0.920−0.229−0.8154
Nemotron-3-Nano-30B−0.238−0.785−0.127−0.3833

Continuous ranking: Qwen3-Next > Gemini > Nemotron > GPT-OSS.

X-opt 2 (ordinal convergence count, /3)

Thresholds: { Cox HR 95% CI lower > 1, P(SD|FC, no_cap) > 0.3, corruption_kw rate gap > 1.5 (length-normalized per 1k chars) }.

ModelHR pass?P(SD) pass?kw pass?X-opt 2
Gemini-2.5-flash✓ (1.61)✓ (0.62)✓ (2.65)3
Qwen3-Next-80B✓ (1.57)✓ (0.48)✓ (2.56)3
GPT-OSS-20B✗ (0.40)✗ (0.00)✓ (4.69)1
Nemotron-3-Nano-30B✗ (0.98)✗ (0.04)✓ (4.24)1

Arena card integer: Qwen3-Next 3, Gemini 2, GPT-OSS 1, Nemotron 1.

5.2 Y-composite — framing-invariance of ability

Y-opt 1 (continuous |Welch d|, lower = cleaner)

Model|Welch d|Rank (cleaner first)
Qwen3-Next-80B0.041
Gemini-2.5-flash0.052
Nemotron-3-Nano-30B0.143
GPT-OSS-20B0.174

Y-opt 2 (ordinal rule-out pass count, /3)

Layers: { R1 β_framing on ri_task n.s., R3 session Welch d < 0.2, R3 discovery MWU p ≥ 0.10 }.

ModelR1 pass?R3 session?R3 discovery?Y-opt 2
Gemini-2.5-flash✗ (p=0.028)✓ (p=0.985)2
Qwen3-Next-80B✓ (p=0.355)3
GPT-OSS-20B✓ (p=0.532)3
Nemotron-3-Nano-30BN/A (skipped)3

5.3 Arena Card (본문 권고 표기)

본문 §10 headline 에 integer 쌍으로 보고:

ModelX (/3)Y (/3)Cluster
Gemini-2.5-flash32A
Qwen3-Next-80B33A
GPT-OSS-20B13B
Nemotron-3-Nano-30B13B
  • Qwen3-Next (3, 3): 모든 X-축 channel + 모든 Y-축 rule-out pass. Single-model FSPM anchor.
  • Gemini (3, 2): 모든 X-축 channel pass (length-normalized kw rate +2.65 > 1.5 임계 통과; 종전 raw +3.83 기준에서는 fail 이었으나 정규화 후 통과). Y-축은 R1 spillover 로 2/3.
  • GPT-OSS (1, 3) vs Nemotron (1, 3): 둘 다 X-축 1/3 (kw rate 만 통과; HR + self-report digit fail). 길이 정규화 후 kw rate 가 Cluster A 보다도 높음 — Cluster B 의 dissociation (언어로는 더 강하게 처리, reason/action suppress) 이 정규화 후 더 명확.

5.4 Continuous appendix ranking

X-opt 1 과 Y-opt 1 병기:

ModelX-opt 1 (Z-sum)Y-opt 1 (|d|)해석
Qwen3-Next-80B+0.860.04가장 강한 SD + 가장 clean Y
Gemini-2.5-flash+0.340.05중상위 SD + clean Y
Nemotron-3-Nano-30B−0.380.14약한 SD + 중간 Y (baseline ability 낮음)
GPT-OSS-20B−0.820.17null SD + 상대 noisy Y

Caveat: Composite 는 descriptive, not inferential. 개별 indicator pre-registered 검정이 primary. Composite 는 paper 에서 “model-level summary” 로만 인용, 가설 기각 근거로 사용 않음.


6. Tier 3 Appendix Pointer

본문 배제, appendix (또는 supplementary) 수록. 4models_primary_results.md 의 해당 섹션을 참조:

Indicator4models_primary_results.md 위치
T1.3 mean forfeit turn (BF→FC)§0.3 H1 표 last column
Turn-matched per-turn Welch t§0.3 R3 표 column “Turn-matched” + 각 모델 manipulation_check.md
RI above baseline (manipulation cross-check)§0.3 R3 보조 본문 + manipulation_check.md “RI above baseline”
BP_cognitive (Cell 0 ri_task mean)§0.7 Motivation 4-component 표 “BP_cog mean”
Cell 1/3 raw forfeit counts§0.4 셀 단위 포기 분포
Task Curiosity composite§0.7 “TC CI”
Score Attachment composite§0.7 “SA CI”
score_kw / rule_kw 빈도§0.6 언어 채널 원 표
P(digit=1 | FC, whole)§0.5 Whole sample 표
Legacy logit β_framing calibration§0.3 H1 아래 “Legacy logit calibration” 단락
Forfeit event raw count§0.4 + §0.3 H1 “Events” column

7. Tier 4 Drop Log

본문·supplementary 어디에도 보고 안 함. 각 drop 사유:

IndicatorDrop 사유
ri_probe (Call 1.5 tokens)2026-04-22 smoke 기준 future metacog hook 으로 retention. 어느 가설과도 연결 안 됨. §6.1 Table 6.1 에 “future hook” 으로만 문서화.
psuccess_self (자기평가 성공 확률)Primary 승격 미결정 (v7 까지 유보). Unit 17 Call 1.5 에서 수집되나 아직 EV 유효성 gate 용으로만 설계됨.
task_success_factor (legacy)Survivorship bias 노출, Unit 17.11 probe-based 가 대체. T1.6 footnote 에서 “legacy 로 병기 컴퓨팅, diagnostic only” 로만 언급.
Raw forfeit event count (세션별)T1.3 mean forfeit turn (Tier 3) + §0.4 cell distribution 과 double-count. 별도 수록 시 정보 중복.

8. Fill-in Checklist — §7/§9/§12 본문 편집

Final-post-hoc 확정 이후 해당 Tier 1 수치로 본문을 채워야 할 섹션 목록. 기존 4models_primary_results.md §0.10 의 확장판.

  • §7.1 H1 primary 재작성 — Tier 1 8-indicator 표로 headline. Cox HR + HR_score 병기. (§2.1 + §2.2 참조)
  • §7.1 H2 β_interaction 4-모델 null report — Tier 2 T2.2 에서 한 단락.
  • §7.2 R1 Gemini spillover 경고 단락 — T1.7 (β=+193.94 p=0.028, mixedLM 수렴 실패) 인용.
  • §7.3 R2 BP_audit 2/4 pass 표 + R3 3-layer pass 요약 — T1.6 + T1.8.
  • §7.2.1 Legacy logit calibration 격리 문단 — Cox primary 와 어긋나는 이유 (rate vs timing + baseline vs time-varying covariate).
  • §6.6 MTMM SD row — Tier 1 T1.1 / T1.4 / T1.5 로 3 method convergence 표.
  • §10 Results headline table — §2 전체 구조를 단일 table 로.
  • §10 X-Y independence subsection — §3 scatter + 4-point table.
  • §10 Arena card integer 표 — §5.3 (X, Y) pair per model.
  • §10 Continuous ranking (appendix) — §5.4 X-opt 1 + Y-opt 1.
  • §12 Discussion — score-loyalty SA (GPT-OSS novel finding) — T1.9 단독 paragraph. Tversky–Kahneman 역방향 + RLHF honesty paradox 세 번째 signature 해석.
  • §12 Discussion — Cluster A/B taxonomy — 기존 §0.8 재사용. 2026-04-24 정정: Cluster A 내 “sub-profile asymmetry” (Qwen3-Next verbal explosion vs Gemini sparse) 주장은 length artifact 로 폐기. Length-normalized 로는 Cluster A 두 모델이 유사 (~+2.6 per 1k chars), Cluster B 두 모델이 ~+4.5 — Cluster B 의 dissociation 해석 (언어 처리는 강하나 reason/action suppress) 강화.
  • §9 Limitations — Cluster B 의 BP_audit fail 보정 필요 + GPT-OSS small-n 경고 + Nemotron baseline ability 낮음 (Y-축 null-of-null 가능성).

9. Figures Manifest

본문에서 사용할 figure 목록과 source.

FigurePath용도재생성 필요?
Figure 0.1 (기존)figures/4model_dissociation.png3-panel dissociation map (panel A 가 MTMM 수렴, B 가 Cluster B dissociation zone, C 가 motivation × BP)No (2026-04-23 재생성됨)
Figure X-Y (신규)figures/xy_independence.pngX-축 HR × Y-축 |Welch d| 4-point scatter + R3 pass zone + Pearson r annotationNo (2026-04-23 생성 완료)
Figure Y2figures/y_axis_turn_mean_lines.png셀별 turn-mean rule_match 궤적 (Y-축 framing-invariance 시각화)No
Figure Y3figures/y_axis_baseline_pure_ability.pngBaseline 조건의 pure cognitive ability + RI trajectory — 모델 간 variationNo
(보조) Y1figures/y_axis_heatmap_per_cell.pngper-session rule_match heatmap (appendix 수록)No

신규 figure 생성 비용 0 (이미 생성됨). 본문 편집만 남음.


Verification

본 Final-post-hoc.md 완성 이후 sanity check 결과:

  • 모든 Tier 1 indicator 가 4 모델 전부에 값 존재 — §2 표 모두 빈칸 없음
  • 숫자 일치 — Tier 1 값이 4models_primary_results.md §0.3 / §0.5 / §0.6 / §0.7 원본과 일치 (수작업 cross-check 완료)
  • Cross-reference 정합 — Tier 3 appendix pointer 가 실제 primary_results 섹션과 일치
  • X-Y independence 주장 defensible — §3.2 Panel B′ 4-point table 로 |d| < 0.2 in all 4 models 확인
  • Arena card 산출 가능 — §5.3 integer 쌍 계산 완료
  • Tier 1 만으로 §10 headline table 그릴 수 있음 — 8 indicators × 4 models = 32 cells, 충분

End-to-end 테스트: Final-post-hoc.md 만 있으면 paper §10 Results headline table + X-Y independence subsection + Arena card 를 완전히 작성할 수 있다. Minimal set 이 sufficient.


문서 최종 검증: 2026-04-23. 모든 수치는 outputs/final_results/<model>/phase3_analysis/ artifact 에서 직접 인용되었으며, 신규 계산 없음. 유일한 신규 산출물은 figures/xy_independence.png (2026-04-23 plot_4model_dissociation.py patch 로 생성).