> ⚠️ **미승인 초안 (Unapproved Draft).** 이 문서는 결정이 아닙니다.
> `state/DECISIONS.md`·`ROADMAP.md`·`BACKLOG.md` 어디에도 등록되지 않았습니다.

| ID | 날짜 | 상태 | 작업시간 | 데이터 sha256(앞16) | 재현 |
|---|---|---|---|---|---|
| DR-001 | 2026-08-28 | **KILLED-LLM (17/30)** | 3h | `0d1a877e5b56b677` | `python run.py --seed 42` (73초) |

# 오픈 AI 모델 생태계에서 파생 관계는 예측 가능한가 — 그래프 위상과 메타데이터의 비교

> ## 🔴 이 초안은 1차 심사에서 폐기됐다 (17/30). **§6의 결과는 무효다.**
> 적대적 심사관이 버그 3건을 지적했고 **작성자가 재검증해 전부 확인**했다.
> 1) 그래프 지표 4개가 테스트셋에서 **완전 상수**(고유값 1, 분산 0) — "중요도 0"은 발견이 아니라 구성상 항등식
> 2) `p_downloads` 단독 AUC **0.8469** > 그것을 포함한 모형 B **0.5928** — 파이프라인이 깨졌다
> 3) 음성표본 부모차수 **중앙값 역전**(양성 0.0 / 음성 1.0) — "선호적 연결 무용"은 샘플러 부산물
>
> **`same_license` 2위도 인공물이다** — 파생은 부모 라이선스를 상속한다(양성 83.1% vs 음성 41.2%).
> 상세: [`REVIEW.md`](REVIEW.md) · 수정에 약 3일 소요 추정
>
> **아래 §1·§6·§7은 무효 상태로 보존한다.** 삭제하지 않는 이유는 실패 경위를 지우지 않기 위해서다.

## 1. 한 줄 요약

**그래프 위상 지표는 작동하지 않았다.** 공통이웃·Adamic-Adar·Jaccard·부모 차수(degree)의 순열 중요도가 **전부 0.000**이었고, 부모 차수는 오히려 **음수(-0.019)** 였다. 메타데이터만 쓴 모형이 AUC **0.593**으로 가장 높았으며, 그래프를 더하자 **0.555로 떨어졌다.**

## 2. 연구질문

오픈 AI 모델 저장소에서 **어떤 모델이 어떤 모델의 파생으로 이어질지**를, 그래프 구조 정보로 메타데이터보다 잘 예측할 수 있는가?

## 3. 왜 아직 없는 질문인가

로컬 코퍼스 34,469건(AIS eLibrary 18,784 + 상위저널 15,685) 구문검색, 2026-08-28 확인.

| 검색어 | 전체 | 2023+ | 상위저널 |
|---|---|---|---|
| `hugging ?face\|model hub\|open-?weight\|foundation model` | 9 | 7 | 0 |
| `model reuse` + `pre-trained` | 1 | 0 | 1 |
| 위 9건 중 **링크 예측·그래프 학습**을 쓴 것 | **0** | **0** | **0** |

**가장 가까운 선행연구 2건**

1. [ICIS 2025 · Fine-Tuning: How Model Family Diversification Shapes LLM Adoption](https://aisel.aisnet.org/context/icis2025/article/1237/viewcontent/2777_doc.pdf) — 63,767 모델 / 14,581 패밀리. 패밀리를 **크기(개수)** 로 다루며 **다운로드**를 종속변수로 회귀. **파생 관계 자체를 예측 대상으로 삼지 않았고, 그래프 위상을 쓰지 않았다.**
2. [ICIS 2024 · Influence of Leaderboard and Trial Space on LLM Popularity](https://aisel.aisnet.org/context/icis2024/article/1410/viewcontent/2041_doc.pdf) — 9,487 LLM 종단. 플랫폼 기능 → 인기도. **관계 예측이 아니다.**

→ **질문 자체는 비어 있었다.** 다만 §6이 보여주듯 답은 부정적이다.

## 4. 데이터

| 원천 | 표본 | 기간 | 핵심변수 | 검증상태 |
|---|---|---|---|---|
| HuggingFace 모델 메타데이터 | 500,000 | ~2026-08-07 | `base_model` 파생관계 · `license` · `likes` · `downloads` · `createdAt` · `pipeline_tag` | `SOURCE_VERIFIED` |

**표본 감소 사다리** (`results/t1_sample_ladder.csv`)

| 단계 | 건수 |
|---|---|
| 원본 수집본 | 500,000 |
| `base_model` 선언 엣지 | 292,519 |
| dangling 제외 (부모가 표본에 없음, **22.6%**) | 226,437 |
| 중복 제거 | 225,684 |
| **자식 생성일 > 부모 (시간정합)** — 역전 2,167건 제외 | **223,517** |
| 학습 엣지 (자식 < 2026) | 136,205 |
| 테스트 엣지 (자식 ≥ 2026) | 87,312 |

## 5. 방법

**시간 기반 분할** — 2026-01-01 이전 생성된 파생을 학습, 이후를 테스트. 그래프 지표는 **학습 시점 그래프에서만** 계산해 미래 정보 누수를 차단했다.
**음성 표본** — 실제로 생기지 않은 (부모, 자식) 쌍을 1:1로 무작위 추출.
**베이스라인 2종** — ① 부모 차수만(선호적 연결) ② 메타데이터만(그래프 미사용).
분류기는 로지스틱 회귀와 HistGradientBoosting. 시도 스펙 **4개**.

## 6. 결과

**표 1. 모형 비교** (테스트 174,624쌍, 부트스트랩 200회 95% CI)

| 모형 | AUC | 95% CI | PR-AUC |
|---|---|---|---|
| A. 부모 차수만 (선호적 연결) | 0.526 | [0.523, 0.529] | 0.693 |
| **B. 메타데이터만 (그래프 미사용)** | **0.593** | [0.590, 0.595] | **0.714** |
| C. 그래프 지표만 | 0.527 | [0.524, 0.529] | 0.695 |
| D. 그래프 + 메타데이터 | 0.555 | [0.553, 0.558] | 0.691 |

**표 2. 순열 중요도** (D 모형, 20,000쌍 표본, 5회 반복)

| 변수 | 중요도 | 표준편차 |
|---|---|---|
| 부모 likes (log) | **0.0308** | 0.0008 |
| **부모·자식 라이선스 동일** | **0.0235** | 0.0009 |
| 부모 연령(일) | 0.0181 | 0.0009 |
| 부모·자식 과업 동일 | 0.0079 | 0.0004 |
| 부모 downloads (log) | 0.0067 | 0.0006 |
| 공통이웃 · Adamic-Adar · Jaccard · 자식의 기존 부모 수 | **0.0000** | 0.0000 |
| **부모 차수 (선호적 연결)** | **−0.0193** | 0.0045 |

## 7. 읽히는 것 `INFERENCE`

그래프 위상 지표가 전부 0인 것은 **파생 구조가 forest에 가깝기 때문**으로 보인다 — 엣지 223,517개에 노드 229,750개로, 부모와 자식이 공통 이웃을 거의 갖지 않는다. 공통이웃 계열 지표는 이런 구조에서 정보를 담지 못한다.

부모 차수의 중요도가 **음수**인 것은, 선호적 연결이 이 데이터에서 예측에 도움이 되기는커녕 **잡음으로 작용**했음을 시사한다. 인기 있는 부모가 더 많은 자식을 갖는다는 통념이 파생 관계 **개별 예측** 수준에서는 성립하지 않았다.

예상하지 못한 결과는 **라이선스 동일 여부가 2위 변수**로 나온 것이다. 이는 라이선스가 단순한 법적 표기를 넘어 파생 관계와 **연관**되어 있을 가능성을 시사한다. (인과 주장이 아니다.)

## 8. 한계 · 확인하지 못한 것

- **AUC 0.593은 낮다.** 무작위(0.5) 대비 개선이 크지 않다. 실용적 예측력이 있다고 말할 수 없다.
- **음성 표본 설계가 약하다.** 무작위 (부모,자식) 쌍은 링크예측의 표준 관행이지만, 이 forest 구조에서는 양성·음성 모두 그래프 지표가 0에 가까워 **그래프의 판별력이 구조적으로 죽는다.** 더 어려운 음성(같은 과업, 같은 시기)을 쓰면 결과가 달라질 수 있다.
- **dangling 22.6%.** 부모가 수집 표본에 없는 엣지를 통째로 버렸다. 그 부모들은 다운로드가 낮아 상위 50만에 못 든 모델일 가능성이 높으므로 **체계적 편향**이다.
- **`base_model`은 자기신고 필드**다. 선언하지 않은 실제 파생이 얼마나 되는지 모른다.
- **생존편향.** 표본은 최근 30일 다운로드 상위 50만이며 최소 8회다. **"HuggingFace 모델은…"이 아니라 "최근 30일 다운로드 상위 50만 모델 중에서는…"** 이라고 읽어야 한다.
- **`downloads`는 최근 30일 창**이다(누적 아님, `SOURCE_VERIFIED`). 특징으로만 썼고 종속변수로 쓰지 않았다.
- **GNN을 실제로 쓰지 않았다.** 공통이웃 계열 지표가 전부 0이라 그래프 신호 자체가 없었으므로, 학습형 그래프 임베딩(GraphSAGE 등)으로 올라가는 것이 정당화되지 않았다.
- **시도 스펙 4개.** 하이퍼파라미터 탐색을 하지 않았고 테스트셋은 1회만 사용했다.

**이 결과를 뒤집을 수 있는 것:** 음성 표본을 "같은 과업·같은 분기에 공개된 모델"로 어렵게 만들면 그래프 지표가 살아날 수 있다. 또한 파생 관계를 **쌍(pair) 예측**이 아니라 **노드 수준 예측**(이 모델이 90일 내에 자식을 가질 것인가)으로 바꾸면 차수 정보가 다시 유효해질 가능성이 있다. 두 재설계는 각각 반나절이면 검증 가능하다.

## 9. 40페이지로 커지는가

| 단계 | 추가로 할 것 | 예상 | 위험 |
|---|---|---|---|
| 1 | 음성 표본 난이도 조정 + 노드수준 재정식화 | 1주 | 여전히 신호 없을 수 있음 |
| 2 | 살아나면 GraphSAGE·node2vec 비교 | 1.5주 | ARM torch 설치 |
| 3 | 이론 프레임(혁신확산·네트워크효과) 접합 + 강건성 | 2주 | 이론 정합이 약할 수 있음 |

**판정: 현 상태로는 40페이지가 안 된다.** 1단계에서 신호가 살아나지 않으면 이 방향은 접는 것이 옳다. 남은 94일 중 1주를 투자해 판정할 가치는 있다.

## 10. 교수님께 여쭐 것

1. 예측력이 낮은 결과(AUC 0.59)를 **그대로 보고하는 논문**이 이 학교에서 통과 가능합니까?
2. 음성 표본을 어렵게 만드는 재설계에 **1주를 더 쓰는 것**과, 지금 접고 다른 데이터로 가는 것 중 어느 쪽을 권하십니까?
3. 라이선스가 2위 변수로 나온 것을 **독립 주제로 키우는 방향**을 어떻게 보십니까?

---

## 부록. 5분 구두 설명 (6문장)

1. 허깅페이스에서 모델 50만 개를 받아, 어떤 모델이 어떤 모델에서 파생됐는지를 22만 개의 관계로 그래프를 만들었습니다.
2. 질문은 "그 파생 관계를 미리 예측할 수 있는가"였고, 2026년 이전 데이터로 학습해서 2026년 관계를 맞히는 방식으로 검증했습니다.
3. 결과는 부정적입니다. 공통이웃 같은 그래프 지표가 전부 중요도 0이었고, 인기 있는 모델이 더 많은 자식을 갖는다는 가정도 오히려 예측을 방해했습니다.
4. 이유는 이 그래프가 나무 모양에 가까워서, 부모와 자식이 공통 이웃을 거의 안 갖기 때문으로 보입니다.
5. 대신 예상 못 한 게 나왔는데, **라이선스가 같은지 여부**가 두 번째로 중요한 변수였습니다.
6. 그래서 저는 이 방향을 1주 더 검증해볼지, 아니면 라이선스 쪽으로 옮겨갈지를 여쭙고 싶습니다.
