그래프 위상과 메타데이터의 비교
DR-001 🔴 폐기
2026-08-28
본문 2,667자 / 6,000 · 그림·표 9개 ✓
| 자리 | 이 초안 | 있어야 했던 것 |
|---|---|---|
| 마더:형식 (통과한 논문의 뼈대) | 없음 | 지도 석사논문 중 「경영과학」 40(3) 게재본 — KOASAS 309593 |
| 마더:기법 (방법을 빌려올 논문) | 없음 | 링크 예측·생태계 실증 논문 — 후보 조사 전이었음 |
| 마더:이론 (왜 그런가를 설명할 틀) | 없음 | IS 플랫폼 생태계·오픈소스 거버넌스 문헌 — 후보 조사 전이었음 |
마더 페이퍼 후보와 확보한 문헌 코퍼스는 자산 페이지에 모았습니다.
누군가 모델 A를 가져다 고쳐서 B를 만들면, B의 설명서에
base_model: A라고 적습니다. 이 선언 한 줄이 이 연구의 원자재입니다.
이렇게 만들어진 것을 파생 모델2이라 부릅니다.
주의. 이건 자기 신고입니다. 실제로 베꼈는데 안 적은 경우는 데이터에 안 잡힙니다. 이 한계는 고칠 방법이 없어 §10에 그대로 적었습니다.
50만 건에서 시작해 실제로 쓸 수 있었던 관계는 223,517건입니다. 가장 크게 버린 것은 dangling3으로, 전체 선언의 22.6%였습니다. "부모가 누구다"라고 적혀 있는데 그 부모가 제 표본에 없는 경우입니다.
시간 기반 분할4을 썼습니다. 자료를 그냥 섞어서 나누면 미래를 미리 본 셈이 되어 점수가 부풀려집니다.
여기에 음성 표본5을 1:1로 넣었습니다 — 실제로는 안 생긴 (부모, 자식) 짝을 지어내 섞은 것입니다. 바로 여기서 치명적인 실수가 났습니다(§7-3).
읽는 법. AUC1는 0.5면 동전 던지기, 1.0이면 완벽입니다. 가장 높은 것이 0.593이었습니다. 그래프를 쓴 쪽이 오히려 낮았습니다. 시험 대상 174,624쌍, 부트스트랩 신뢰구간6 200회.
이 절이 이 페이지의 존재 이유입니다. 결과가 나빴던 게 문제가 아니라, 결과 자체가 무효였습니다.
자식의 이웃을 2025년까지의 그래프에서만 찾게 만들었습니다. 그런데 시험 대상 자식은 전부 2026년에 생긴 것이라 거기에 있을 수가 없습니다. 값이 항상 0이 되는 것이 수학적으로 보장돼 있었습니다.
| 변수 | 고유값7 | 분산 | 0인 비율 |
|---|---|---|---|
공통 이웃 common_neighbors | 1 | 0.000000 | 100.0% |
Adamic-Adar adamic_adar | 1 | 0.000000 | 100.0% |
Jaccard jaccard | 1 | 0.000000 | 100.0% |
자식의 기존 부모 수 c_parents_prior | 1 | 0.000000 | 100.0% |
정답 쌍은 실제 관계에서 나오므로 자식이 많은 부모가 여러 번 등장합니다. 그런데 오답 쌍은 부모 목록에서 골고루 한 번씩 뽑았습니다. 둘의 성질이 달라졌습니다.
| 부모가 가진 자식 수 | 평균 | 중앙값 | 0인 비율 |
|---|---|---|---|
| 정답 쌍 | 132.1 | 0.0 | 54.2% |
| 오답 쌍 | 3.54 | 1.0 | 32.9% |
파생 모델은 부모의 라이선스11를 그대로 물려받습니다. Llama·Gemma 계열은 승계가 의무이기도 합니다. 즉 "라이선스가 같으면 파생이다"는 동어반복12입니다.
게다가 라이선스는 2026년 8월에 찍은 사진입니다. 자식이 그 라이선스를 갖게 된 이유가 파생됐기 때문이므로, 원인 자리에 놓으면 반칙입니다 — 사후 변수13입니다.
14개 전부 실었습니다. 순열 중요도14입니다. 1차 심사에서 제가 14개 중 10개만 싣고 음수 변수 하나를 말없이 뺀 것이 지적됐습니다. 그래서 지금은 생성기가 전 행 출력을 강제합니다. 다만 위 §7 때문에 이 순위 자체가 오염돼 있습니다.
살아남은 자산: HuggingFace 모델 메타데이터 · 파생 관계 223,517건 · 문헌 구문검색 표 · 라이선스 상속률 실측(16.9%는 부모 라이선스를 안 따름) · 파이프라인 코드 · 관문 4개(F1~F4).
단, 위 두 갈래도 F10 관문(마더 페이퍼 3종 + DB 실측)을 통과해야 착수합니다. 이번에는 앵커부터 잡습니다.
재현16: python run.py --seed 42 ·
73초 · 데이터 지문 0d1a877e5b56b677
1차 심사(LLM 자동 심사) 17 / 30 — 합격선 18점에 1점 부족. 결과 정직성 1점이 결정타였습니다. 숫자를 지어내지는 않았지만, 내부적으로 성립하지 않는 결과를 결론으로 제시했습니다. 표를 일부만 실은 것도 함께 감점됐습니다.
출처: drafts/DR-001-hf-linkpred-gnn/REVIEW.md
본문에 붙은 번호를 누르면 여기로 옵니다. 모르실 만한 것은 의심스러우면 다 붙였습니다.
교수님께 들고 가는 원문입니다. 여기서도 드래그해 밑줄을 그으실 수 있습니다.
⚠️ 미승인 초안 (Unapproved Draft). 이 문서는 결정이 아닙니다.
state/DECISIONS.md·ROADMAP.md·BACKLOG.md어디에도 등록되지 않았습니다.
| ID | 날짜 | 상태 | 작업시간 | 데이터 sha256(앞16) | 재현 |
|---|---|---|---|---|---|
| DR-001 | 2026-08-28 | KILLED-LLM (17/30) | 3h | 0d1a877e5b56b677 | python run.py --seed 42 (73초) |
🔴 이 초안은 1차 심사에서 폐기됐다 (17/30). §6의 결과는 무효다.
적대적 심사관이 버그 3건을 지적했고 작성자가 재검증해 전부 확인했다. 1) 그래프 지표 4개가 테스트셋에서 완전 상수(고유값 1, 분산 0) — "중요도 0"은 발견이 아니라 구성상 항등식 2)
p_downloads단독 AUC 0.8469 > 그것을 포함한 모형 B 0.5928 — 파이프라인이 깨졌다 3) 음성표본 부모차수 중앙값 역전(양성 0.0 / 음성 1.0) — "선호적 연결 무용"은 샘플러 부산물
same_license2위도 인공물이다 — 파생은 부모 라이선스를 상속한다(양성 83.1% vs 음성 41.2%). 상세:REVIEW.md· 수정에 약 3일 소요 추정아래 §1·§6·§7은 무효 상태로 보존한다. 삭제하지 않는 이유는 실패 경위를 지우지 않기 위해서다.
그래프 위상 지표는 작동하지 않았다. 공통이웃·Adamic-Adar·Jaccard·부모 차수(degree)의 순열 중요도가 전부 0.000이었고, 부모 차수는 오히려 음수(-0.019) 였다. 메타데이터만 쓴 모형이 AUC 0.593으로 가장 높았으며, 그래프를 더하자 0.555로 떨어졌다.
오픈 AI 모델 저장소에서 어떤 모델이 어떤 모델의 파생으로 이어질지를, 그래프 구조 정보로 메타데이터보다 잘 예측할 수 있는가?
로컬 코퍼스 34,469건(AIS eLibrary 18,784 + 상위저널 15,685) 구문검색, 2026-08-28 확인.
| 검색어 | 전체 | 2023+ | 상위저널 | |||
|---|---|---|---|---|---|---|
| `hugging ?face\ | model hub\ | open-?weight\ | foundation model` | 9 | 7 | 0 |
model reuse + pre-trained | 1 | 0 | 1 | |||
| 위 9건 중 링크 예측·그래프 학습을 쓴 것 | 0 | 0 | 0 |
가장 가까운 선행연구 2건
→ 질문 자체는 비어 있었다. 다만 §6이 보여주듯 답은 부정적이다.
| 원천 | 표본 | 기간 | 핵심변수 | 검증상태 |
|---|---|---|---|---|
| HuggingFace 모델 메타데이터 | 500,000 | ~2026-08-07 | base_model 파생관계 · license · likes · downloads · createdAt · pipeline_tag | SOURCE_VERIFIED |
표본 감소 사다리 (results/t1_sample_ladder.csv)
| 단계 | 건수 |
|---|---|
| 원본 수집본 | 500,000 |
base_model 선언 엣지 | 292,519 |
| dangling 제외 (부모가 표본에 없음, 22.6%) | 226,437 |
| 중복 제거 | 225,684 |
| 자식 생성일 > 부모 (시간정합) — 역전 2,167건 제외 | 223,517 |
| 학습 엣지 (자식 < 2026) | 136,205 |
| 테스트 엣지 (자식 ≥ 2026) | 87,312 |
시간 기반 분할 — 2026-01-01 이전 생성된 파생을 학습, 이후를 테스트. 그래프 지표는 학습 시점 그래프에서만 계산해 미래 정보 누수를 차단했다. 음성 표본 — 실제로 생기지 않은 (부모, 자식) 쌍을 1:1로 무작위 추출. 베이스라인 2종 — ① 부모 차수만(선호적 연결) ② 메타데이터만(그래프 미사용). 분류기는 로지스틱 회귀와 HistGradientBoosting. 시도 스펙 4개.
표 1. 모형 비교 (테스트 174,624쌍, 부트스트랩 200회 95% CI)
| 모형 | AUC | 95% CI | PR-AUC |
|---|---|---|---|
| A. 부모 차수만 (선호적 연결) | 0.526 | [0.523, 0.529] | 0.693 |
| B. 메타데이터만 (그래프 미사용) | 0.593 | [0.590, 0.595] | 0.714 |
| C. 그래프 지표만 | 0.527 | [0.524, 0.529] | 0.695 |
| D. 그래프 + 메타데이터 | 0.555 | [0.553, 0.558] | 0.691 |
표 2. 순열 중요도 (D 모형, 20,000쌍 표본, 5회 반복)
| 변수 | 중요도 | 표준편차 |
|---|---|---|
| 부모 likes (log) | 0.0308 | 0.0008 |
| 부모·자식 라이선스 동일 | 0.0235 | 0.0009 |
| 부모 연령(일) | 0.0181 | 0.0009 |
| 부모·자식 과업 동일 | 0.0079 | 0.0004 |
| 부모 downloads (log) | 0.0067 | 0.0006 |
| 공통이웃 · Adamic-Adar · Jaccard · 자식의 기존 부모 수 | 0.0000 | 0.0000 |
| 부모 차수 (선호적 연결) | −0.0193 | 0.0045 |
INFERENCE그래프 위상 지표가 전부 0인 것은 파생 구조가 forest에 가깝기 때문으로 보인다 — 엣지 223,517개에 노드 229,750개로, 부모와 자식이 공통 이웃을 거의 갖지 않는다. 공통이웃 계열 지표는 이런 구조에서 정보를 담지 못한다.
부모 차수의 중요도가 음수인 것은, 선호적 연결이 이 데이터에서 예측에 도움이 되기는커녕 잡음으로 작용했음을 시사한다. 인기 있는 부모가 더 많은 자식을 갖는다는 통념이 파생 관계 개별 예측 수준에서는 성립하지 않았다.
예상하지 못한 결과는 라이선스 동일 여부가 2위 변수로 나온 것이다. 이는 라이선스가 단순한 법적 표기를 넘어 파생 관계와 연관되어 있을 가능성을 시사한다. (인과 주장이 아니다.)
base_model은 자기신고 필드다. 선언하지 않은 실제 파생이 얼마나 되는지 모른다.downloads는 최근 30일 창이다(누적 아님, SOURCE_VERIFIED). 특징으로만 썼고 종속변수로 쓰지 않았다.이 결과를 뒤집을 수 있는 것: 음성 표본을 "같은 과업·같은 분기에 공개된 모델"로 어렵게 만들면 그래프 지표가 살아날 수 있다. 또한 파생 관계를 쌍(pair) 예측이 아니라 노드 수준 예측(이 모델이 90일 내에 자식을 가질 것인가)으로 바꾸면 차수 정보가 다시 유효해질 가능성이 있다. 두 재설계는 각각 반나절이면 검증 가능하다.
| 단계 | 추가로 할 것 | 예상 | 위험 |
|---|---|---|---|
| 1 | 음성 표본 난이도 조정 + 노드수준 재정식화 | 1주 | 여전히 신호 없을 수 있음 |
| 2 | 살아나면 GraphSAGE·node2vec 비교 | 1.5주 | ARM torch 설치 |
| 3 | 이론 프레임(혁신확산·네트워크효과) 접합 + 강건성 | 2주 | 이론 정합이 약할 수 있음 |
판정: 현 상태로는 40페이지가 안 된다. 1단계에서 신호가 살아나지 않으면 이 방향은 접는 것이 옳다. 남은 94일 중 1주를 투자해 판정할 가치는 있다.
1차 심사관이 쓴 심사평 원문입니다. 왜 죽었는지가 여기 있습니다.
총점 17/30 · 판정: KILLED-LLM
심사 방식: 적대적 LLM 심사관이 원본 데이터로 파이프라인을 독립 재현해 검증. 이후 작성자(Claude)가 동일 난수·동일 음성표본으로 재검증해 지적 3건을 전부 확인했다.
| 항목 | 점수 | 근거 |
|---|---|---|
| 신규성 | 3 | 구문검색 표·선행 2건 URL은 실재. 그러나 게이트 문서가 목록한 겹침 큰 3편을 §3에서 누락했고, 5편이 초록만 읽은 상태임을 밝히지 않았다 |
| 데이터 실재성 | 4 | 사다리 전 단계가 원본 재현과 정확히 일치. 감점: 결측 컬럼 부재, §7의 "노드 229,750"이 CSV에 없음 |
| 결과 정직성 | 1 | §6 숫자가 내부적으로 성립하지 않는다. 아래 §2 참조 |
| 지도교수 적합 | 3 | ML/DL 축과 데이터는 맞으나 GNN을 쓰지 않았고, 아웃소싱·조직통제 축과 접점 없음 |
| 40p 확장성 | 3 | 형식은 갖췄으나 1단계 진단이 틀렸다. 문제는 음성표본 난이도가 아니라 버그였다 |
| AI로 보이는가 | 3 | 폴더명이 약속한 GNN이 없다. 실체는 14개 수작업 피처 + sklearn 표 분류 |
자동 실격 6조: 미발동. 표 숫자는 CSV와 반올림 범위에서 전부 일치했다. 다만 §6 표2가 t3 14행 중 10행만 싣고 두 번째 음수 변수 p_parents(−0.00024)를 무언급 삭제한 것은 선택적 제시로 기록한다.
run.py가 자식 쪽 이웃을 학습 그래프에서만 계산한다. 테스트 자식은 정의상 2026년 이후 생성이므로 학습 그래프에 존재할 수 없다 → 모든 테스트 쌍에서 이웃집합이 공집합인 것이 수학적으로 보장된다.
작성자 재검증 (동일 난수, 테스트 174,624쌍):
| 변수 | 고유값 | 분산 | 0비율 |
|---|---|---|---|
common_neighbors | 1 | 0.000000 | 100.0% |
adamic_adar | 1 | 0.000000 | 100.0% |
jaccard | 1 | 0.000000 | 100.0% |
c_parents_prior | 1 | 0.000000 | 100.0% |
→ 순열 중요도가 정확히 0.0000, 표준편차 정확히 0.0000인 것은 상수를 섞었기 때문이다. §1 헤드라인("그래프 위상 지표는 작동하지 않았다")과 §7의 forest 설명은 자기가 만든 상수를 데이터의 성질로 오독한 것이다.
더 나쁜 것: §8의 "그래프 신호가 없었으므로 GraphSAGE로 올라가는 것이 정당화되지 않았다"는 깨진 피처 정의를 근거로 GNN을 포기한 순환논증이다.
작성자 재검증, 동일 테스트셋 단일 변수 AUC:
| 변수 | 단일 AUC | vs 모형 B (0.5928) |
|---|---|---|
p_downloads | 0.8469 | ★ 훨씬 높음 |
p_likes | 0.8173 | ★ |
same_license | 0.6922 | ★ |
same_task | 0.6669 | ★ |
p_age_days | 0.3643 | 무작위보다 나쁨(반예측) |
| 모형 B (위 전부 포함) | 0.5928 | — |
→ 부스팅 모형이 자기 입력변수 하나보다 AUC 0.25 낮을 수 없다. §6 표1 네 줄, §1의 결론, §8의 "AUC 0.593은 낮다"까지 전부 무효다. 원인은 시간분할에서의 분포 시프트로 추정되나 확정하지 않았다.
양성은 엣지 단위라 차수 가중(자식 5,550개 부모는 5,550번 등장), 음성 부모는 중복 없는 집합에서 균등 추출.
작성자 재검증 (테스트, 부모 out-degree):
| 평균 | 중앙값 | 0비율 | |
|---|---|---|---|
| 양성 | 132.10 | 0.0 | 54.2% |
| 음성 | 3.54 | 1.0 | 32.9% |
→ 중앙값이 역전돼 있다. 순열 중요도 −0.0193은 여기서 나온다. §1·§7의 "선호적 연결 통념이 성립하지 않았다"는 음성 추출기 설계의 부산물이다.
| # | 할 것 | 소요 |
|---|---|---|
| 1 | 음성 표본을 양성의 부모 차수 분포에 맞춰 추출 (degree-matched) 또는 동일 부모·다른 자식. 자식도 같은 분기로 시기 맞춤 | 0.5일 |
| 2 | 테스트에서 상수가 되지 않는 그래프 피처로 교체 — 부모의 조상·형제 집합, 루트 동일 여부, 계보 깊이, 2-hop, Katz/PPR. 테스트셋 분산 ≠ 0을 사전 assert로 강제 | 1일 |
| 3 | 모든 피처에 as-of 시점 부여. p_age_days 기준을 각 쌍의 자식 생성일로. likes/downloads는 사후 스냅샷이므로 분리하거나 §8에 명시 | 0.5일 |
| 4 | 부모 단위 클러스터 부트스트랩 (RIGOR_BAR 명시 요구인데 안 했다) | 0.5일 |
| 5 | §6 표2를 t3 전 행으로 교체 + 단일 변수 AUC 표를 하한선으로 병기 | 0.5일 |
§9 1단계(1주)에 지금 착수하는 것은 반대. 진단이 틀렸으므로 1주를 태우고도 같은 자리다.
same_license 2위는 발견인가 인공물인가 — 인공물이다1. 파생이 라이선스를 상속하는 것은 기계적 사실이다. 실측: 양성 쌍에서 양쪽 라이선스 보유 시 83.1%가 일치, 음성은 41.2%. HF 모델카드 템플릿이 base model 카드를 복사하고, Llama·Gemma 계열은 파생 라이선스 승계가 의무다. → "파생이면 라이선스가 같다"는 파생의 정의에 가까운 성질이지 가설이 아니다.
2. 사후 측정 변수다. license는 2026-08-07 스냅샷이고, 자식이 그 라이선스를 갖게 된 이유가 파생됐기 때문이다. post-treatment variable이며 시점상 누수다.
3. "2위"라는 순위 자체가 무의미하다. same_task도 0.6669로 거의 같다. 라이선스가 특별한 게 아니라 "부모와 자식이 닮았다"를 재는 지표는 전부 이 패턴을 낸다. 게다가 순위가 나온 D 모형은 죽일 이유 1·2로 오염돼 있다.
→ §10 3번 질문과 부록 5·6번 문장은 지금 상태로 교수님께 가져가면 안 된다. "그건 파생하면 당연히 따라오는 거 아닌가"에 답할 말이 없다.
→ 부모 속성만 쓰므로 사후 변수가 아니고, 종속변수가 노드 수준이라 쌍 샘플링 문제도 우회. 지도교수의 조직통제 축에 정면으로 붙는다
→ 동어반복이 아니고 통제 메커니즘의 실패 사례로 IS 문헌에 걸린다
이 셋 중 어디로 갈지는 사용자·지도교수 결정 사항이다.
아직 받은 피드백이 없습니다. 문장을 드래그해 밑줄을 그으시거나, 위아래 판정 버튼을 눌러 주십시오.