RESULT / 44

논문2026.08.2527 MIN

Chinchilla 정독: 20토큰/파라미터는 Table 3에서 나왔다

세 접근법이 낸 예측을 표에서 직접 나눠 봤다. 토큰/파라미터가 20 근처에 머무는 것은 Approach 1 열뿐이고 파라메트릭 적합 열은 23에서 142까지 간다. 세 예측은 실험을 돌린 구간에서 7% 안이지만 예산을 열 자릿수 밀면 2.6배로 벌어진다.

논문2026.08.2424 MIN

Attention Is All You Need 정독: Table 3의 params 칸이 요구하는 어휘는 37,000이 아니다

논문 Table 3을 HTML에서 직접 파싱해 스무 행을 복원하고, params가 적힌 열 행의 파라미터 수를 shape 산술로 다시 셌다. 논문이 §5.1에 적은 어휘 37,000으로는 어느 행도 맞지 않는다. 아홉 행은 40,932~41,160이라는 한 창에서 동시에 성립하고 big 한 행만 35,296~36,272를 요구해 교집합을 깬다.

논문2026.08.2421 MIN

HNSW를 5,183 벡터로 재현했다: M 범위 5~48은 맞았고, 메모리 공식의 위층 항은 5.4배 컸다

Malkov & Yashunin(arXiv:1603.09320)의 M 권장 범위와 메모리 공식을 scifact 5,183 벡터에서 다시 쟀다. 범위 5~48은 이 규모에서도 성립했지만 §4.2.3의 공식은 M=64에서 실측보다 9.4% 크다. 원인은 위층 층수를 mL로 잡은 자리이고, 같은 논문의 레벨 생성 규칙에서 나오는 값은 1/(M−1)이다.

논문2026.08.2326 MIN

앞에서 잘라도 되는 임베딩: MRL 학습의 흔적은 64차원 한 자리에만 남았다

MRL(arXiv:2205.13147)은 앞 m차원만 써도 된다고 말한다. 손실만 다른 mpnet 두 개를 scifact에서 재니 절단 유지율이 여섯 자리 중 다섯에서 동률이었고, 갈린 곳은 훈련 중첩 차원의 맨 아래인 64차원 하나였다. 그리고 MRL 아닌 모델은 PCA가 절단을 거의 모든 자리에서 이겼다.

논문2026.08.2327 MIN

RRF는 정말 학습 없이 이기는가: 한국어 코퍼스에서는 Condorcet이 이겼다

순위 융합 논문(Cormack 외, SIGIR 2009)은 제목이 곧 주장이다 — RRF가 Condorcet과 개별 시스템을 이긴다. KorQuAD 문단 960개·질의 5,774개에서 시스템 셋을 융합해 다시 재니 RRF가 네 융합 방식 중 꼴찌였다. Condorcet이 R@1에서 0.0521 앞섰고, RRF는 최고 단독 시스템보다도 0.0402 낮았다.

논문2026.08.2217 MIN

고차원에서 거리는 무의미해진다는데 임베딩은 왜 멀쩡한가 — Beyer 1999를 384차원에서 재현했다

iid 좌표에서 차원이 오르면 최근접과 최원접이 같아진다는 Beyer(1999)의 상대대비를 재현하니 384차원 균등난수에서 0.25까지 떨어졌다. 그런데 같은 지표를 scifact 실제 임베딩 384차원에 재니 0.83으로, iid 64차원 수준이었다. 정규화 때문이 아니다 — PCA로 잰 내재 차원이 참여율 65, 두 측정이 같은 수를 가리켰다.

논문2026.08.2217 MIN

BEIR 정독과 scifact 재측정: BM25는 DPR을 17:1로 이기지만, 최신 dense와는 300질의 안에서 구별되지 않았다

BEIR 논문(arXiv:2104.08663) Table 2를 직접 세니 BM25는 DPR을 18개 중 17개에서, ANCE를 14개에서 이긴다. 그런데 우리 실험대에서 scifact를 다시 재니 BM25 0.6617과 dense 0.6451의 차이는 300질의 부트스트랩 구간 [-0.022, +0.055] 안이었다. '제로샷에서 BM25가 이긴다'가 참인 경계는 dense의 세대였다.