結構相似度
每個模型被編碼為一個特徵向量——注意力類別、MoE 佈局、正規化、位置編碼、激活函數、訓練精度,加上對數尺度的規模與上下文長度。向量之間的餘弦相似度可以找出「結構上的兄弟」:在不同規模上做出相同結構押注的模型。
計算方法
特徵向量由類別選擇(注意力類別、正規化、位置編碼、激活函數、精度)的 one-hot 編碼,加上正規化的對數尺度特徵(總參數、上下文長度、層數、隱藏維度)構成。相似度為餘弦值,衡量的是結構相似而非能力相近。
相似度熱力圖
01
行列均為模型並按實驗室分組;顏色越深越相似。懸浮可查看精確數值。
相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。
相似度 > 0.93
相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。