经典层板 · MHA+FFN(12 块代表,GPT-3 实为 96 层)
CED 因果编码器(20 层)
CSA2 · Full(自算 main KV + indexer K,产出新 Top-K)
CSA2 · Reindex(复用最近层 KV,重新打分)
CSA2 · Reuse(连 Top-K 索引一并复用)
SWA 局部滑窗(第 1、2 层仅 SWA)
Engram 条件记忆库(第 1、14 层)
DSpark 投机草拟塔(3 block · 草拟 5)
DeepSeek-ViT · pixel-unshuffle 3×3→1
CED 全局 KV 投影弧(HL/2 → 各解码层)