【手撕系列】手撕Qwen3-Next 【2026-02-06】从零手撕一个小参数量的Qwen3-Next模型,包括Gated DeltaNet、Gated Attention、MoE、负载均衡、Zero-Centered RMSNorm等实现,进行预训练和微调。
【论文解读】Transformers are RNNs 【2026-01-18】本文提出了经典的 Linear Attention,大幅降低原始 Transformer 的内存与计算成本,利用矩阵乘积结合律使自注意力的时间和内存随序列长度呈线性增长。