bjt 用 R torch 从零构建的 JEPA (Joint Embedding Predictive Architecture) 带思维链的大语言模型,含 BPE 分词器训练、预训练、SFT 微调、推理全流程,总计约 700 行主脚本代码,单卡 RTX 4090 可跑,训练成本约 4 块钱。 效果预览: 预训练的续写 SFT 之后的问答 项目地址: https://github.com/sunbjt/Rtomic
bjt 项目做了一个更新,见 https://github.com/sunbjt/stat-llm-lab 探讨了从经典 GPT 到对比学习、残差预测,JEPA 世界模型、MoE 模型等多种架构。以及归一化对数似然的四选一模型评估、表征工程、logit 透镜等分析技术。 当然还有一个更为关键问题:如何从各类 LLM 项目中找到合理的语料数据,并能够在 1-2 个小时训练出结果。 项目完整走下来,对大语言模型基本就可以祛魅了。