外观
极速索引
从理论、部署到组件、框架和应用,把搭 Agent、跑 Agent 常用的软件与文档入口放在一起,方便对照和筛选。
2017 年提出 Transformer 的原始论文(Vaswani et al.),现代大模型结构的共同源头。
自注意力与 Transformer 的源头论文。
大规模训练与推理优化库:ZeRO、Offload 等,方便在多卡上扩展。原微软团队发起,现由 DeepSpeed(deepspeedai)社区维护。
大模型训练省显存、提吞吐,ZeRO 让更大模型训得动。
开源机器学习的协作与分发平台:模型、数据集、Spaces(Demo)的集散地;也支持团队私有协作。
模型与数据集的公共货架,找权重、试推理都从这进。
图解文章:把 Attention Is All You Need 拆成可扫读的结构图,适合入门对照。
用图拆开 Attention,建立直觉比硬啃论文更快。
从零手写神经网络到 GPT / Tokenizer 的视频课 + 配套代码,偏直觉与可运行实现。
从零手写到能训练,把反向传播真正跑通。
NVIDIA 开源的大规模 Transformer 训练参考实现,以及可组合的 Megatron Core 库,面向多 GPU / 多机。
NVIDIA 超大模型多卡并行训练的主流路线。
主流深度学习框架:张量计算、自动求导、神经网络模块与 GPU/加速器上的训练与推理。开源大模型实现与微调脚本大多基于它。
训练与改模型的事实标准,开源仓库大多基于它。
预训练模型的定义与加载库:覆盖文本、视觉、音频、视频与多模态;同时服务推理与训练。Hub 上有大量基于它的 checkpoint。
加载、推理、微调开源模型的事实标准库。
共 8 项