基本概念
涵盖PLM与LLM概念及FNN、CNN、RNN、Transformer等神经网络架构
从自然语言处理与预训练语言的 basics 出发,沿序列建模的 RNN、Transformer 架构,延伸至大语言模型 LLaMA 与 MoE 结构,并进一步覆盖 Agent、MCP 工具调用与大模型推理部署等前沿内容。
涵盖PLM与LLM概念及FNN、CNN、RNN、Transformer等神经网络架构
讲解词编码与词嵌入,并介绍循环神经网络RNN的结构、前文传递及长期依赖缺陷
介绍大模型自回归推理机制与训练流程,涵盖prompt、completion及损失反向传播
介绍训练数据的token、EOS、上下文长度与步幅,以及词嵌入和位置编码
详解Transformer自注意力、QKV、掩码与多头注意力,及输出采样、堆叠结构与KV缓存
对比密集模型与混合专家模型MoE结构,介绍路由选择及Deepseek的MoE改进
介绍Agent智能体概念及ReAct、Plan-执行架构,梳理从Prompt到harness的演进
介绍模型上下文协议MCP的概念、类型、工作原理及Python与VSCode实战配置
介绍 superpowers 与 openspec 两款 AI 辅助开发套件的流程、命令与规范驱动开发模式
讲解 llama.cpp 大模型推理框架的命令行工具、量化参数与推测性解码配置