基础层:深度学习前置
从张量和自动微分起步,把神经网络、损失函数、反向传播、优化器与正则化一路讲到 CNN、RNN 与 Transformer——大模型之所以能 work 的底层数学与结构,后面所有模块的地基。
按知识依赖重排的 9 个模块、57 页讲义,从神经网络基础一路走到多模态与前沿。每讲一页,固定八段结构:30 秒看懂 → 概念 → 原理 → 最小代码 → 完整案例 → 骨架模板 → 易错点 → 自测题。
从左到右是推荐顺序:先打地基,再建工具,最后改模型本体。点击跳到对应模块。
从张量和自动微分起步,把神经网络、损失函数、反向传播、优化器与正则化一路讲到 CNN、RNN 与 Transformer——大模型之所以能 work 的底层数学与结构,后面所有模块的地基。
主流大模型有哪些、彼此差在哪、怎么用 API 把它接进自己的程序——从「听说过」到「调得通」。
不改一个模型参数,只靠一张「工作便条」把效果拉上去:先用 NLP 四范式讲清 Prompt 从哪来,再把 In-Context Learning、CoT、Instruction-Tuning 与 PEFT 家族摆进同一张坐标系,接着落到 ChatGPT 时代的提示词工程两大原则,最后用金融行业动态方向评估的三个真实任务——分类、信息抽取、文本匹配——把方法论跑成可复现的代码。
把模型从别人的云端搬到自己的机器上:先算清显存能跑多大的模型,再用 Ollama 命令行跑通对话,接着在 Linux 上做成 systemd 托管的企业级服务,最后通过 HTTP 接口接入客户端与自研聊天机器人,数据全程不出内网。
让模型真正干活的一整套应用层工具:LangChain 把提示词、模型、解析器串成流水线,LCEL 用一个管道符组合出可复用的链,Memory 让多轮对话记得住上文,Function Call 把外部世界接进来,Agent 在循环里自主决策该调用谁,最后用 Streamlit 把这一切包成一个能对外交付的对话应用。
给模型外挂一个可检索的资料库:切分与向量化决定库里有没有答案,检索与重排决定能不能把它拿准,最后落到一个可验收的行业问答系统。
不写代码也能搭应用:先把「自建、订阅、自部署」这道选型题算清楚,再吃透编排式工作流的通用骨架(节点、变量、知识库、插件),然后在 Coze 和 Dify 上各走通一条完整链路,最后看托管式 Agent 接口这条路的兴衰与迁移方案。
提示词到头了就改权重:从 PET/P-Tuning 到 LoRA,再到把大模型的能力蒸馏进小模型。本课程项目最密集的一块。
从 AIGC 的产业版图一路走到能自己跑通的文生图:先弄清生成模型三条技术路线,再拆开 CLIP 的跨模态对齐与扩散模型的加噪/去噪数学,然后把 Stable Diffusion 的三个子模型拆到张量维度,最后用 DreamBooth 和 LoRA 把它训成自己的画风并接成线上服务;收尾是一套可复用的论文精读与撰写方法。