Generative AI for Beginners 第 01 课:生成式 AI 与大语言模型(LLM)原理全景解析
2026/9/7 15:08:38 网站建设 项目流程

Generative AI for Beginners 第 01 课:生成式 AI 与大语言模型(LLM)原理全景解析

【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners

本文基于 Generative AI for Beginners 课程的第 01 课(孟加拉语译文 translations/bn/01-introduction-to-genai/README.md)展开,系统讲解生成式 AI 的技术演进脉络、大语言模型"Tokenizer 切词 → 逐词元预测 → 概率分布采样"的内部工作机制,以及 prompt/completion 的核心概念与五类典型用法。读完后,你将理解 LLM 为什么是非确定性的、温度(temperature)参数如何影响输出,并能结合本仓库的shared/python工具链,真正发起第一次大模型调用。

生成式 AI 是什么,以及这门课在讲什么

生成式 AI 是指能够生成文本、图像和其他类型内容的 AI。它最大的价值在于"民主化"了 AI 的使用门槛:任何人不需学习 Java 或 SQL,只需用自然语言写一句提示(prompt),模型就会返回一个建议。你几秒钟内就能完成写报告、读报告、起草应用等任务,应用与影响力都极为可观。

这门课程(共 21 课,当前仓库为 Version 3)将通过一个虚构的教育类创业公司(后文简称"我们的创业公司")的视角,探讨如何利用生成式 AI 在教育领域开辟新场景,并如何应对应用带来的社会影响与技术局限这两类必然存在的挑战。

学习导引与学习目标

本课件将覆盖以下内容:

  • 商业场景介绍:我们的创业公司构想与使命;
  • 生成式 AI 及其所处的当前技术版图是如何形成的;
  • 大语言模型的内部工作机制;
  • LLM 的主要能力与实用用例。

完成本课后,你应当能够:

  • 说清"什么是生成式 AI"以及"LLM 是如何工作的";
  • 知道如何在不同用例(尤其是教育场景)中利用 LLM。

场景设定:一个教育领域的创业公司

生成式 AI 是 AI 技术的巅峰形态,不断突破过去被认为不可能的边界。虽然生成式模型能力众多、应用遍地,但本课程选择聚焦它如何革教育于命。"我们的创业公司"扎根教育领域,其使命宣言是:

在全球范围内改善学习可及性,确保教育公平,并根据每位学习者的需要,为每个人提供个性化的学习体验。

团队清楚:不借助现代最强大的工具之一——大语言模型(LLM)——就不可能实现这个目标。生成式 AI 有望彻底改变我们学习的方式:学生将拥有 7×24 小时在线的虚拟教师,随时获得海量信息与示例;教师也能借助创新工具评估学生并给出反馈。

我们是如何走到生成式 AI 的:四阶段技术演进

尽管生成式模型的公告制造了空前的hype(炒作热度),但这项技术已经酝酿了几十年,最早的研究可追溯到 20 世纪 60 年代。今天 AI 已具备对话等人类认知能力(例如 ChatGPT、基于 GPT 模型的对话式网页搜索 Copilot 等)。回看历史,可以清晰地划分为四个阶段:

1. 打字式聊天机器人:知识库 + 关键词匹配

最早的 AI 原型是"打字式聊天机器人"(typewritten chatbots):从一组专家处抽取知识库、录入计算机,知识库中的答案由输入文本中出现的关键词触发。但很快人们就发现:这种靠人工编写应答的方式无法良好地扩展(does not scale)。

2. 统计方法登场:机器学习

20 世纪 90 年代出现关键转折——统计方法被应用到文本分析中,催生了新的算法族,即机器学习(Machine Learning):能够从数据中学习模式,而无需被显式编程。这一思路让机器模拟"人类语言理解":统计模型在"文本-标签"配对上训练,学会把未知输入文本分类到预先定义的标签(代表消息意图)下。

3. 神经网络与现代虚拟助手

近年硬件技术的演进(能处理更大规模数据与更复杂计算)推动了 AI 研究,催生了神经网络 / 深度学习算法。其中循环神经网络(RNN)显著增强了自然语言处理能力:它通过评估词在句子中的上下文,使文本的语义表达更有意义。

正是这一技术驱动了 21 世纪第一个十年诞生的虚拟助手:它们擅长解读人类语言、识别需求并执行动作来满足需求——比如回复预定义脚本,或调用第三方服务。

4. 当下:Transformer 与生成式 AI

我们由此走到了今天的生成式 AI——它可视为深度学习的子集。

AI 领域数十年的研究之后,一种名为Transformer的新模型架构突破了 RNN 的限制,能够接收长得多的文本序列作为输入。Transformer 基于注意力机制(attention mechanism):让模型给它收到的不同输入赋予不同权重,"更加关注"信息最集中的地方——无论其在文本序列中的先后顺序如何。

近期大多数生成式 AI 模型——即LLM(因为它们以文本输入、文本输出工作)——都基于这一架构。这类模型的有趣之处在于:它们在来自书籍、文章、网站等来源的海量无标签数据上训练,因而可以适配非常多样的任务,并生成带有几分创意、语法正确的文本。它们不仅极大地提升了机器"理解"输入文本的能力,还赋予了机器用人类语言生成原创回答的能力。

LLM 内部机制:Tokenizer、逐词元预测与温度参数

下一课我们会探索不同类型的生成式 AI 模型,这里先聚焦OpenAI GPT(Generative Pre-trained Transformer)系列,看 LLM 到底如何运转:

  1. Tokenizer:把文本变成数字LLM 以文本为输入、以文本为输出,但作为统计模型,它们与数字的相处远好于与文本序列。因此每个输入在进入核心模型之前都会先经过tokenizer处理。一个 token(词元)是文本的一块,由可变数量的字符组成;tokenizer 的主要任务就是把输入切分成 token 数组,再把每个 token 映射为一个token index(原始文本块对应的整数编码)。

结合本仓库的源码印证:仓库的 requirements.txt 与 pyproject.toml 均把tiktoken列为核心依赖(openai>=1.0.0python-dotenvrequestsazure-ai-inferencetiktoken等)。从仓库依赖结构看,课程在后续"分词器"相关实验中可以直接调用tiktoken来复现上图的切词与整数编码过程,这正是本节原理的可运行版本。

  1. 预测输出 token:滑动窗口式补全给定 n 个 token 作为输入(每个模型的最大 n 各不相同),模型可以预测出一个token 作为输出;该 token 随后被并入下一轮迭代的输入中,按"扩展窗口"模式滚动推进——这就是用户能拿到一整句(或整段)答案的体验来源。它也能解释:如果你玩过 ChatGPT,可能注意到它有时会看起来在句子中间停顿——那正是逐 token 生成过程中的状态。

  2. 选择过程:基于概率分布采样输出 token 是依据它"出现在当前文本序列之后的概率"选出的:模型会预测所有可能"下一个 token"上的一个概率分布(基于其训练得出)。但并非总是选择概率最高的那个 token——选择过程中加入了一定程度的随机性,使模型以非确定性方式运行:同一输入不会得到完全相同的输出。这种随机性用于模拟"创造性思考"的过程,并可以通过名为temperature(温度)的模型参数进行调节。

我们的创业公司如何借助 LLM?prompt 与 completion 的五大形态

理解了内部机制,就可以看 LLM 最擅长完成哪些常见任务了。我们说过 LLM 的核心能力是:从自然语言书写的文本输入出发,从零生成文本

那么什么样的文本输入与输出?LLM 的输入称为 prompt(提示),输出称为 completion(补全)——后者指模型"生成下一个 token 以补全当前输入"的机制。prompt 中通常可以包含以下几类内容:

  • 一条指令(instruction):指明我们期望模型产生何种输出,有时内嵌示例或额外数据。典型子场景包括:
    1. 对文章、书籍、商品评论等的摘要,以及从无结构数据中提取洞察;
    2. 对文章、论文、作业等的创意构思与设计

  • 一个问题(question):以与智能体对话的形式提出。
  • 一段待补全的文本(text to complete):隐式地请求写作协助。
  • 一段代码(code):附带上"解释并写文档"的请求,或一条要求生成完成特定任务的代码的注释。

以上示例都很简单,并非对 LLM 能力的穷尽展示,而是为了说明使用生成式 AI 的潜力——在教育语境下,但不限于教育。

能力边界:生成式 AI 并不"完美"

原文档特别强调了必须建立的正确预期,这也是后续课程反复出现的主题:

  • 输出不完美:模型的"创造力"有时会反噬,产出人类会视为"对现实的歪曲"的词组拼贴,甚至冒犯性内容;
  • 它不"智能":至少按更全面的智能定义(包含批判性/创造性推理与情商)来说,生成式 AI 不算智能;
  • 它不是确定性的:同样的输入,响应可能变化;
  • 它不可盲信:编造(fabrication)——错误的引用、内容与论断——可能与正确信息混合在一起,并以自信且有说服力的口吻呈现。

后续课程将逐一处理这些局限,并给出缓解手段(如 第 03 课:负责任地使用生成式 AI、第 04 课:提示工程基础)。

实战准备:在本仓库中把 LLM 调用跑起来

本课件是纯概念课,但仓库已经为第 06 课之后的代码课准备好了完整工程底座,现在就可以验证"逐 token 补全"这套机制。

环境与依赖

仓库要求 Python ≥ 3.10(见 pyproject.toml),核心依赖在 requirements.txt:

ipywidgets==8.1.8 numpy==2.4.2 matplotlib==3.10.8 pandas==3.0.0 tqdm==4.68.4 python-dotenv==1.2.2 openai>=1.12.0 tiktoken azure-ai-inference scikit-learn

其中python-dotenv负责加载.envopenai是调用各家 API 的 SDK,tiktoken就是本节"文本 → token → 整数索引"原理的直接实现。

用仓库自带的 shared 工具发起一次 completion

仓库的 shared/python 模块封装了 API 客户端创建与环境变量校验。以下脚本演示了课件"prompt 进、completion 出"的最小闭环:

# 1) 加载 .env 中的密钥(对应课程 setup 文档的 .env 约定) import os from dotenv import load_dotenv load_dotenv() # 2) 校验必填环境变量:缺失时抛出带指引的 ValueError # (实现见 shared/python/env_utils.py 的 get_required_env / validate_env_vars) from shared.env_utils import get_required_env api_key = get_required_env("OPENAI_API_KEY", "OpenAI API 鉴权") # 3) 创建客户端(实现见 shared/python/api_utils.py 的 create_openai_client) from shared.api_utils import create_openai_client client = create_openai_client(api_key=api_key) # 4) 一次最小的 completion:prompt 进,文本出 prompt = "用一句话解释什么是 Transformer 注意力机制" response = client.responses.create(model="gpt-4o-mini", input=prompt) print(response.output_text)

源码层面可以看到几处与课程理念呼应的工程设计(对应 tests/test_env_utils.py、tests/test_api_utils.py 的测试覆盖):

  • create_openai_client:API key 优先取参数,否则回落到OPENAI_API_KEY环境变量;两者都缺失时抛出带说明的ValueError,而不是让 SDK 在运行时报晦涩错误;
  • get_required_env / validate_env_vars:把"密钥是否配置"做成显式、可测试的前置检查;
  • make_safe_request:带 30 秒超时与 3 次重试的 HTTP 封装,体现"模型 API 调用需要容错"的工程常识。

安全补充:shared/python/input_validation.py 中的sanitize_prompt_input会剥离空字节、控制字符以及模板注入({{...}}${...})、<script>标签等潜在注入模式——这正是课件"不可盲信输出、也要审慎构造输入"理念在代码中的落地。若你希望验证本机环境是否就绪,可以直接运行pytest(测试路径由 pyproject.toml 的[tool.pytest.ini_options]指向tests/)。

完整的账号、.env配置与 Codespaces 排障步骤,见课程 课程环境搭建(Course Setup) 及 本地安装指南;模型提供商的选择见 providers.md。

本课作业

你的作业是:进一步阅读生成式 AI 的资料,尝试找到一个今天还没有用上生成式 AI、但你希望加上它的领域。与"老办法"相比,影响会有什么不同?你能否做成以前做不到的事,或者速度更快?请为你梦想的 AI 创业公司写一段300 字摘要,包含"问题(Problem)""我将如何使用 AI(How I would use AI)""影响(Impact)"等小标题,可选地附一份商业计划。

知识自测:关于 LLM,哪个说法正确?

  1. 每次都会得到完全相同的响应。
  2. 它做事十全十美:加数、生成可运行代码都样样精通。
  3. 即使使用同一个 prompt,响应也可能不同;它擅长为某样东西(文本或代码)给你一个好的初稿,但你需要在此基础上继续改进。

答案:3。LLM 是非确定性的,响应会有变化,不过你可以通过 temperature 设置控制其变化幅度。也不应指望它一次做对——它的价值在于替你完成"重活":通常意味着得到一个不错的初稿,而你要做的是逐步改进它。

小结与下一步

  • 生成式 AI 经历了"关键词机器人 → 机器学习 → 神经网络/RNN → Transformer"四个阶段的演进,LLM 正是 Transformer 架构的产物;
  • LLM 的核心回路是:Tokenizer 把文本切为 token 并映射为整数索引 → 模型基于概率分布预测下一个 token → 以扩展窗口方式滚动生成 completion
  • temperature 是调节"创造性随机度"的旋钮;同一输入不会总得到同一输出;
  • 输出要谨慎对待:不可盲信、不可全信,需持续迭代改进。

学完本课后,继续前往 第 02 课:探索与比较不同类型的 LLM,了解如何为你的用例挑选模型。

翻译说明(继承自原文档):本课程的孟加拉语文本由 AI 翻译服务生成,英文原文(01-introduction-to-genai/README.md)应视为权威来源;自动翻译可能存在误差,重要信息建议参考英文原文或人工翻译。

【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询