Day7 了。说实话,我的“从零开始学AI”计划,前6天一直处于一种“看起来很忙,实际上不知道自己学会了什么”的状态。作为大三双非二本学生,我给自己定了一个三个月逆袭计划,结果头一周下载了十几个G的资料,收藏了四个B站up主的学习路线,笔记本上密密麻麻写满了“Transformer”“自注意力”“SOTA”“微调”这些词——可一旦有人让我用自己的话解释“大模型到底是怎么工作的”,我就会陷入沉默。
这种状态在第7天终于被打断了。我想明白了一件事:我的目标不是成为理论研究型选手,而是用三个月时间做到“能独立做出一个能演示的AI小作品”。这两个目标的学习路径,完全是两条路。所以Day7我只给自己定了一个任务:亲手调用一次大模型API,让它在我的屏幕上吐出一段文字。就这一个任务,比前面六天看的任何资料都值钱。
下面这些内容,就是我Day7的全记录和踩坑过程,包括环境准备、第一段代码、参数实验,以及我总结的零基础避坑思路。如果你也在从零开始学AI,或者同样是普通院校学生,想用三个月给自己加点竞争力,那这份记录应该能帮你省下不少摸索时间。
1. 前6天踩的坑:我差点把“收藏”当成“学会”
1.1 资料囤积症:越收集越焦虑
前6天我具体干了什么,现在回想起来都觉得有点好笑。Day1刷到一份“AI学习路线图”,从Python、PyTorch一路排到大模型微调,规划得井井有条,我如获至宝,收藏。Day2又刷到一个视频,标题是“三个月进大厂做AI”,顺藤摸瓜找到了配套笔记,收藏。Day3看到一篇万字长文,把大模型基础理论从头梳理了一遍,甚至附了数学公式,我又收藏了。到了Day6,我的收藏夹里躺着将近100个链接,文件夹建了七八个,叫“必看”“待整理”“第二轮学习”……但真正打开过的,不超过五个。
回头分析,这就是典型的“输入型满足感”。看视频、存资料的时候,大脑会分泌一种“我在进步”的错觉,因为你持续在被新概念冲击,觉得自己离“懂AI”越来越近。问题在于,知识和技能之间隔着一道巨大的传送门:看别人演示代码,和你自己敲出能跑的代码,是两种完全不同的体验。Day6晚上我给自己做了个测试:关掉所有资料,凭记忆写一篇“我对大模型的理解”。结果只写出三行半,其中还包括一句“大模型是一种基于深度学习的语言模型”这种车轱辘话。那一刻我才意识到,我收藏了别人嚼过的东西,却没有真正咀嚼过哪怕一口。
1.2 为什么“知道”和“会做”之间隔着一条鸿沟
这个道理其实你早就听过无数遍,但只有自己撞上去一次,才会真的明白。就拿“API”这个词来说,我以前以为懂了——不就是应用程序接口嘛,程序之间通信用的。可真到动手那天,我面临的是一连串非常具体的问题:API Key去哪申请?base_url填什么?model参数填什么名字?为什么我填了“deepseek-chat”却报错?哪来的一堆HTTP状态码403、401又是什么意思?
这些问题,教程一概没讲。因为教程默认你有一点点基础,或者默认你会遇到问题之后自己去查。但双非学生最缺的恰恰是这种“自己查”的底气——不是不会查,而是面对报错时,连“该去哪里看文档”“该搜什么关键词”都不知道。依赖肌肉记忆,我跌跌撞撞花了两个小时才跑通。但跑通之后的那种踏实感,是看十个小时视频都给不了的。
1.3 Day7的定位:给三个月的计划打第一根桩
我把三个月的逆袭计划简单分成了三个阶段:第一个月打基础,核心目标是“跑通能跑通的一切”;第二个月做项目,核心目标是“用AI工具解决一个真实问题”;第三个月沉淀作品,核心目标是“把做过的东西整理成别人能直接看到、直接用的东西”。
Day7正好落在第一个月的第一个完整学习周之后。为什么一定要在第7天安排实操?因为网上“XX天学会AI”的标题太多了,但真正能被量化的里程碑,永远是你亲手跑通第一个模型调用的那一天。Day7之前,我的计划只是一张PPT;Day7之后,我的计划里终于有了一根活生生的桩。说白了,当你能用自己的代码让大模型回话,你就从一个“看戏的”变成了“搭台子的”。这种身份切换带来的学习动力,比再多打鸡血的视频都管用。
2. Day7实操全流程:从零到第一次API调用
2.1 环境准备:真的不用装PyTorch
这大概是零基础同学最大的误解——以为学大模型必须要先装深度学习框架,把CUDA、GPU、PyTorch折腾一遍才算开始。Day7我用的环境寒酸得令人发指:一台带Windows系统的普通笔记本、Python 3.11、一个VSCode,外加一个浏览器。没有显卡,没有训练框架,甚至没有一个像样的IDE,照样完成了第一次模型调用。
具体步骤我列出来,照着做就行:
- 先确认电脑有没有Python。命令行输入
python --version,如果提示命令不存在,就去Python官网下载3.10以上的版本,安装时记得勾选“Add Python to PATH”。这一步不做,后面所有指令都会找不到python。 - 新建一个项目文件夹,比如
D:\ai-learning\day7,用VSCode打开,这是以后所有代码的家。 - 在VSCode的终端里执行
pip install openai,安装OpenAI官方SDK。这里有个关键判断:国内很多大模型服务商都兼容OpenAI的接口格式,所以只装这一个SDK,以后换服务商基本不用改代码。这是我在Day7做的最划算的一笔投资。 - 去模型服务商官网注册账号,创建API Key。新用户一般都有免费额度,足够新手练习一两个星期。
为什么我不提装CUDA、装GPU版PyTorch?因为对纯新手来说,第一天就本地跑大模型,既不现实也没必要。你接下来要学的是“调用模型”,而不是“训练模型”,最贵的计算资源云端已经帮你准备好了。等以后真到微调模型那一步,再回头研究显卡也不迟。提前做超出阶段的事,只会白白消耗你的热情。
提示:API Key相当于你的账户密码,千万别写死在代码里往GitHub上传,也千万别截图发到群里。我现在的习惯是先写在一个临时变量里,等第三周再统一改成
.env文件管理。
2.2 3分钟的第一段代码:大模型第一次“开口”
环境就绪之后,我写下了人生中第一段真正意义上的AI调用代码,大概只有十几行:
from openai import OpenAI client = OpenAI( api_key="sk-你的key", # 在服务商控制台创建 base_url="https://api.deepseek.com/v1", # 兼容OpenAI格式的国产大模型 ) resp = client.chat.completions.create( model="deepseek-chat", messages=[ {"role": "system", "content": "你是一名耐心、喜欢打比方的AI学习导师"}, {"role": "user", "content": "请用2句话,讲清楚什么是大语言模型"}, ], temperature=0.7, max_tokens=200, ) print(resp.choices[0].message.content)按下运行之后,终端停顿了两三秒,然后像变魔术一样吐出一段文字:“大语言模型是一种基于海量文本数据训练出来的深度学习模型,它通过学习语言规律,能够理解并生成自然流畅的文字。你可以把它想象成一个读了无数本书的学生,你说上句,它能根据概率接下句,但比自己死记硬背厉害得多。”
那一刻我的感觉非常奇妙。之前所有抽象概念——参数、训练、生成、上下文——突然有了一个实实在在的落点。原来“大模型”不是PPT里的一个框,而是一个我亲手写出来的代码里、一个会回话的东西。这个体验直接治好了我前6天积攒的焦虑。
2.3 别急着往下学:把参数“玩坏”才算入门
很多人调通第一步就满足了,赶紧去看下一节视频课。我的建议是停一停,花半小时把几个关键参数挨个改一遍,你得到的体感会远超十篇教程。
我做的第一个实验是改temperature。改成0之后,输出变得非常稳定,但语气明显干巴、单调;改成1.3之后,文字开始“飘”,甚至出现逻辑跳跃。查了原理才知道,temperature控制的是模型采样时的随机程度——越接近0,模型越保守,几乎总是选概率最高的词;越大,越容易去选那些概率低“但说不定更好玩”的词。这解释了为什么代码补全类工具喜欢低温度,而文案创作可以拉高一点。
第二个实验是改max_tokens。改成50之后,回答硬生生被截断了,话说到一半戛然而止。这个参数限制的是生成的最大长度,给太少回答不完整,给太多则增加等待时间和费用。对我来说还要养成一个习惯:看返回结果里的usage字段,它会告诉你这次调用消耗了多少输入token和输出token。做AI工程实践,时刻知道自己消耗了多少资源,是最基本的成本意识。
第三个实验是改system消息。把它从“耐心的AI学习导师”改成“毒舌程序员”,同一个问题得到的回答风格彻底变了。这一刻我才真正理解:提示词不是玄学,而是在明确地给模型设定任务边界和行为人设。我把这三个实验的结果整理成了一个小表格,这就是我Day7的第一个“作品”:
| 参数 | 实验值 | 观察到的现象 |
|---|---|---|
| temperature | 0 | 输出稳定,但语气呆板 |
| temperature | 0.7 | 自然流畅,平衡 |
| temperature | 1.3 | 有想象力,偶尔逻辑跳跃 |
| max_tokens | 50 | 回答被硬生生截断 |
| max_tokens | 500 | 内容完整,费用略微上升 |
| system | 导师人设 | 解释耐心通俗 |
| system | 毒舌人设 | 输出犀利简短 |
3. 零基础学大模型基础理论:三个必须想清楚的取舍
3.1 数学要不要啃?先开起来,再研究发动机
我见过太多零基础的朋友,兴致勃勃买了《深度学习》《统计学习方法》,然后在前三章的数学推导里彻底放弃。我自己前6天也在干类似的事,收藏了好几个带着拉普拉斯变换的学习视频,一个都没看完。Day7跑通之后,我反而释然了。
现在的你,第一目标应该不是理解“为什么大模型能生成文字”,而是“怎么能让它为我生成文字”。打个比方:你不需要会造发动机,才敢开车上路;你现在要做的第一件事是踩油门,让车动起来。等你在路上遇到“为什么起步会顿挫”这类具体问题时,再回头研究发动机结构,那时候你的学习动机和吸收速度,和为了学而学完全不一样。
这不等于完全放弃数学。我给自己定的路线是:第一个月,只要求术语级别的理解——比如“梯度下降就是一个不断让误差变小的过程”,不要求推导;第二个月做项目时,如果用到RAG(检索增强生成)或者微调,再回头补对应的数学直觉。不要求会证明,但要求能用自己的话说清楚“它在干什么”。这个标准对三个月逆袭来说足够了。
3.2 理论、应用、工程:三线并进的配比
“学AI”这三个字太模糊了,我把它拆成了三条线,每一条对应不同的内容和权重。
| 学习线 | 包含内容 | 我给的权重 |
|---|---|---|
| 理论线 | token、上下文窗口、大模型基础理论、RAG与微调的区别 | 30% |
| 应用线 | 提示词工程、API调用、AI编程提示词、工具链使用 | 40% |
| 工程线 | Python、命令行、版本管理、模型部署的基础认知 | 30% |
为什么应用线权重最高?因为对零基础的人反馈最快。你改一行提示词,立刻能看到效果变化,这种即时反馈能支撑你走下去。理论线负责给你判断力,避免别人说什么你都信;工程线负责让你做出来的东西不是只在你自己电脑上能跑。三条线缺一不可,但顺序上一定是应用先行,用应用倒逼理论,再用理论反哺工程。
3.3 检验“学明白了”的三个标准
我发现很多教程只教输入知识,却很少讲怎么检验你是“真会了”还是“看懂了”。这里分享三个我给自己定的检验标准,每个都能在15分钟内完成。
第一,讲给室友听。如果你能不用任何专业术语,让一个文科室友听懂什么是大模型、什么是提示词,那你是真懂了;如果只能复述“它是一种语言模型”这种车轱辘话,那还没到位。第二,预测行为。改temperature之前,先凭直觉预测输出会怎么变,再运行代码验证。预测对了说明你建立了因果直觉;预测错了,恭喜,你刚刚找到自己的认知盲区。第三,改造样例。不看任何教程,把Day7这段代码改成“给AI设定一个新角色,连续问答三轮”的小程序,越丑越好,只要跑得通,就说明这段知识已经进了你的手指。
4. “双非二本”这个标签,怎么变成动力而非包袱
4.1 诚实面对起点:资源不多,但机会窗口还在
先交代我的处境:三线城市的普通二本,计算机相关专业,但课程内容偏旧,教材里的技术栈比市场至少落后三五年。周围同学大多在准备考研考公,能聊AI的不超过三个。没有学长内推,没有实验室氛围,有时候连一个报错信息都找不到人请教。
但Day7我想通了一个事实:AI这个领域现在最大的特点是“还没定型”。今天热门的工具,三个月后可能被淘汰;今天没几个人听过的概念,明天就可能出现在招聘JD里。这意味着什么?意味着在这个赛道上,真正的优势不是静态的资源,而是“谁更能持续学习”。双非学生确实没有牌子加持,但也没有太多可失去的东西。当一个人没什么可失去时,冲的胆子反而会更大。我不想把这句理解成鸡汤——它是我前6天焦虑到失眠之后,实实在在用来稳住自己的逻辑。
4.2 每天4小时:普通学生的可持续节奏
作为一个大三学生,白天要上课、写作业、偶尔应付社团活动,能稳定利用的时间段其实只有晚上。我给自己定的作息是这样:早上8点到8点半,复习前一天的笔记,不学新东西;晚上8点到10点半,两个半小时的大块学习,这是每天的核心;临睡前15分钟,写学习日志,记录今天跑通的、卡住的内容。
周末则是双倍时间:上午两小时,下午两小时,专门用来做小项目或者补理论。这个安排没有任何惊艳之处,关键就四个字:雷打不动。3个月里最怕的不是学得少,而是断两天之后彻底放弃。所以我把底线设得很低——哪怕某天状态奇差,只学20分钟,也比完全停摆强。习惯断开再想接上,成本至少翻倍。
4.3 低成本甚至零成本的资源清单
双非学生的现实约束是,拿不出几万块报培训班。但好消息是,现在AI学习能找到的高质量免费资源,比很多付费内容都好。
- 模型API:多个国产大模型平台都有新用户免费额度,够新手练习一阵子。之后按量计费,一次问答几分钱到几毛钱,完全承受得起。
- 官方文档:不要只看二手教程,服务商官网的文档准确、更新及时,是最好的老师。遇到英文看不懂就开翻译,但一定要读原文。
- Hugging Face:查模型、读论文、看开源项目,全部免费,还能看到全球开发者的最新动态。
- GitHub:搜“awesome-ai”这类仓库能找到高质量学习清单;遇到不懂的项目就去看Issues,很多疑惑早就有人问过。
- 免费算力:以后要跑开源模型,Colab和Kaggle的免费GPU够做小型实验。
写这段时我想强调一句:资源不在多,在用透。我身边不少同学,手里捏着几百个课程链接,却连一次API都没调过。把一条路径走穿,比收藏一百条路径有用一百倍。
5. 从Day8到Day14:我给自己定的下一周清单
5.1 先把“单次问答”升级成“多轮对话”
Day7的代码只能一问一答,就像两个人见面只准说一句话。我给自己定的第一个升级任务是:让程序支持多轮对话,每轮都能带上之前的聊天内容。
这其实是一个AI Agent的雏形。大模型本身没有记忆,你要做的就是手动维护记忆——把用户每次说的话追加到messages列表里,再整体发给模型。我最开始的版本长这样:
messages = [] while True: user_input = input("你:") if user_input == "exit": break messages.append({"role": "user", "content": user_input}) messages = messages[-20:] # 粗暴但有效的截断:只保留最近10轮 resp = client.chat.completions.create( model="deepseek-chat", messages=messages, ) reply = resp.choices[0].message.content messages.append({"role": "assistant", "content": reply}) print("AI:", reply)这段代码里最容易被忽略的是截断逻辑。如果一直往里追加消息,上下文会无限变长,费用和延迟都会上涨。只保留最近十轮,是我第一次认真思考“上下文窗口”这个概念的契机。别小看这一步:消息结构、上下文管理、成本控制,都是后续所有复杂AI应用的地基。
5.2 建一个属于你自己的提示词模板库
很多人用AI是当场瞎写提示词,效果不好就一句“AI不行”收场。实际上提示词是有方法论的:角色设定、任务描述、输入输出格式、约束条件,这四件套写清楚,效果立刻不一样。
我给自己的小目标是:一周内收集20个场景的提示词模板,包括“代码解释器”“学习规划师”“文案润色”“简历修改”等。每个模板至少要实测三次,把“哪些说法有效、哪些说法无效”记录下来,迭代出一个稳定的版本。这个模板库既是我练习AI编程提示词能力的手感来源,也顺手成了我的第一个可展示作品——以后写简历时,“熟悉提示词工程”这句话终于不是空话了。
5.3 周末挑战:跑通一个最简单的Agent流程
下一个周末,我准备挑战一个“带工具的小助手”。场景很具体:让大模型根据用户提问,决定要不要调用一个“天气查询函数”,然后基于函数的真实返回结果来组织回答。这就是网上天天在讲的AI Agent的一个最简形态——模型不只是会聊天,还会决定调用工具、根据工具结果继续行动。
我提前写的伪代码是这样的,算是给自己立个靶子:
# 伪代码,Day12-14要落地的东西 def get_weather(city: str): # 真实场景会在这里调用天气API return f"{city}今天晴,25℃" tools = [ { "type": "function", "function": { "name": "get_weather", "description": "查询一个城市的当前天气", "parameters": { "type": "object", "properties": {"city": {"type": "string"}}, "required": ["city"], }, }, } ] # 循环逻辑: # 1. 把用户问题和工具列表发给模型 # 2. 模型返回 tool_calls 就执行对应函数 # 3. 把函数结果追加回 messages # 4. 模型不再要求调用工具时,输出最终回答这套流程我预期会踩不少坑,比如工具参数格式解析、函数执行出错后的兜底处理。但踩完这些坑,我对“AI Agent搭建”就有了真正的体感,而不是停留在“智能体”三个字的概念层面。等单Agent流程跑顺,下一阶段就可以研究多AI协作,让一个Agent拆解任务,另一个负责执行,再一个负责检查结果。
5.4 每周复盘:把“学过”变成“作品”
月底前,我想把这三周的内容整合成一个小作品。目前有两个备选方向:一个是“专业课程问答机器人”,把我们专业课老师发的课件转成问答数据,做一个能陪同学复习的机器人;另一个是“课程资料摘要工具”,把课程PDF自动生成复习提纲。
无论最终选哪个,我都打算把过程写成博客,就像今天这篇一样。因为输出是最快的照妖镜,哪里没想通一写就暴露。而且三个月后,当别人还在简历上写“熟悉大模型”时,我可以直接甩出一个能跑的链接和一份完整的开发记录。对双非学生来说,这种看得见摸得着的东西,比任何形容词都有说服力。顺带提一句,现在比较热门的AI漫剧、AI短视频方向,底层需要的也是这套能力——先用大模型生成文案框架,再用图像模型出图,最后剪辑合成,本质上还是提示词和工程链路的功夫,路径是相通的。
最后说点不太“正能量”的话。三个月逆袭计划能不能成功,说实话我到现在也没底。Day7之前我差点放弃,因为“从零开始学AI”这种标题网上遍地都是,我不确定自己会不会又是三分钟热度。但今天跑通第一次API调用之后,那种“我真的让它开口说话了”的实感,让我开始相信一件事:这条路不需要你天赋异禀,只需要你愿意一次次把“看不懂”变成“跑通了”。Day7的一切,就是从一行代码开始的。明天的我,打算从十行代码开始。