概念入门总览:从零看懂 AI 编程助手#
这份文档是给完全的新手看的。你不需要有编程经验,也不需要懂人工智能。
我们会用生活里的比喻,把 AI 编程助手(比如 Khy-OS)背后的五个核心概念讲清楚。
Khy-OS 既是一个真实可用的工具,也是作者入行 AI 的第一个项目。所以这套文档刻意写得啰嗦、把话说透——宁可多解释一句,也不让你卡住。
一、先建立一个整体画面#
你可以把一个 AI 编程助手想象成一位会自己动手干活的助理:
- 你给它一个目标("帮我修好这个 bug");
- 它自己思考该怎么做;
- 它会动手用工具(读文件、改代码、跑测试);
- 干完一步看结果,再决定下一步;
- 直到目标达成,才回来告诉你"做完了"。
这一整套能力,拆开来看就是下面五个概念。它们像积木一样层层叠起来:
flowchart TB A["① Agent 智能体<br/>会自己做决定的'助理'本体"] B["② Tool Calling 工具调用<br/>助理伸手去用一个具体工具"] C["③ Tool Loop 工具循环<br/>用工具→看结果→再用工具,反复直到完成"] D["④ MCP 模型上下文协议<br/>给助理'插'新工具的标准插座"] E["⑤ Skill 技能<br/>把一套做事套路打包成'一键手册'"] A --> B --> C C -. "需要新能力时" .-> D C -. "需要固定套路时" .-> E
一句话记忆:
| 概念 | 一句话 | 生活比喻 |
|---|---|---|
| Agent | 会自己拿主意的 AI 助理 | 一个能独立干活的实习生 |
| Tool Calling | 助理调用某个具体工具 | 实习生拿起电话打给客户 |
| Tool Loop | 反复"用工具→看结果→再决定" | 实习生一步步把任务推进到完成 |
| MCP | 给助理接新工具的标准接口 | USB 插座,插上就能用 |
| Skill | 打包好的做事套路 | 一本"新员工操作手册" |
二、建议的阅读顺序#
请按顺序读,每一篇都建立在前一篇的基础上:
读完这五篇,你再回到文档站首页,就能看懂 Khy-OS 其它文档在讲什么了。
三、一个最小的例子,把五个概念串起来#
假设你对 Khy-OS 说:"帮我看看 README 里有没有错别字,有就改掉。"
sequenceDiagram participant 你 participant Agent as Agent(AI 助理) participant 工具 as 工具(读文件/改文件) 你->>Agent: 目标:检查并修正 README 错别字 Note over Agent: ① 它是 Agent:自己决定先读文件 Agent->>工具: ② Tool Calling:读取 README.md 工具-->>Agent: 返回文件内容 Note over Agent: ③ Tool Loop:看到内容,发现一处错别字 Agent->>工具: ② Tool Calling:把"的的"改成"的" 工具-->>Agent: 修改成功 Note over Agent: ③ 再看一眼,确认没有别的错了 Agent-->>你: 完成:改了 1 处错别字
- 它自己决定先读后改——这是 Agent。
- 它每一次"读文件""改文件"——这是 Tool Calling。
- 它"读→发现→改→再检查"这个反复过程——这是 Tool Loop。
- 如果这些"读/改文件"的能力是通过标准接口接进来的——那就是 MCP。
- 如果"检查错别字"这件事被打包成一个固定套路随时可调用——那就是 Skill。
四、这套概念和 Khy-OS 的关系#
Khy-OS 把上面五个概念都做成了真实代码。等你读完概念,可以对照工程实现:
- 工具循环的真实实现:见
docs/03_DESIGN_设计里的网关与执行相关设计。 - 技能(Skill)的真实例子:见
docs/AI协作预设包/skills目录,里面每个子目录就是一个 Skill。 - 运维与上手:见
docs/07_OPS_运维。
给自己的提醒:概念是地图,代码是地形。先看地图(本系列),再走地形(源码),不容易迷路。
五、进阶阅读:读完五个核心概念之后#
上面五篇是地基。读透之后,你八成会冒出更细的问题:模型本身到底是什么?为什么它会"忘事"?它怎么"记住"我给的资料?这些问题,下面这条进阶链逐个讲透。它们同样面向小白,可以按顺序读,也可以挑你最好奇的那篇:
flowchart TB
subgraph 核心5篇["🧱 核心地基(先读这 5 篇)"]
C1["① Agent 智能体"]
C2["② Tool Calling 工具调用"]
C3["③ Tool Loop 工具循环"]
C4["④ MCP 协议"]
C5["⑤ Skill 技能"]
C1 --> C2 --> C3 --> C4 --> C5
end
subgraph 进阶8篇["📚 进阶拓展(想深入再读)"]
C6["⑥ LLM 大语言模型"]
C7["⑦ Prompt 提示词"]
C8["⑧ Context 与 Token"]
C9["⑨ Embedding 向量"]
C10["⑩ 向量数据库"]
C11["⑪ RAG 检索增强"]
C12["⑫ 机器学习"]
C13["⑬ 深度学习"]
C14["⑭ Transformer"]
C15["⑮ PyTorch"]
C16["⑯ Harness 运行骨架"]
C17["⑰ YOLO 目标检测"]
C18["⑱ 系统提示词"]
C19["⑲ ReAct 推理模式"]
C20["⑳ 智能体编排"]
C21["㉑ 思维链 CoT"]
C22["㉒ 反思 Reflection"]
C23["㉓ 计划与执行"]
C24["㉔ 思维树 ToT"]
C25["㉕ 微调"]
C26["㉖ 强化学习 / RLHF"]
C27["㉗ 多模态"]
C28["㉘ 采样与温度"]
C6 --> C7 --> C8 --> C9 --> C10 --> C11
C12 --> C13 --> C14 --> C15 --> C16 --> C17
C18 --> C19 --> C20
C21 --> C22 --> C23 --> C24
C25 --> C26 --> C27 --> C28
C20 -. "再进阶:设计模式与算法" .-> C21
end
C5 -. "想知道'模型本身'是什么" .-> C6
C9 -. "向量怎么存怎么查" .-> C10
C11 -. "背后的学习原理" .-> C12
进阶链清单(点标题直接跳):
| # | 概念 | 一句话:读了能解决什么困惑 |
|---|---|---|
| ⑥ | 什么是 LLM(大语言模型) | 前五篇一直说的"大模型"到底是什么、怎么来的 |
| ⑦ | 什么是 Prompt(提示词) | 你打给它的字,为什么写法不同效果差很多 |
| ⑧ | 什么是 Context 与 Token(上下文与令牌) | 为什么它会"忘事"、为什么有"长度限制" |
| ⑨ | 什么是 Embedding(向量) | 文字怎么变成一串数字、机器怎么"懂意思" |
| ⑩ | 什么是向量数据库 | 那些"意思相近"的资料存哪、怎么秒查 |
| ⑪ | 什么是 RAG(检索增强生成) | 它怎么"边查资料边回答"、少编瞎话 |
| ⑫ | 什么是机器学习 | 这一切"会学习"的底层原理 |
| ⑬ | 什么是深度学习 | 现代大模型为什么这么强的技术根子 |
| ⑭ | 什么是 Transformer(变换器) | 现代大模型的"骨架"、它的绝招"注意力机制"到底神在哪 |
| ⑮ | 什么是 PyTorch(深度学习框架) | 工程师用什么"电动工具箱"把模型真正造出来、训出来 |
| ⑯ | 什么是 Harness(智能体运行骨架) | 模型只会"吐字",那到底是谁替它读文件、跑命令、把圈转起来——Khy-OS 的真身 |
| ⑰ | 什么是 YOLO(实时目标检测) | AI 怎么"一眼"看清一张图里有哪些东西、还框出来——自动驾驶/安防都靠它 |
| ⑱ | 什么是系统提示词(System Prompt) | 为什么它一"出生"就有身份、有规矩、有脾气——那份看不见的"入职手册"在哪 |
| ⑲ | 什么是 ReAct(智能体推理模式) | 它做事时"边想边做"的套路叫什么、为什么把思考写出来就更不容易犯傻 |
| ⑳ | 什么是智能体编排(Orchestration) | 一个 AI 忙不过来时,怎么当"总指挥"拆活、派给一群小 AI、再收结果 |
| ㉑ | 什么是思维链(Chain of Thought) | 为什么让它"把推理一步步写出来",答案反而更准、更少犯错 |
| ㉒ | 什么是反思(Reflection) | 它怎么"回头看自己刚才做得对不对"、发现错了再改一遍 |
| ㉓ | 什么是计划与执行(Plan and Execute) | 面对复杂任务,为什么"先列计划再逐步做"比一步到位更靠谱 |
| ㉔ | 什么是思维树(Tree of Thoughts) | 它怎么"同时想好几条路、比一比再选最优的一条"走下去 |
| ㉕ | 什么是微调(Fine-Tuning) | 怎么在通用大模型上"再训一小轮",把它调成你这行的专家 |
| ㉖ | 什么是强化学习(RLHF) | 它怎么靠"人给的好评差评"越练越懂人话、越来越会说人味的答案 |
| ㉗ | 什么是多模态(Multimodal) | 为什么现在的 AI 不止会读字,还能看图、听声、连起来一起理解 |
| ㉘ | 什么是采样与温度(Sampling) | 同一句话它为什么每次回答都不一样、"temperature"到底调的是什么 |
📌 ⑭ Transformer 与 ⑮ PyTorch 是 AI 圈最常挂在嘴边的两个词;⑯ Harness 则是理解 Khy-OS 自身的钥匙(它本身就是一个 harness);⑰ YOLO 帮你看到"AI 不止会读字,还会看图"的另一半江山。最后 ⑱ 系统提示词、⑲ ReAct、⑳ 智能体编排是理解"智能体怎么被设定、怎么思考、怎么协作"的三块拼图——⑱ 讲它"出生就带的身份和规矩",⑲ 讲它"边想边做"的套路,⑳ 讲它当"总指挥"调度一群小 AI。除了 ⑯⑱⑳ 直指本项目,其余 Khy-OS 不一定直接用到——但作为你入行 AI 的第一站,把它们也吃透,日后和人聊 AI 才不露怯。而 ㉑~㉔(思维链 / 反思 / 计划与执行 / 思维树)是四路最常见的 "AI 设计模式",教 AI"怎么想得更稳、更周全";㉕~㉘(微调 / 强化学习·RLHF / 多模态 / 采样与温度)则补上"模型怎么被训、怎么懂图、怎么随机作答"这几块底子——这八篇合起来,把"智能体的思考模式 + 绕不开的算法概念"补成了一张完整地图。
六、想换种轻松方式学?读一部修仙小说#
如果对着概念文档觉得枯燥,我们还写了一部修仙长篇小说——《算道天书》:修仙学 AI。
主人公孔浩原从山村药童起步,一路修炼成一代 AI 大师。他修的每一层境界,都精确对应上面的一个概念:
- 炼气(接龙诀)= ⑥ LLM 大模型
- 筑基(言灵咒 / 纳言之窗)= ⑦ Prompt / ⑧ 上下文与令牌
- 金丹(驭器术 / 周天循环)= ② 工具调用 / ③ 工具循环
- 元婴 / 化神(观例悟法 / 神识重楼)= ⑫ 机器学习 / ⑬ 深度学习
- 炼虚 / 合体(万象坐标 / 藏经阁 / 开卷问道)= ⑨ 向量 / ⑩ 向量数据库 / ⑪ RAG
- 大乘 / 飞升(万法归一 / 化身万千)= ④ MCP / ⑤ Skill / ① 自主 Agent
- 番外(观照之眼 / 炼器工坊 / 护道法阵 / 法眼观物)= ⑭ Transformer / ⑮ PyTorch / ⑯ Harness / ⑰ YOLO(正传之外的彩蛋,讲大模型的"骨架""铸炉工坊""运行外壳"与"看图神通")
- 番外·续(立身法旨 / 思行合一 / 万化调兵)= ⑱ 系统提示词 / ⑲ ReAct / ⑳ 智能体编排(讲智能体"出生就带的法旨""边想边做的心诀"与"一化万、万归一的调兵之术")
- 番外·再续(步步推演 / 回照自省 / 先谋后动 / 万途并参)= ㉑ 思维链 / ㉒ 反思 / ㉓ 计划与执行 / ㉔ 思维树(四路"AI 设计模式":把推理显式化、回头挑错、先谋后动、分叉择优)
- 番外·终章(点化真身 / 赏罚淬心 / 六识同参 / 火候心诀)= ㉕ 微调 / ㉖ 强化学习 / ㉗ 多模态 / ㉘ 采样与温度(四个绕不开的概念与算法:改内功、按赏罚淬炼、眼耳并用、火候调随机,共十五篇彩蛋)
每章末尾都有一节 📒 凡人笔记,把"仙法"翻译回真实 AI 术语。当爽文看会上头,当教材看会开窍。 👉 进入《算道天书》
👉 准备好了就从第一篇开始:① 什么是 Agent(智能体)