Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

渐进式演进路线图 (Full Roadmap)

Tiny Agent 坚信“最好的学习方式是亲手构建”。为了避免一上来就面对复杂的完整系统,本项目将 Agent 的核心能力拆解到不同的 Git Tag 中。

注:你可以通过 git checkout 命令切换到任意版本进行独立运行和源码研读。如 git checkout v0.3 将切换到 RAG 版本。

第一阶段:模型基础与全栈通信

[v0.1] Hello LLM(你好,大模型)

  • 定位:项目起步,跑通最基础的闭环。
  • 核心能力:学习如何配置和初始化大语言模型(LLM)SDK,实现单轮文本输入与输出。
  • UI演进:无前端 UI,纯 CLI 终端交互,方便开发者聚焦后端网络请求本身。

[v0.2] Streaming Web(流式 Web 输出)

  • 定位:从 CLI 迈向实时响应的浏览器交互。
  • 核心能力:搭建最小后端服务与前端页面,通过 SSE 协议实现 LLM 流式输出的实时渲染。
  • UI演进:引入极简 Web页面 (输入框 + 发送按钮 + 结果展示区),动态解析并逐字打印流式文本。

[v0.3] Multi-turn Chat(多轮对话)

  • 定位:从“一问一答”走向“连续对话”。
  • 核心能力:理解 Message Protocol 的设计(System / User / Assistant),设计 Chat History 数据结构,实现多轮连续对话。
  • UI演进:增加消息列表,可保留对话历史,支持连续追问。

[v0.4] Structured Output(结构化输出)

  • 定位:从自然语言输出,演进到可被程序可靠消费的结构化输出。
  • 核心能力:引入Prompt Template、Structured Outputs、JSON Schema 等现代 LLM 交互方式,以及Temperature参数。
  • UI演进:对话框支持JSON等特殊格式渲染。

第二阶段:外部知识与规划行动

[v0.5] Basic RAG(基础检索增强生成)

  • 定位:为模型提供可检索的外部知识库,降低无依据生成的概率。
  • 核心能力:对接 Embedding 模型,构建内存简易向量库,实现文档读取、文本切分、向量化与本地检索,打通「切片 → 检索 → Prompt 拼装 → 生成」的最简闭环链路。
  • UI演进:对话框中支持显示文档引用来源。

[v0.6] Tool Calling(工具调用)

  • 定位:赋予 Agent 改变世界、连接外部系统的双手。
  • 核心能力:深入 Function Calling 原理,学习工具声明、参数生成、本地函数执行以及工具结果回填,理解 LLM 如何调用外部能力;加入最小安全机制。
  • UI演进:在对话流中展示 Tool 的调用信息(参数 → 调用状态 → 返回结果)。

[v0.7] Agent Loop(智能体循环)

  • 定位:从被动调用工具到自主思考。
  • 核心能力:手写 ReAct 范式核心循环(Thought → Action → Observation),让 Agent 能够自主感知复杂任务、调用工具,并加入最大步数限制与 Token 防御机制。
  • UI演进:工具调用模式演变为智能体模式;对话流展示 Agent 的执行步骤,展示每一轮的思考决策、工具调用决策以及返回的观察结果。