主题
AI 应用 · 必学内容图
一、LLM 基础原理
Token / BPE / 分词与计费
上下文窗口、温度/top_p 等采样参数
能力边界(next-token 本质、数学/检索/规划弱在哪)
模型训练阶段全景(Pretrain→SFT→RLHF/DPO)
MoE / 模型结构趋势(了解级)
二、Prompt 工程
四要素(角色/任务/约束/示例)
Few-shot / CoT / ReAct prompt
结构化输出(JSON mode、schema 约束、校验兜底)
Prompt 工程化(版本化、评测回归、A/B)
Context Engineering(上下文工程:放什么、怎么放、压缩与管理)
三、Function Calling / 工具使用
工具声明→模型决策→执行→回填循环
多轮工具调用与状态管理
并行工具调用、工具错误处理
结构化输出与 FC 的关系
四、RAG 全链路
RAG 定位与微调边界
文档加载与解析(PDF/表格/OCR/切分前清洗)
Chunk 策略(固定/递归/语义、大小与 overlap)
Embedding 模型选型与原理
向量库(HNSW/IVF/PQ、Milvus/PGVector 等对比)
混合检索(BM25+向量 RRF)、Query 改写(HyDE/多查询)
Rerank 重排(cross-encoder)
GraphRAG(知识图谱增强、实体抽取)
Agentic RAG(自主多轮检索)
RAG 评测(召回 recall@k/MRR、忠实度、RAGAS)
五、Agent
Agent 定义(LLM+工具+循环+状态)与 Chatbot 区别
ReAct 循环与终止条件
Plan-then-Execute / Plan-and-Execute
记忆体系(短期/长期/工作记忆、压缩遗忘)
多 Agent 协作(主从/流水线/辩论、黑板模式、死循环防护)
框架(LangChain/LlamaIndex/CrewAI/LangGraph)
MCP 协议(resources/tools/prompts 三原语)
A2A 协议(Agent 间协作标准)
生产化(状态持久化/断点恢复/人工审批/幂等/预算控制)
Agent 评测基准(SWE-bench/GAIA)
六、微调
SFT 与微调数据工程(数据构造/清洗/配比)
LoRA / QLoRA / PEFT 原理与选型
全量微调 vs PEFT
RLHF(奖励模型、PPO)
DPO 及对齐算法家族
模型蒸馏
Embedding 微调/领域适配
RAG vs 微调选型
七、推理优化与部署
量化(GPTQ/AWQ/GGUF、4-bit 精度影响)
KV Cache 原理
Continuous Batching / Streaming
推理框架对比(vLLM/TensorRT-LLM/TGI)与压测(RPS/延迟)
长上下文(Lost-in-the-middle、压缩、KV Cache 压缩、StreamingLLM)
八、多模态
图文理解 vs 生成差异
语音(ASR/TTS)与多模态 Agent(了解级)
九、评测体系
评测集构建(真实/边界/对抗样本)
传统指标(BLEU/METEOR/ROUGE 的局限)
LLM-as-Judge(prompt 设计、偏差)
RAGAS 与 RAG 分层评测
Agent benchmark(SWE-bench/GAIA)
十、可观测性
全链路 Tracing(每步 prompt/token/耗时)
Token 成本监控
Prompt 版本管理与灰度回归
十一、安全
Prompt Injection 攻防(直接/间接注入、纵深防御)
输出敏感内容过滤
幻觉检测与缓解
数据隐私/越权(工具白名单、人工审批)
十二、API 工程化
流式 SSE / TTFT
兼容层/多供应商抽象
重试/降级/熔断/超时
幂等与结构化输出可靠性
十三、成本与延迟优化
十四、落地场景
AI+搜索(Query 改写、语义检索、GSE 生成式搜索、BM25 融合)
AI+推荐(特征工程、排序蒸馏、生成式推荐)
AI 编码助手(Copilot/Cursor 原理、补全 vs 生成)
AI 应用 vs 传统后端的工程差异/落地坑