Skip to content

AI 应用 · 必学内容图

一、LLM 基础原理

Transformer / Attention 机制直觉(Decoder-only vs BERT、因果注意力)
Token / BPE / 分词与计费
上下文窗口、温度/top_p 等采样参数
能力边界(next-token 本质、数学/检索/规划弱在哪)
模型训练阶段全景(Pretrain→SFT→RLHF/DPO)
MoE / 模型结构趋势(了解级)

二、Prompt 工程

四要素(角色/任务/约束/示例)
Few-shot / CoT / ReAct prompt
结构化输出(JSON mode、schema 约束、校验兜底)
Prompt 工程化(版本化、评测回归、A/B)
Context Engineering(上下文工程:放什么、怎么放、压缩与管理)

三、Function Calling / 工具使用

工具声明→模型决策→执行→回填循环
多轮工具调用与状态管理
并行工具调用、工具错误处理

四、RAG 全链路

文档加载与解析(PDF/表格/OCR/切分前清洗)
Chunk 策略(固定/递归/语义、大小与 overlap)
向量库(HNSW/IVF/PQ、Milvus/PGVector 等对比)
混合检索(BM25+向量 RRF)、Query 改写(HyDE/多查询)
Rerank 重排(cross-encoder)
GraphRAG(知识图谱增强、实体抽取)
Agentic RAG(自主多轮检索)
RAG 评测(召回 recall@k/MRR、忠实度、RAGAS)

五、Agent

Agent 定义(LLM+工具+循环+状态)与 Chatbot 区别
ReAct 循环与终止条件
Plan-then-Execute / Plan-and-Execute
记忆体系(短期/长期/工作记忆、压缩遗忘)
多 Agent 协作(主从/流水线/辩论、黑板模式、死循环防护)
框架(LangChain/LlamaIndex/CrewAI/LangGraph)
MCP 协议(resources/tools/prompts 三原语)
生产化(状态持久化/断点恢复/人工审批/幂等/预算控制)

六、微调

SFT 与微调数据工程(数据构造/清洗/配比)
LoRA / QLoRA / PEFT 原理与选型
全量微调 vs PEFT
RLHF(奖励模型、PPO)
DPO 及对齐算法家族
模型蒸馏

七、推理优化与部署

量化(GPTQ/AWQ/GGUF、4-bit 精度影响)
Continuous Batching / Streaming
推理框架对比(vLLM/TensorRT-LLM/TGI)与压测(RPS/延迟)
显存估算与 GPU 选型
投机采样(Speculative Decoding)
长上下文(Lost-in-the-middle、压缩、KV Cache 压缩、StreamingLLM)

八、多模态

视觉编码原理(LLaVA/Qwen-VL/GPT-4V)
图文理解 vs 生成差异
语音(ASR/TTS)与多模态 Agent(了解级)

九、评测体系

评测集构建(真实/边界/对抗样本)
传统指标(BLEU/METEOR/ROUGE 的局限)
LLM-as-Judge(prompt 设计、偏差)

十、可观测性

全链路 Tracing(每步 prompt/token/耗时)
Token 成本监控
Prompt 版本管理与灰度回归

十一、安全

Prompt Injection 攻防(直接/间接注入、纵深防御)
输出敏感内容过滤
幻觉检测与缓解
数据隐私/越权(工具白名单、人工审批)

十二、API 工程化

十三、成本与延迟优化

成本结构与 token 计费(输入/输出/缓存差价)
模型分级路由
缓存(精确/前缀/语义)
延迟拆解(TTFT/tok/s)与优化(并行工具、流式、投机采样)

十四、落地场景

AI+搜索(Query 改写、语义检索、GSE 生成式搜索、BM25 融合)
AI+推荐(特征工程、排序蒸馏、生成式推荐)
AI 编码助手(Copilot/Cursor 原理、补全 vs 生成)
AI 应用 vs 传统后端的工程差异/落地坑

手撕 → 框架 → 生产化,一步步把 AI Agent 工程化搞透。
粤ICP备2026104257号-1