教程中心
AI Agent 从入门到实战:概念理解、MCP 使用、平台实操、工作流自动化
246
教程总数
44
入门教程
20
实操教程
按主题浏览
Modal AI 基础设施:完整设置指南
面向 AI 工作负载的无服务器 GPU 基础设施
Modal AI 工作负载指南(2026):Python 装饰器即基础设施,实现无服务器 GPU——四大适用场景(突发任务、尖峰端点、并行扇出、定时管道),冷启动缓解(keep_warm/Volume 权重缓存),GPU 选择,以及转向自托管 vLLM 的临界点。
OpenAI Assistants API v2 2026:文件、代码解释器与线程
构建具有内置RAG、代码执行和函数调用的持久化AI助手
OpenAI Assistants API 现状与迁移(2026):官方已弃用、转向 Responses API。给出概念映射表(Thread→response 链 / Run 轮询→直接返回 / vector store 原样保留)、迁移五步法、双跑验证策略,以及"托管状态 API 要抽象隔离"的教训。
Zod vs Pydantic 用于 AI 验证:并排对比
AI 输出的模式验证对比——比较 Zod 和 Pydantic 的类型安全性
Zod vs Pydantic 用于 AI 输出验证(2026):TypeScript 栈使用 Zod(Vercel AI SDK),Python 栈使用 Pydantic(OpenAI SDK/Instructor)。LLM 输出是不可信输入——包含两个栈的实际代码、自修复重试、反幻觉语义验证以及跨栈 JSON Schema 同步。
AI 学习路线图 2025
2025 年成为 AI 工程师的结构化学习路径
AI 工程学习路线图·课程表视角(2026):构建优先/裸 API 先于框架/评估前置三原则,Phase 0-4 各带可验证检查点(前置→API 基本功→RAG+评估→生产工程→Agent)+ 按去向选修,学习方法论(课程时间封顶 30%)。
WhyLabs AI Observatory: 完整设置指南
使用 WhyLabs 实现实时数据和 AI 监控
WhyLabs 与画像式 ML 可观测(2026):监控数据的统计画像而非原始数据——whylogs 开源、KB 级摘要、原始数据不出边界天然合规。无标签先知预测漂移、LLM 时代扩展(文本指标+嵌入空间漂移)、与 trace 级观测互补。
AI精准农业:无人机成像与机器学习模型如何变革作物管理
农民分享:AI驱动的作物监测使农药使用量减少40%,同时提高产量
AI精准农业指南(2026年):无人机NDVI多光谱成像可提前1-2周检测作物胁迫,定点喷洒(投资回报率最高),变量施肥处方图闭环。包含ML任务对比表、真实经济性(先省钱后增产)、采用障碍及最小可行路径。
Vellum AI 平台:完整设置指南
使用 Vellum 编排 LLM 工作流
Vellum 平台指南(2026):面向混合团队的 LLM 应用开发平台四件套——提示词工作台(非工程师可迭代)/可视化工作流/评测套件/版本化部署端点。诚实的买建对照:小全工程团队 git+registry 即可,复杂 Agent 仍归代码框架。
Midjourney V7提示词完整指南2026:从入门到商业级图像生成
掌握V7新特性:角色一致性、风格参考、原生文字生成
Midjourney V7 提示词指南(2026):主体→场景→光线→风格→参数五段结构(光线权重最被低估)、参数速查表、电商/头图/肖像/概念场景配方库、商业交付的一致性控制(cref/sref/seed 记录)。
Ollama vs LM Studio vs Jan:本地大模型对比(2026版)
本地运行AI模型,保障隐私、节省成本、离线可用
Ollama vs LM Studio vs Jan 本地大模型工具对比(2026):通过API接入的开发者选Ollama;追求最精致GUI的选LM Studio(Mac上支持MLX加速);需要开源GUI的选Jan。三者底层均使用llama.cpp,选择取决于工作流程。包含硬件估算规则和决策表。
pgvector 教程 2026:PostgreSQL 中的向量相似性搜索
无需额外基础设施,为 PostgreSQL 数据库添加语义搜索以支持 RAG
pgvector 教程(2026 年):在现有 PostgreSQL 上执行向量搜索——HNSW 与 IVFFlat 选择、操作符对齐、完整 Python 流水线、SQL 过滤与混合搜索(专用向量数据库的付费功能在此仅是一个查询)、内存估算及迁移阈值。
Claude Artifacts vs GPT Code Interpreter:全面对比
AI 编程环境对比——深入比较 Anthropic 与 OpenAI 的开发者工具
Claude Artifacts 与 ChatGPT Code Interpreter(2026):前者是浏览器端交互式渲染画布(UI 原型/可视化/可发布分享),后者是服务端 Python 沙箱(文件分析/数据处理)。如果任务是“构建交互式内容”,选前者;如果是“处理这个文件”,选后者。包含组合使用方案。
AI 驱动的 HR 助手:企业级实现
基于 RAG 的 HR 问答与政策指导
企业 HR 助手实现(2026):政策问答走带辖区元数据过滤的 RAG+强制引用条款与生效日期;个人数据走身份从鉴权派生的 scoped 工具(代码级授权)。硬性转人工类目、隐私架构(DPIA/驻留/works council)、影子上线四步法。
用 Server-Sent Events 实现 AI 流式响应:2026 开发者完全指南
通过实际示例和生产模式掌握基于 Server-Sent Events 的 AI 流式响应
用 SSE 实现 AI 流式响应(2026):为什么用 SSE 而非 WebSocket、FastAPI 服务端 + 浏览器 EventSource 客户端真实代码、关闭代理缓冲/逐 token flush/断连取消等生产要点,以及 Next.js 用 Vercel AI SDK 的更简路径。
语音活动检测:实现指南
检测并分割音频流中的语音
语音活动检测(VAD)实现指南(2026):在转写/语音 Agent 前判断哪段是语音,省钱降延迟、判断说话结束。Silero vs webrtcvad、真实代码、VAD→分段→ASR 管线与实时 end-of-turn 调参。
语义搜索实现:2026 年完整开发者指南
通过实际示例和生产模式掌握语义搜索实现
语义搜索实现完全指南(2026):分块→嵌入→向量库存储→近邻检索→重排的完整管线,含真实代码、向量库选型(Chroma/Qdrant/pgvector/Pinecone)、分块/混合检索/重排/元数据过滤等质量杠杆。RAG 的检索底座。
LangSmith LLM 评估:构建系统化反馈循环
追踪收集、评估数据集、A/B 测试与回归检测
LangSmith LLM 评估工作流(2026):追踪→数据集→评估器(含 LLM-as-judge)→实验四件套,把"感觉变好了"变成可测进步。含 @traceable 代码、每周评估闭环、LLM 裁判的偏差校准,及 vs Langfuse。
语音克隆集成:实现指南
集成语音合成 API 实现自定义语音
语音克隆集成实现指南(2026):多数应用应集成托管 TTS(ElevenLabs/OpenAI TTS/Cartesia)而非自训。含同意合规要点、合成代码、提供商选型、流式低延迟与缓存等生产做法。
OpenAI 函数调用完全指南:2026 年开发者完整教程
通过实际示例和生产模式掌握 OpenAI 函数调用
OpenAI 函数/工具调用完全指南(2026):使用 JSON Schema 定义工具 → 模型返回结构化调用 → 你执行并反馈结果。包含完整循环的真实代码、生产模式(验证/tool_choice/并行调用/strict)、与结构化输出的区别,以及如何驱动智能体。
LlamaIndex vs LangChain:到底该用哪个搭 RAG(2026 实战对比)
两个都用过半年后,我把选型逻辑讲清楚:什么项目用 LlamaIndex,什么项目用 LangChain
都说 LlamaIndex 专注检索、LangChain 偏向编排,但落到具体项目还是会纠结。这篇按"你要做什么"来分,配真实代码和踩过的坑,帮你 10 分钟内做出选型决定。
2026年AI创业指南:用AI工具将MVP开发速度提升10倍
早期创业者如何利用AI将数年工作压缩至数周
面向创业者的实用指南,介绍如何利用AI加速MVP开发。涵盖无代码AI工具、自动化编码、用户研究自动化、营销文案生成以及投资人路演准备。
OpenAI API vs Anthropic API vs Gemini API:2026年开发者对比
面向开发者的LLM API对比:定价、速率限制、SDK及生产模式
2026年OpenAI API、Anthropic API与Google Gemini API的完整开发者对比。涵盖身份认证、流式传输、函数调用、结构化输出、速率限制及成本比较。
OpenAI Whisper API:在应用中集成语音识别的完整指南
使用 OpenAI Whisper API 为任何应用添加准确的语音转文字功能
集成 OpenAI Whisper 进行语音识别的完整指南:API 设置、语言检测、翻译、实时流式传输、成本优化以及处理音频质量问题。
ElevenLabs vs Suno vs Udio:AI音频工具完全指南 2026
专业配音、AI音乐生成与音频制作工具对比
全面对比 ElevenLabs(语音AI)、Suno v4(音乐生成)和 Udio(风格控制)在专业音频制作中的表现,包含API示例和生产工作流模板。
AI邮件自动化2026:GPT-4 + Gmail API实现智能收件箱管理
利用AI自动分类、摘要和起草邮件回复
使用GPT-4和Gmail API构建AI邮件自动化系统。涵盖邮件分类、优先级评分、自动草稿生成和路由,每周节省数小时的收件箱管理时间。
AI 文本转语音 2026:OpenAI TTS、ElevenLabs 与语音克隆
使用自然语音 TTS 和自定义语音克隆构建语音 AI 应用
完整的 TTS API 对比与教程。OpenAI TTS 用于生产环境,ElevenLabs 用于语音克隆,流式 TTS 用于聊天机器人,以及构建完整的语音 AI 助手。
AI 图像生成 API 2026:DALL-E 3、Flux 与 Stable Diffusion 对比
对比 DALL-E 3、Flux 和 Stable Diffusion API,用于生产环境图像生成
2026 年 AI 图像生成 API 完整指南。涵盖 DALL-E 3 的文字准确性、Flux 的照片级真实感、Stable Diffusion 的自定义能力、批量生成以及如何选择合适的 API。
Claude Opus 4 API 教程 2026:高级推理与长上下文
使用 Claude Opus 4 构建处理复杂推理任务的高级 AI 应用
完整的 Claude Opus 4 API 教程。涵盖系统提示、文档分析、工具使用、视觉识别、流式传输以及在 Opus/Sonnet/Haiku 之间路由的成本优化策略。
Gemini 2.0 API 教程 2026:拥有 200 万 Token 上下文的 multimodal AI
使用 Gemini 2.0 Flash 和 Pro 构建 multimodal AI 应用:视觉、音频、文档
完整的 Gemini 2.0 API 教程,涵盖 multimodal 输入、200 万 token 上下文、函数调用、Google 搜索接地以及代码执行。
AI代码审查自动化2026:GitHub Actions + GPT-4 实现拉取请求审查
通过AI驱动的代码审查,自动发现拉取请求中的错误和安全问题
使用GitHub Actions和GPT-4o构建AI代码审查机器人。分析每个PR的安全漏洞、逻辑错误和代码质量。在发现严重安全问题时阻止合并。
Supabase AI Stack 2026:pgvector + Edge Functions + 实时流式传输
使用用户级RAG、Edge Functions和流式传输构建全栈AI应用
完整的Supabase AI教程。pgvector用于语义搜索,Edge Functions用于AI推理,实时流式传输,行级安全策略实现用户级RAG,以及一个Next.js聊天组件。
Mistral AI API 指南 2026:Mixtral、Mistral Large 与边缘部署
2026 年 Mistral AI 模型完整开发者指南,涵盖 Mistral Large、Mixtral 8x22B 以及本地部署 Mistral 模型以构建隐私优先应用
2026 年 Mistral AI API 与模型的全面指南。涵盖 Mistral Large 与 Mixtral 模型选择、Python 和 TypeScript 的 API 使用、基于 Ollama 的本地部署、函数调用,以及构建符合欧洲数据驻留要求的生产级应用。
TypeScript AI SDK 指南 2026:用于 Next.js 应用的 Vercel AI SDK
使用 TypeScript 和 Vercel AI SDK 在 Next.js 中构建流式 AI 聊天界面、结构化输出和智能体工作流
2026 年使用 Vercel AI SDK 构建 AI 驱动的 Next.js 应用的完整指南。涵盖流式聊天界面、基于 Zod 的结构化数据提取、工具调用、多步骤智能体以及面向 TypeScript 开发者的生产模式。
Whisper API 教程 2026:转录、翻译与会议智能
使用 OpenAI Whisper 和 GPT-4o 构建自动会议转录、说话人分离和智能会议摘要
2026 年使用 OpenAI Whisper API 进行音频转录的完整指南。涵盖实时转录、说话人识别、会议摘要、自动行动项提取以及构建完整的会议智能系统。
CrewAI 教程 2026:构建协同工作的多智能体系统
使用 CrewAI 创建协调的 AI 智能体团队,处理研究、分析、内容创作等单个智能体无法独立完成的复杂任务
2026 年使用 CrewAI 构建多智能体 AI 系统的完整教程。涵盖智能体角色设计、任务委派、团队编排、工具集成以及构建多个专业 AI 智能体协作完成复杂任务的生产工作流。
ElevenLabs 语音 AI 2026:克隆声音、构建播客、自动化音频内容
使用 ElevenLabs API 进行语音克隆、文本转语音和构建自动化音频内容管道的完整指南
关于 ElevenLabs 语音 AI 平台的详细教程,涵盖语音克隆、多语言 TTS、有声书制作、播客自动化以及使用 API 构建生产级语音应用。包含定价分析和伦理使用指南。
使用OpenAI Assistants API构建AI客户支持代理(2026版)
完整指南:利用OpenAI Assistants API的文件搜索、代码解释器和自定义工具,构建生产级AI客户支持系统
逐步教程,教你使用OpenAI Assistants API构建AI客户支持代理。涵盖创建助手、上传知识库文件、实现函数调用、管理线程以及部署到生产环境。
2026年向量数据库对比:Pinecone vs Weaviate vs Qdrant vs Chroma
为你的AI应用选择哪个向量数据库?四大选项的性能基准、定价和用例分析
全面对比2026年AI应用中使用的Pinecone、Weaviate、Qdrant和Chroma向量数据库,包括性能基准、成本分析、功能对比以及针对不同用例类别的推荐。
LangChain vs LlamaIndex 2026:构建RAG应用该选哪个框架?
LangChain与LlamaIndex构建检索增强生成应用的诚实技术对比,含基准测试、用例及迁移指南
详细对比2026年用于构建检索增强生成应用的LangChain与LlamaIndex,涵盖架构差异、性能基准、集成生态及各自擅长的具体用例。
OpenAI GPT-4o API 教程 2026:视觉、音频与实时能力
掌握 GPT-4o 的多模态特性,包括图像分析、音频转录以及用于交互式应用的全新实时流式 API
OpenAI GPT-4o API 完整指南,涵盖多模态输入、实时音频流、函数调用以及构建生产级应用。包含视觉分析、语音转文本集成和成本优化策略的代码示例。
通义千问 API 开发者指南 2026:性价比最高的国产 LLM 集成方案
从 API 接入到生产部署,Qwen 全流程开发教程
阿里云通义千问(Qwen)系列在性价比和多语言能力上领先国产模型,Qwen2.5 已被全球开发者广泛使用。本文从 API Key 获取到生产级应用构建,详细讲解 Qwen API 的开发最佳实践。
Midjourney v7 品牌设计:大规模创建一致的视觉识别
专业品牌设计师分享如何使用 Midjourney v7 实现角色一致性和风格参考
一份实用的工作流程指南,面向使用 Midjourney v7 生成标志、品牌情绪板、产品样机和营销素材的品牌设计师,利用 style-ref 和 character-ref 参数保持一致性。
AI驱动的NFT市场分析:估值模型与交易智能
利用机器学习预测NFT价格、识别低估资产并分析市场趋势
学习如何构建AI模型进行NFT价格预测、稀有度评分、清洗交易检测和收藏品分析,从而在NFT市场中做出数据驱动的决策。
AI时间序列预测在商业中的应用:需求、收入与库存预测
面向精准商业预测的实用机器学习方法
掌握基于AI的时间序列预测在商业中的应用——从需求预测、收入预测到库存优化和异常检测,使用现代深度学习与统计混合模型。
用AI自动化数据科学工作流:从探索性分析到模型部署
AutoML与AI助手如何让数据科学大众化
一份全面指南,教你如何使用AI工具自动化端到端的数据科学工作流——从自动探索性数据分析、特征工程,到模型选择、超参数调优,再到生产部署。
AI驱动的钓鱼检测:保护组织免受电子邮件威胁
机器学习方法识别和阻断复杂钓鱼攻击
探索AI和NLP如何改变电子邮件安全,从检测鱼叉式钓鱼到识别绕过传统过滤器的商业电子邮件欺诈(BEC)攻击。
AI动画与动态图形:人工智能如何改变视觉叙事
从AI生成关键帧到实时渲染,动画制作的未来
探索AI工具如何变革2D和3D动画制作——涵盖关键帧生成、动作捕捉AI、角色绑定自动化、渲染AI以及独立工作室工作流程。
AI生成式设计在产品开发中的应用:从CAD自动化到拓扑优化
AI如何加速产品设计周期并实现不可能几何形状
探索AI生成式设计工具如何变革产品开发——自动生成最优组件几何形状,减少材料使用,将设计周期从数月压缩至数天。
零售AI库存管理与需求预测:将缺货率降低30%
机器学习如何变革库存优化与供应链规划
部署AI驱动的需求预测与库存优化,通过实用实施步骤减少缺货、削减过剩库存并提升供应链效率。