LLM

7 篇文章

AI
Prompt Caching, End to End · 1

提示缓存(一):到底缓存了什么

prompt caching 省下的不是网络往返,而是 prefill 阶段的算力。本文讲清 KV cache 从哪来、前缀哈希为什么要求逐 token 一致、TTL 为什么必须存在,以及缓存写入为什么会比不缓存更贵。

AI
Prompt Caching, End to End · 2

提示缓存(二):五家厂商三家云的账单差异

AWS 文档说 Claude Sonnet 4.5 在 Bedrock 上要 4096 token 才能缓存,我实测是 1024——和一方 API 一样。本文对照五家模型厂商与三家云的当期倍率、TTL 档位、跨区域行为,并区分哪些数字是实测的、哪些只是文档值。

AI
Prompt Caching, End to End · 3

提示缓存(三):开了却没命中,怎么查

提示缓存失效几乎不报错——推理成功、日志干净、只有账单变贵。本文按出现频率拆四类元凶:前缀混进易变内容、序列化顺序抖动、工具顺序不稳、中间层静默吞掉缓存标记,并给出一个跨厂商的命中率自检脚本。

怎么向你老婆解释什么是 Agent?
AI

怎么向你老婆解释什么是 Agent?

从'飞书机器人算不对数'到'养一只自己的 AI 龙虾'——一篇给普通人看的智能体科普。13 个灵魂拷问讲透 LLM、Token、Tools、MCP、RAG、Skills、Memory、Multi-Agent 和 2026 年的模型价格:AI 不是蠢,是还没养好。

18 分钟
AI 编程 Agent 究竟是如何工作的:一次源码深度剖析
DEEP

AI 编程 Agent 究竟是如何工作的:一次源码深度剖析

我们追踪了 Amazon Q CLI 和 Claude Code 的源代码,深入理解 AI 编程 Agent 底层的真实运作方式。

25 分钟
AI

如何用 LangChain 和 Elasticsearch 构建 RAG 系统

从零开始构建检索增强生成(RAG)的实战指南——从向量嵌入到上下文增强的 LLM 答案。

18 分钟
如何用 Python 构建 AI 视频课程生成器
TOOLS

如何用 Python 构建 AI 视频课程生成器

借助 LLM、文字转语音和 FFmpeg,将 PowerPoint 幻灯片全自动转换为带旁白的视频课程。

15 分钟