博客

深度技术文章与分析。

AWS g6e 自建 MiniMax H3:10 个坑、性能实测与成本对比
公众号

AWS g6e 自建 MiniMax H3:10 个坑、性能实测与成本对比

在 g6e.4xlarge 的 L40S 48GB 上部署 MiniMax H3:从 INT8 权重、ComfyUI 显存错误到 ControlNet、性能数据和 API 成本,算清自建何时更划算。

我不再蹲模型发布了:换了半年最强模型,我的幻觉一点没少
AI 与 Agent

我不再蹲模型发布了:换了半年最强模型,我的幻觉一点没少

半年里 Opus 主力型号发了四代、价格没动,我天天拿最新模型干活,热情却没了、幻觉也没少。这篇把六条困惑一条条摊开:榜单、幻觉、真实提效、harness、对 Agent 的过度依赖,以及自己被提速多少的错觉。

AI 与 Agent

提示缓存(一):到底缓存了什么

prompt caching 省下的不是网络往返,而是 prefill 阶段的算力。本文讲清 KV cache 从哪来、前缀哈希为什么要求逐 token 一致、TTL 为什么必须存在,以及缓存写入为什么会比不缓存更贵。

AI 与 Agent

提示缓存(二):五家厂商三家云的账单差异

AWS 文档说 Claude Sonnet 4.5 在 Bedrock 上要 4096 token 才能缓存,我实测是 1024——和一方 API 一样。本文对照五家模型厂商与三家云的当期倍率、TTL 档位、跨区域行为,并区分哪些数字是实测的、哪些只是文档值。

AI 与 Agent

提示缓存(三):开了却没命中,怎么查

提示缓存失效几乎不报错——推理成功、日志干净、只有账单变贵。本文按出现频率拆四类元凶:前缀混进易变内容、序列化顺序抖动、工具顺序不稳、中间层静默吞掉缓存标记,并给出一个跨厂商的命中率自检脚本。

AI 与 Agent

提示缓存(四):文档说 4096,实测 1024

AWS 文档给 Claude Sonnet 4.5 标的最小可缓存前缀是 4096 token。我在 Bedrock 上做了 20 多次夹逼调用,真实门槛是 1024——和 Anthropic 一方 API 一样。同时验证了另外三个模型,其中三个文档准确,只有 Sonnet 4.5 这一条错了 4 倍。

Seedance 2.5 实测:69 元买 725 积分只够 27 秒,CLI 权限还要另外掏 998
AI 与 Agent

Seedance 2.5 实测:69 元买 725 积分只够 27 秒,CLI 权限还要另外掏 998

充 69 元/月会员拿到 725 积分,折算约 2.5 元/秒,额度上限只够生成 27 秒;即梦 CLI 还要 998 元/月的高级会员才放开,agent 自动化流水线断在这一步。本文记录三个卡点、一笔按实付算的成本账,以及成片字幕的四类问题。

DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上
AI 与 Agent

DeepSeek V4 Pro 正式版:拿第三方实测去对流出的跑分表,对不上

DeepSeek V4 Pro 0813 正式版发布,Artificial Analysis 独立评测综合 53 分排第 23。流出的 Agent 评测表宣称 Terminal Bench 87.9 超过 Opus 4.8,但第三方实测只有 79%,差了近 9 分。本文逐项核对两套数据,还原真实位置。

龙虾之后,我为什么又装了一个 KiroCrew?
公众号

龙虾之后,我为什么又装了一个 KiroCrew?

KiroCrew 不只是 Kiro 的一个新入口,而是加在 kiro-cli 上的一层持久化工作空间——会话管理、长期记忆、Skill、计划任务、多 Agent 和微信/企业微信 Channel。我没让它跑 Demo,而是先让它整理我十多年前的博客,提炼出一份能长期使用的个人写作风格。

0比1,梅西的世界杯落幕了:这一次不谈模型,只想好好告个别
公众号

0比1,梅西的世界杯落幕了:这一次不谈模型,只想好好告个别

阿根廷 0:1 西班牙,梅西的第 6 届世界杯落幕。这一次不谈 fable 5 模型,只想好好告个别:埃及之战的眼泪、恩佐 15 岁写给他的信、20 年 6 届世界杯的编年史,以及为什么他首先是一个人,而不是神。

Claude 多轮对话神秘 400:一次 Thinking Signature 损坏的排查实录
技术深潜

Claude 多轮对话神秘 400:一次 Thinking Signature 损坏的排查实录

客户的 Claude extended thinking 多轮对话在部分网关通道稳定报 400 Invalid signature,其他通道却一切正常。本文完整复盘这次排查:signature 机制是什么、proxy 层 JSON 重序列化如何悄悄损坏 base64、五组对照实验逐一验证,以及给所有 LLM 网关开发者的修复清单。

别只给员工买 AI 工具:互联网公司转型 AI Native 的完整方法论
公众号

别只给员工买 AI 工具:互联网公司转型 AI Native 的完整方法论

从 Loop Engineering、Harness Engineering 到 AI-DLC 2.0 与 AI-PLC:互联网公司转型 AI Native 的四层完整方法论,以及岗位、KPI、制度、中层与团队结构的组织重构路线图。

拆解 Kimi K3 的两大架构支柱:KDA 与 AttnRes,讲到小白也能懂
AI 与 Agent

拆解 Kimi K3 的两大架构支柱:KDA 与 AttnRes,讲到小白也能懂

零基础友好、全程打比方:KDA 把'开卷翻书'的注意力改成'一页高级小抄',显存省 75%、百万 token 解码快 6.3 倍;AttnRes 把'流水账'残差流改成'带目录的笔记本',训练效率 +25%、开销不到 2%。看完就知道 2.8T 是怎么撑起来的。

Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样
AI 与 Agent

Kimi K3 正式发布:2.8 万亿参数全开源,这次真的不一样

月之暗面发布 Kimi K3:2.8 万亿参数、全球首个开源 3T 级模型、100 万 token 上下文、原生多模态。本文深度解读 KDA 与 AttnRes 架构创新、Artificial Analysis 全球第四的评测成绩、对齐 Claude Sonnet 5 的定价信号,以及开源前沿模型对整个行业的四层长远影响。

决赛前夜,我让 fable 5 又跑了 100 万次模拟:梅西把差距踢没了一半多
AI 与 Agent

决赛前夜,我让 fable 5 又跑了 100 万次模拟:梅西把差距踢没了一半多

上篇 6 项预测全部命中:西班牙 2-0 法国、阿根廷 2-1 逆转英格兰,41.8% 概率的西阿决赛成真。赛前我把半决赛数据喂回 fable 5 重跑 100 万次模拟:西班牙胜率从 54.1% 降到 51.8%,阿根廷从 45.9% 升到 48.2%——梅西用射手榜第一的表现,把模型扣掉的年龄分抢了回来。附上梅西与亚马尔 19 年前的照片故事。

我是梅西球迷,但我让史上最强大模型 fable 5 预测世界杯冠军,答案扎心了
AI 与 Agent

我是梅西球迷,但我让史上最强大模型 fable 5 预测世界杯冠军,答案扎心了

2026 美加墨世界杯四强出炉,我让 Claude Fable 5 用 Elo 等级分 + 年龄曲线 + 大赛经验 + 点球子模型跑了 100 万次蒙特卡洛模拟。结果出现了'阿根廷悖论':阿根廷进决赛概率四队最高(66.5%),最可能夺冠的却是西班牙(37.5%)。敏感性分析显示,梅西的状态就是冠军归属的分界线。

在 AI 浪潮里慢一点:写给打工人,也写给老板
AI 与 Agent

在 AI 浪潮里慢一点:写给打工人,也写给老板

AI 焦虑至少有一半是被营销出来的。用 PwC、MIT、METR、DX 的一手数据拆解 2026 年的 AI 现实:56% 的 CEO 报告零回报,95% 的企业自建项目失败,AI Coding 实测只提速 10%。给打工人 5 条定力建议,给老板 5 条转型建议。

编码工具

Claude Code、Gemini CLI、Aider 怎么选?2026 年终端 AI 编程智能体选型指南

2026 年年中,三大终端 AI 编程智能体实测横评:Claude Code 的自主 Agent 循环、Gemini CLI 的开源免费额度(以及 Antigravity 迁移风波)、Aider 的 Git 原生结对编程。附对比矩阵、优缺点直评和选型决策框架。

当胡彦斌亲手"敲"出一个 APP:古法编程,真的要失传了吗?
AI 与 Agent

当胡彦斌亲手"敲"出一个 APP:古法编程,真的要失传了吗?

华语歌手胡彦斌零编程基础,用 Vibe Coding 做出上架 App Store 的「彦火」APP。实习生说"古法编程我们不会"。当懂业务的人开始自己动手,手写代码成了老手艺——但冰山之下 90% 的工程,反而让有经验的程序员更稀缺。一个古法程序员的自白。

AI 时代,高考志愿怎么填
公众号

AI 时代,高考志愿怎么填

AI 时代怎么选专业?用 Anthropic 经济指数等一手数据看职业渗透度与生产力红利,给高考志愿一个数据视角。

2026 亚马逊云科技中国峰会 · 展区见闻
公众号

2026 亚马逊云科技中国峰会 · 展区见闻

2026 亚马逊云科技中国峰会展区见闻:Agentic 基础设施、Amazon Quick 智能体、AI 独角兽出海、智能机器人与黑客松现场,一篇图文实录。

云架构

GPU 通信技术全景:从 PCIe、NVLink 到 RDMA、EFA 与 NCCL

训练大模型时,通信会取代计算成为瓶颈。这篇文章把 GPU 互联的整条链路一次讲透:PCIe 的事务模型与 BAR、NVLink/NVSwitch 的全互联与在网规约、AMD Infinity Fabric、RDMA/InfiniBand 的 QP 与内存注册、RoCE 的无损以太网三件套、AWS EFA 的 SRD 多路径喷洒、GPUDirect 如何消除 CPU 拷贝,以及 NCCL 如何调度这一切。

Anthropic 放大招:Claude Fable 5 和 Mythos 5 来了
AI 与 Agent

Anthropic 放大招:Claude Fable 5 和 Mythos 5 来了

2026 年 6 月 9 日 Anthropic 同时发布 Claude Fable 5 与 Mythos 5:同一个底层模型,区别只在护栏。Fable 5 几乎全基准 SOTA、任务越长领先越大(Stripe 5000 万行代码库迁移一天搞定),价格 $10/$50 不到 Mythos Preview 一半,AWS Bedrock 已上线。最后聊聊:藏了几个月的 Mythos 为啥突然放出来了。

我让全球5大顶尖AI写2026高考作文,再请5个模型当评委
公众号

我让全球5大顶尖AI写2026高考作文,再请5个模型当评委

5 大顶尖模型同题写 2026 高考作文,再让 5 个模型当评委匿名互评——评委们一致把最高分投给了 Claude。全过程、全文与评语公开。

很多人问我公众号排版怎么做的
公众号

很多人问我公众号排版怎么做的

用 Agent Skills 把公众号排版流程固化下来:一条命令从 Markdown 生成公众号兼容 HTML,样式统一、图片自动处理。

Agentic AI 时代,软件工程该怎么做?
公众号

Agentic AI 时代,软件工程该怎么做?

AIDLC(AI Development Life Cycle):当 AI 深度参与软件开发,传统 SDLC 需要怎样的重构?从需求、设计到测试部署的全流程实践。

在 AI 浪潮里慢一点:写给打工人,也写给老板
公众号

在 AI 浪潮里慢一点:写给打工人,也写给老板

企业要不要自建 AI Agent?选型、成本、落地路径一篇讲透:什么时候用现成平台,什么时候值得自研,以及常见的坑。

VOD 深度剖析(一):视频基础——视频到底是什么?
流媒体

VOD 深度剖析(一):视频基础——视频到底是什么?

VOD 流媒体系列(共 12 篇)的开篇之作。从字节层面理解视频究竟是什么——像素、分辨率、帧率、码率、I/P/B 帧、GOP、色彩空间与 HDR。

流媒体

VOD 深度剖析 第 10 篇:QoE 指标 —— 如何衡量用户真实的观看感受

QoE 与 QoS 的区别、六大核心指标(VST、RBR、VSF、EBVS、VPF、平均码率)、数据管道、多维度下钻、故障排查案例,以及自建还是采购的抉择。

流媒体

VOD 深度剖析 第 11 部分:端到端工作流——从上传到播放

完整的 10 步 VOD 生产流水线:上传、内容审核、探测、转码、封装、发布、CDN 预热,以及使用 Step Functions 和 Temporal 进行编排、灾难恢复。

流媒体

VOD 深度剖析第 12 部分:在 AWS 上构建 VOD —— 服务、架构与成本

完整的 AWS VOD 参考:MediaConvert、MediaPackage、CloudFront、S3、Step Functions、SPEKE DRM 集成、Terraform IaC、真实成本拆解、常见陷阱,以及一份生产落地路线图。

流媒体

VOD 深度剖析(二):视频编解码器 —— 为什么一部 4K 电影只需 5 GB

视频压缩的工作原理、为什么 H.264 至今仍占主导、何时选择 H.265 或 AV1、逐标题编码、VMAF 质量指标,以及可上手实操的 ffmpeg 示例。

流媒体

VOD 深度解析 第 3 部分:音频基础 —— 让声音变小

深入理解数字音频的工作原理:采样率、位深、声道、AAC 对比 Opus 对比 Dolby Atmos、多语言音轨、响度归一化,以及实用的 ffmpeg 配方。

流媒体

VOD 深度剖析(四):容器格式 —— .mp4 并不是编解码器

容器与编解码器的区别、MP4 内部结构(Box 结构)、faststart 陷阱、分片 MP4、用于统一 HLS 与 DASH 的 CMAF、分片时长权衡,以及字幕格式。

流媒体

VOD 深度剖析(五):流媒体协议——HLS 和 DASH 到底是怎么工作的

为什么渐进式下载会失败、HLS 两级清单和 DASH MPD 如何工作、CMAF 双清单最佳实践、面向低延迟的 LL-HLS,以及何时该考虑 WebRTC。

流媒体

VOD 深度剖析(六):自适应码率——播放器如何自动切换清晰度

深入解析 ABR 的底层原理:基于吞吐量、基于缓冲区(BBA)、BOLA、MPC 以及 Pensieve 算法。并给出码率阶梯与短视频场景的实用工程建议。

流媒体

VOD 深度剖析(七):CDN 分发 —— 为什么它在全球都快

CDN 架构(Edge/Shield/Origin)、缓存策略、请求合并、签名 URL、预热、JIT 与预打包、多 CDN 策略、HTTP/3 以及成本估算。

流媒体

VOD 深度剖析 第 8 部分:DRM 内容保护 —— 为什么 Netflix 无法被录屏

深入讲解 Widevine、FairPlay、PlayReady。涵盖 CENC/CBCS 统一加密、许可证流程、L1/L2/L3 安全级别、HDCP、SPEKE 集成,以及针对短视频的轻量级保护方案。

流媒体

VOD 深度剖析 第 9 篇:视频播放器 —— 从清单到首帧

深入视频播放器内部:Web(MSE/EME)、iOS(AVPlayer)、Android(ExoPlayer/Media3),以及 TTFF 优化、缓冲策略、音画同步,还有自研与采购的取舍。

OpenAI "解绑"微软、牵手 AWS:AI 云战争进入新纪元
云架构

OpenAI "解绑"微软、牵手 AWS:AI 云战争进入新纪元

2026 年 4 月 27 日微软与 OpenAI 修订协议结束独占关系;两个月前 Amazon 向 OpenAI 投资 500 亿美元;Codex 仓库悄悄合并的 Bedrock GPT-5.4 兼容性修复证实模型已在 AWS 生产环境运行。三件事串起来看:模型正在变成基础设施,独占不可持续,AI 产业权力版图正在重绘。

怎么向你老婆解释什么是 Agent?
AI 与 Agent

怎么向你老婆解释什么是 Agent?

从'飞书机器人算不对数'到'养一只自己的 AI 龙虾'——一篇给普通人看的智能体科普。13 个灵魂拷问讲透 LLM、Token、Tools、MCP、RAG、Skills、Memory、Multi-Agent 和 2026 年的模型价格:AI 不是蠢,是还没养好。

技术深潜

基于 OpenCV 与 Amazon Nova 的字幕位置检测

一套 CV + LLM 混合流水线,自动检测字幕位置 —— 经过 6 轮迭代,在多语言视频上达到 83% 准确率。

Amazon 的 2026 AI 战略:为什么最大的玩家却最没有存在感
AI 与 Agent

Amazon 的 2026 AI 战略:为什么最大的玩家却最没有存在感

自研芯片、全球基础设施、巨额投入——可 Amazon 在 AI 竞赛中却几乎隐形。这背后究竟发生了什么。

技术深潜

Claude Code vs OpenClaw:51 万行 vs 53 万行源码对决

Claude Code 源码泄露暴露了 51.2 万行 TypeScript,我们终于能与 OpenClaw 做一次真正对等的逐行比较——架构、Agent 定义、安全模型与设计哲学。

围墙花园里的数据突围
公众号

围墙花园里的数据突围

围墙花园里的数据突围:微信公众号文章抓取方案技术分享——接口分析、反爬对抗与工程化实践。

微信 x OpenClaw:AI Agent 时代的平台战略
AI 与 Agent

微信 x OpenClaw:AI Agent 时代的平台战略

微信原生集成 OpenClaw,标志着一次重大转向。为什么全球最大的即时通讯应用向 AI Agent 开放如此重要。

用 CloudFront + Lambda@Edge 记录失败请求的 5 个坑
云架构

用 CloudFront + Lambda@Edge 记录失败请求的 5 个坑

我们用双 Lambda@Edge 方案为 CloudFront 实现了完整的请求日志记录。以下是我们踩过的 5 个坑。

AI 编程 Agent 究竟是如何工作的:一次源码深度剖析
技术深潜

AI 编程 Agent 究竟是如何工作的:一次源码深度剖析

我们追踪了 Amazon Q CLI 和 Claude Code 的源代码,深入理解 AI 编程 Agent 底层的真实运作方式。

用 Kiro 和 AWS 构建企业级 Agentic AI 平台
编码工具

用 Kiro 和 AWS 构建企业级 Agentic AI 平台

我们用 Kiro IDE 在一周内构建了一个完整的 AI Agent 平台——零手写代码。下面是完整的实现过程。

技术深潜

OpenClaw vs Claude Code:架构与战略全面对比

两款 AI Agent 产品,两种截然不同的理念。深度对比它们的架构、普及路径以及未来走向。

云架构

使用 Amazon Nova 构建实时音视频 AI

结合 Amazon Nova、Transcribe、Polly 与开源 TEN 框架,构建低延迟的多模态 AI 助手。

编码工具

Claude Code vs Cursor vs Amazon Q:一年真实体验的坦诚评测

一年每天用 AI 辅助编码之后——什么真正好用、什么不行,以及各类任务下哪款工具胜出。

云架构

Amazon QuickSuite:自然语言数据分析实战指南

手把手教你用 Amazon QuickSuite 连接数据库、构建仪表板,并用自然语言查询数据。

大数据

AWS 大数据深度解析(第 10 部分):完整架构蓝图与成本拆解

社交应用数据仓库与推荐系统在 AWS 上的完整端到端架构——每一个服务都一一对应,附带真实的月度成本估算与优化策略。

大数据

AWS 大数据深度剖析(第九篇):SageMaker 与机器学习平台——从训练到生产

全面解析 SageMaker AI:Studio 笔记本、Feature Store、训练作业、实时 Endpoint、Model Monitor,以及它们如何融入推荐系统的 MLOps 工作流。

大数据

AWS 大数据深度剖析(第 8 部分):在线特征存储 —— DynamoDB、ElastiCache 与 OpenSearch k-NN

推荐系统如何在推理时提供特征服务:用 DynamoDB 存用户特征、用 ElastiCache 做热点缓存、用 OpenSearch k-NN 做向量召回、用 Neptune 做图检索。

大数据

AWS 大数据深度剖析(第 7 部分):推荐系统基础——漏斗、双塔与 PIT

理解推荐系统漏斗(召回 → 粗排 → 精排 → 重排)、双塔召回架构,以及为什么 Point-in-Time(时点)正确性对训练样本至关重要。

大数据

AWS 大数据深度剖析(第 6 部分):端到端数据管道 —— 从数据源到特征存储

把所有环节串联起来:追踪一个点击事件如何从客户端 SDK 经过 API Gateway、MSK、Firehose、S3、数仓分层(ODS→DWD→DWS→ADS),最终写入 DynamoDB 用于实时服务。

大数据

AWS 大数据深度解析(第五部分):EMR、Glue ETL、Flink 与管道编排

对比 EMR Serverless、Glue ETL、Managed Flink,选出合适的计算引擎;再用 MWAA(Airflow)与 Step Functions 编排数据管道。

大数据

AWS 大数据深度剖析(第四部分):Glue Catalog、Athena 与 Lake Formation

AWS Glue Data Catalog 如何充当数据湖的中央目录,以及 Athena 如何用无服务器 SQL 查询 S3 上的 Parquet 与 Iceberg 表。

大数据

AWS 大数据深度剖析(第三部分):数据接入 —— DMS、Zero-ETL、Firehose 与 MSK

四类数据源,四条接入管道 —— 学习使用 DMS 做 CDC、Aurora Zero-ETL、MSK 上的 Kafka,以及 Firehose 微批处理,将数据落地到你的 S3 数据湖。

大数据

AWS 大数据深度剖析(第二部分):S3、Parquet 与 Apache Iceberg 详解

掌握现代数据湖的存储基石 —— S3 对象存储、Parquet 列式格式,以及 Iceberg 如何为 S3 上的文件加上 ACID 事务能力。

大数据

AWS 大数据深度剖析(第一部分):数据湖、数据仓库与湖仓一体革命

理解大数据的核心概念——数据湖 vs. 数据仓库 vs. 湖仓一体,OLTP vs. OLAP,以及为什么现代分析架构都在向 S3 收敛。

AI 与 Agent

如何构建用于广告创意生成的 AI Agent

使用 Strands Agents 和 Amazon Bedrock 自动化广告文案、图像与视频制作。一份注重实战、代码优先的实践指南。

AI 与 Agent

如何用 LangChain 和 Elasticsearch 构建 RAG 系统

从零开始构建检索增强生成(RAG)的实战指南——从向量嵌入到上下文增强的 LLM 答案。

如何用 Python 构建 AI 视频课程生成器
编码工具

如何用 Python 构建 AI 视频课程生成器

借助 LLM、文字转语音和 FFmpeg,将 PowerPoint 幻灯片全自动转换为带旁白的视频课程。

技术深潜

如何用 Elasticsearch 设计一个全站搜索引擎

多数据源索引、CDC 同步、权限感知搜索、热词与联想输入——一份完整的 Elasticsearch 架构指南。

技术深潜

用 FSCrawler 和 Elasticsearch 构建知识库搜索引擎

使用 FSCrawler 将 PDF、Word 文档和扫描件索引到 Elasticsearch。涵盖 OCR、自定义映射和生产环境部署。

技术深潜

给 1500 万行的 MySQL 表加唯一索引:一次生产事故实录

我们在一张 1500 万行的线上表上添加唯一索引,结果引发了故障。本文复盘了当时到底哪里出了错,以及正确的做法。

云架构

DNS 深度剖析:从第一性原理到 Kubernetes

从 dig 追踪到 Kubernetes 中的 CoreDNS,彻底搞懂 DNS。一份面向实战的容器 DNS 调试指南。

云架构

用 Go 构建分布式任务调度系统

使用 Go、Machinery、Redis 和 cron 设计并交付一套生产级任务调度器。涵盖分布式锁与重试策略。

云架构

如何用 Grafana 和 Elasticsearch 搭建 API 监控

从零搭建生产级 API 监控 —— Elasticsearch 数据源、Lucene 查询、Grafana 面板与告警规则。

订阅更新

想第一时间读到新文章?订阅 RSS,或在下面的二维码里关注公众号。

订阅 RSS