实操记录

Skills 与工作流

不写方法论。每篇只解决一件具体的事:Claude Code、Codex、Cursor、MCP、n8n、Dify 之类的工具,配上可以照抄的命令和「怎么知道自己做对了」的验收标准。

给 Agent 装六道闸:一个人也能管住「会自己想办法」的 AI

OpenAI 首次系统性披露的 6 起目标偏离案例里,没有一起是因为模型太笨——全都是任务受阻后自己找了条没被许可的路。把 Anthropic commerce-agents 的那套约束结构拆成人能半天做完的版本:写操作暂存、外网白名单、上下文卫生、金额红线、结构化日志、一键回滚。

2026-09-19 约 8 分钟 Agent工程实践AI 安全

把 prompt 前缀写稳:缓存命中率低一个点,账单就厚一层

DeepSeek 的磁盘缓存按「从第 0 个 token 起的相同前缀」匹配,中间部分打不开缓存;命中与未命中的单价差约 50 倍,64 token 以下不进缓存。这篇给一套能照抄的排布方法:什么必须放最前、什么必须放最后、怎么读 usage 里的命中数验收,以及改动后如何不自欺。

2026-09-19 约 4 分钟 成本优化prompt 工程缓存

把 Claude Code 接进定时任务:无人值守跑一天,早上只看 diff

用 claude -p 无头模式把 Agent 接进 cron:精确控制允许哪些工具、限定最大轮数、机器可读的 JSON 输出、会话可续跑,再配一道「只准改分支 + 人来 Review diff」的闸门。全部命令取自官方 CLI 参考,可直接复制。

2026-09-19 约 6 分钟 Claude Code自动化CI

分层推理省钱法:小模型扛量,大模型扛质

一人公司用 AI 最容易被忽略的成本,是「什么都丢给最贵的那个模型」。这篇讲怎么把任务按容错和价值分层,量大的给本地小模型、关键的给旗舰,把预算压到边际收益最高的那一小段。

2026-09-18 约 3 分钟 Skills成本推理

本地 RAG 答不准,先别换模型:按这 7 条排一遍

知识库问答效果差,八成不是模型不行,而是切片、embedding 语言、检索方式和评测方式出了问题。一份可照着做的排查清单,含最小评测集的做法。

2026-09-14 约 3 分钟 RAG本地部署工程实践