Anthropic 放出 commerce-agents:购物 Agent 的官方参考答案
Anthropic 在 GitHub 上线 commerce-agents 参考蓝图,主语言 Python,覆盖零售、电商、电信与娱乐四类购物场景。一周收获 599 颗星。

适合:准备用 Claude 搭建购物、零售、电信或娱乐类 Agent 工具的团队和独立开发者。
先说结论
commerce-agents 是 Anthropic 给“购物 Agent”这个大坑画的一张参考地图。它不是某个现成产品,而是一套参考蓝图:给你示范怎么用 Claude 搭一个能下单、能查单、能改地址的购物助手。零售、电商、电信、娱乐四个场景,例子都给到了。Python 为主,一周拿到 599 颗星,热度是真的。
但参考蓝图终究只是地图。它让你少踩坑,不替你解决“业务跑通”和“预算可控”这两件最头疼的事。这两件事还得靠你自己。
真正的问题
购物 Agent 听起来性感,做起来全是琐事。下单前要确认商品,下单后要同步物流,售后还要能改地址、换尺码、退款。用户不耐烦,接口也不稳定。
更现实的问题摆在面前:商家系统大多是十年以上的旧接口,移动端字段、回调逻辑、库存锁这些细节,哪一个对不上都会让 Demo 直接翻车。这也是为什么大家宁愿拿一份“参考实现”改一改,也不愿意从零写。
| 场景 | 重点能力 | 典型坑 |
|---|---|---|
| 零售电商 | 加购、下单、查询订单 | 库存锁与支付幂等 |
| 电信 | 套餐变更、账单解读 | 风控与人工兜底 |
| 娱乐 | 票务预订、座位选择 | 库存锁与高峰限流 |
| 售后改地址 | 多物流商路由 | 状态同步与异常回调 |
这张表不是在凑字数,而是告诉你:commerce-agents 的价值,是帮你先把“能力清单”列全,再去谈“能不能跑通”。
怎么做更省力
蓝图的价值不在抄,而在对照。拿到这份仓库后,更聪明的做法是拿自己的业务去套:哪些工具已经在例子里了,哪些还缺;哪些逻辑可以直接参考,哪些必须自己重写。
实操上可以分三步。第一步通读四个场景的示例,把“工具调用”和“对话编排”两块拆开看,别混在一起学。第二步挑一个最简单的子场景,做最小可用版本,把外部接口、状态机、错误兜底跑通,再考虑扩展。第三步再回到 Anthropic 的参考实现,把工具描述、Prompt 模板这些“说明书”拿来对照自己的版本,看哪里写得不够清楚。
读仓库最容易掉的坑,是把所有时间花在 prompt 调优,而忽略工具调用层的健壮性。事实是,购物 Agent 的天花板,多半卡在系统对接。
哪些坑要避开
第一,别拿“参考实现”直接上生产。例子里的接口、密钥、回调地址全是示意,真实接入必须重写。
第二,别一上来就堆复杂 Agent。Tool Use 链路越长,越难调试。先单工具、单场景验证,再做多工具组合。
第三,别忽视幂等和超时。下单类操作必须带幂等键,必须设置合理超时,必须有用户可见的失败回退。
第四,别把“自然语言对话”当成核心卖点。用户在乎的是订单改没改成、地址换没换好,不在乎你的 Prompt 写得多么漂亮。
现在就能动手
如果你今天就想动手,建议按这个顺序来。
先把仓库克隆到本地,把四个场景的目录都过一遍,记录下每个场景的工具列表和对话模板,这一步大约半小时。
然后挑自己业务里最简单的一个场景,比如“查订单状态”,用 Claude 的 Tool Use 能力搭一个最小可用版本,跑通端到端。
跑通之后,再补两件事:一是把错误处理、超时和幂等补齐;二是写一段简单的回归用例,覆盖至少 3 种异常路径。
这之后再去读 commerce-agents 里更复杂的例子,比如多工具协同和跨系统编排,会比一开始直接硬啃要轻松得多。