案例背景
某电商公司运营团队需在 618 大促后提交用户行为分析报告,传统流程:
| 环节 | 传统方式 | 耗时 | 痛点 |
|---|---|---|---|
| 需求对齐 | 运营写需求文档 | 4 小时 | 指标定义不清 |
| SQL 取数 | 数据工程师写 SQL | 16 小时 | 排队等工程师 |
| 数据清洗 | Python 脚本处理 | 12 小时 | 异常值处理 |
| 可视化 | Excel / Tableau 作图 | 8 小时 | 图表选型纠结 |
| 洞察提炼 | 分析师人工解读 | 16 小时 | 主观偏差 |
| 报告撰写 | PPT / Word 排版 | 12 小时 | 格式反复改 |
| 总计 | - | 68 小时(2 周) | 链路长、协作慢 |
目标:用 AI 把全流程压缩到 3 天,每天 6-8 小时,产出质量不低于人工。
工具组合
| 工具 | 角色 | 选型理由 |
|---|---|---|
| Claude Code | SQL 生成 + 脚本编写 | 长上下文能吞下完整表结构 |
| GPT-4 | 洞察提炼 + 报告撰写 | 分析逻辑与文案稳定性高 |
| Cursor | 数据清洗脚本 | IDE 内运行与调试 Python |
| Prompt Chaining | 流水线编排 | 串联取数-清洗-分析-报告 |
| GitHub MCP | 脚本版本管理 | 自动提交分析脚本到仓库 |
3 天整体规划
| 天数 | 阶段 | 产出 |
|---|---|---|
| Day 1 | 取数 + 清洗 | 10+ SQL + 清洗后的数据集 |
| Day 2 | 分析 + 可视化 | 20+ 图表 + 洞察清单 |
| Day 3 | 报告 + 答辩 | 完整分析报告 + 行动建议 |
实施步骤
Day 1:取数与清洗
Prompt 1:让 Claude Code 理解表结构并生成 SQL
你是资深数据工程师。请基于以下数据库表结构,为 618 大促用户行为分析生成取数 SQL。
## 表结构
{schema_ddl}
## 分析需求
1. 618 期间(6/1-6/18)日活、新增用户、留存率
2. 各流量来源的转化漏斗(曝光→点击→加购→下单→支付)
3. 用户分群:新客 vs 老客,高价值 vs 低价值
4. 商品维度:Top 20 热销商品、滞销商品
5. 支付方式分布与失败率
## 输出要求
1. 每个 SQL 标注用途与预期行数
2. 复杂查询加注释解释逻辑
3. 优先用窗口函数避免自连接
4. 涉及金额的字段注意精度(用 DECIMAL)
5. 输出为 .sql 文件,便于 Cursor 执行
Prompt 2:让 Cursor 生成数据清洗脚本
基于以下 SQL 查询结果(CSV),生成 Python 清洗脚本:
## 数据问题
1. 时间字段有脏数据(如 0000-00-00)
2. 金额字段有空值和负值
3. 用户 ID 有重复(同一用户多设备)
4. 部分商品分类为空
## 清洗规则
1. 时间脏值 → 删除该行
2. 金额空值 → 填 0,负值 → 取绝对值
3. 用户 ID 去重:保留最近登录的记录
4. 商品分类空值 → 填"未分类"
## 输出
- 用 pandas,每步打印处理前后行数
- 输出清洗后的 parquet 文件
- 生成清洗报告(删除了多少行、为什么)
产出:10+ SQL 脚本 + Python 清洗脚本 + 清洗后数据集。
Day 2:分析与可视化
Prompt 3:让 GPT-4 做多维分析框架
你是资深数据分析师。请基于以下数据概览,设计分析框架:
## 数据概览
- 总用户:120 万,新增 35 万
- 总订单:8.2 万,GMV 2300 万
- 平均客单价:280 元
- 转化率:曝光→点击 12%,点击→加购 8%,加购→下单 45%,下单→支付 78%
## 请设计
1. 5 个核心分析维度(每个含 3-4 个子指标)
2. 每个维度建议的图表类型
3. 预判 3 个可能有价值的洞察方向
4. 需要交叉分析的维度组合
输出为 Markdown 表格,便于导入报告。
Prompt 4:让 GPT-4 提炼洞察(Prompt Chaining 核心)
你是数据洞察专家。请从以下数据中提炼洞察:
## 数据
{data_summary}
## 洞察要求
每条洞察按以下结构输出:
1. 【现象】一句话描述数据表现
2. 【对比】与基准/上期/行业对比
3. 【原因】推测 2-3 个可能原因
4. 【影响】对业务的影响评估
5. 【建议】可执行的优化动作
## 输出
- 至少 10 条洞察,按价值排序
- 标注每条置信度(高/中/低)
- 区分"确认性洞察"(符合预期)和"意外性洞察"(反直觉)
Prompt 5:让 Cursor 生成可视化图表
基于以下分析结果,生成 Python 可视化脚本(matplotlib + seaborn):
## 图表清单
1. 日活趋势折线图(含大促前/中/后对比)
2. 转化漏斗图(5 步)
3. 用户分群雷达图(新客 vs 老客,5 维度)
4. Top 20 商品横向柱状图
5. 支付方式饼图 + 失败率标注
## 要求
1. 中文字体用 SimHei
2. 配色用品牌色 #FF6B35 为主
3. 每张图保存为 300dpi PNG
4. 图表标题简洁,副标题标注数据周期
5. 关键数据点加标注
输出为一个完整的 .py 脚本,可一键运行。
产出:20+ 图表 + 10+ 条结构化洞察。
Day 3:报告撰写与行动建议
Prompt 6:让 GPT-4 撰写分析报告
你是数据报告撰写专家。请基于以下素材撰写 618 大促用户行为分析报告:
## 素材
- 数据概览:{summary}
- 图表清单:{charts}
- 洞察清单:{insights}
## 报告结构
1. 执行摘要(300 字,给高管看)
2. 大促整体表现(GMV/订单/用户,含同比)
3. 用户行为分析(漏斗/分群/留存)
4. 商品分析(热销/滞销/品类)
5. 关键洞察(10 条,按价值排序)
6. 行动建议(5 条,含优先级与预期收益)
7. 附录(数据口径与方法论)
## 写作要求
1. 每段开头一句话结论
2. 数据用阿拉伯数字,金额用万元
3. 图表引用用「如图 X 所示」
4. 避免数据堆砌,重在解读
5. 行动建议要具体到"谁做什么"
Prompt 7:让 GPT-4 生成行动建议
基于以下洞察,生成可执行的行动建议:
## 洞察
{insights}
## 行动建议格式
| 优先级 | 建议 | 负责团队 | 预期收益 | 实施周期 | 风险 |
|--------|------|----------|----------|----------|------|
## 要求
1. 优先级分 P0(立即)/ P1(本月)/ P2(下季度)
2. 预期收益量化(如"转化率提升 2-3%")
3. 实施周期精确到周
4. 标注依赖项与风险
5. 每条建议附 1-2 句执行要点
Prompt 8:让 Claude Code 做数据口径校验
请校验报告中所有数据的口径一致性:
## 检查项
1. GMV 是否含退款订单?
2. 转化率分母是否一致(曝光 vs 点击)?
3. 用户数去重逻辑是否统一(设备 vs 账号)?
4. 同比基数是否正确(去年同期 vs 上月)?
5. 金额单位是否统一(元 vs 万元)?
发现问题列出修正建议。
产出:完整分析报告 + 5 条行动建议 + 数据口径校验报告。
关键 Prompt 合集汇总
| Prompt | 用途 | 工具 |
|---|---|---|
| 1 | 表结构理解 + SQL 生成 | Claude Code |
| 2 | 数据清洗脚本 | Cursor |
| 3 | 分析框架设计 | GPT-4 |
| 4 | 洞察提炼 | GPT-4 |
| 5 | 可视化脚本 | Cursor |
| 6 | 报告撰写 | GPT-4 |
| 7 | 行动建议 | GPT-4 |
| 8 | 口径校验 | Claude Code |
效果数据
| 指标 | 传统流程 | AI 流水线 | 提升 |
|---|---|---|---|
| 总耗时 | 68 小时(2 周) | 22 小时(3 天) | 3.1 倍 |
| SQL 数量 | 8 个 | 14 个 | +75% |
| 图表数量 | 12 张 | 23 张 | +92% |
| 洞察数量 | 6 条 | 11 条 | +83% |
| 意外性洞察 | 1 条 | 3 条 | 3 倍 |
| 报告页数 | 15 页 | 28 页 | +87% |
| 行动建议 | 3 条 | 5 条 | +67% |
| 口径错误 | 2 处 | 0 处 | -100% |
| 工程师介入 | 全程 | 仅 1 小时答疑 | -94% |
| API 成本 | - | 约 $15 | - |
关键发现(意外性洞察)
- 新客转化率反超老客:大促首日新客下单转化 52%,高于老客 41%。原因:新客受首单优惠驱动,老客对大促"脱敏"。
- 凌晨 2-4 点转化率峰值:反直觉发现深夜转化率比白天高 15%。原因:睡前"报复性消费"+ 限时秒杀集中在凌晨。
- 加购未下单用户次日回流率仅 12%:远低于行业 25% 基准。原因:加购后无催付触达,流失严重。
这三条洞察直接驱动了:新客专项激励、凌晨时段秒杀扩容、加购催付自动化三个优化方案。
经验总结
成功要点
- 表结构先喂全:把完整 DDL 给 Claude Code,SQL 一次生成率 90%+,避免来回改。
- Prompt Chaining 分步:取数-清洗-分析-报告拆成独立步骤,每步可单独调试。
- 洞察结构化:用"现象-对比-原因-影响-建议"五段式,避免 AI 输出空泛结论。
- 口径校验必做:AI 生成报告易出现口径不一致(如 GMV 是否含退款),必须用 Prompt 8 专门校验。
- 意外性洞察最有价值:刻意让 GPT-4 标注"反直觉发现",这些往往是最有商业价值的。
踩过的坑
- SQL 编造字段:Claude Code 偶尔会编造不存在的字段名,需用 DDL 校验。
- 数据清洗过度:AI 会自动删除"异常值",但有些异常是真实业务(如大单),需人工确认。
- 图表选型不当:AI 生成的图表类型偶尔不合理(如用饼图展示趋势),需人工调整。
- 洞察过于保守:GPT-4 倾向输出"符合预期"的洞察,需 Prompt 强调"优先找反直觉发现"。
- 报告数据堆砌:AI 容易罗列数据而缺乏解读,需强调"每段开头一句话结论"。
- 金额单位混乱:元/万元/亿元混用,需在 Prompt 中明确统一单位。
- 行动建议太虚:AI 建议"优化用户体验"太笼统,需强制"具体到谁做什么、预期收益多少"。
不可 AI 化的环节
- 业务背景理解:AI 不懂公司具体业务逻辑,需人工补充背景
- 数据真实性核查:AI 不会质疑数据来源,异常数据需人工核实
- 行动建议可行性:AI 建议可能脱离执行能力,需业务团队评估
- 口径定义决策:GMV 是否含退款等口径选择是业务决策,非技术问题
- 报告呈现节奏:答辩时的节奏把控与重点强调,需人工设计
复用建议
这套方案可迁移到:
- 内容平台分析:阅读量/互动/留存,调整指标定义
- SaaS 产品分析:激活/付费/流失,调整漏斗步骤
- 线下零售分析:客流/坪效/连带率,接入 POS 数据
- App 行为分析:页面路径/功能使用/崩溃,接入埋点数据
核心是Prompt Chaining 串联取数-分析-报告,每个环节独立可调试。
工具版本
- Claude Code:v1.0.20+
- GPT-4:gpt-4-turbo 或 gpt-4o
- Cursor:v0.40+
- Python:3.11+(pandas 2.x / matplotlib 3.8+)
- 3 天 API 总成本:约 $15(Claude $10 + GPT-4 $5)