项目概览 背景痛点 页面与交互 技术架构 评测体系 诚实边界
AI 产品作品 · 从 0 到 1 原型

投放复盘诊断台
小红书投流周报智能体

把"人工每周翻数据写周报"变成"一个 Agent 自动跑完数据→诊断→八章节报告→可分享链接"。面向小红书投流场景的销售复盘工具。

角色 产品设计 + 评测体系搭建 技术 Python · 单 Agent 编排 · RAG 周期 2026.08 启动 状态 原型 / 离线验证

项目概览

一句话:把销售每周最耗时的"复盘周报"做成可运行、可评测、可迭代的 AI Agent。

8
章节诊断报告(自动生成)
10
节点编排引擎(单次 ≤10 次 LLM 调用)
56+
RAG 案例库条目(含独立 badcase 库)

我做了什么

  • 产品定义:拆解销售复盘真实工作流,定义"数据总览 / 周度复盘 / 手动录入"三大模块与八章节报告结构。
  • 交互设计:客户卡片网格 → 详情页(KPI+趋势+每日表)→ 一键生成报告;案例库按行业/赛道/品类召回历史打法。
  • 评测体系:设计双层 rubric(机器硬断言 + LLM-as-judge),搭 17 用例 / 126 断言评测集与 badcase 闭环。
  • 边界与接管:定义字段红线、数据不足降级、人工审核闭环(HITL),保证"不瞎编、可追责"。

背景与痛点

为什么这件事值得做成一个 Agent。

销售侧的真实困境

  • 每周手动从后台导出几十个客户的消耗/转化,逐行对比环比、找异常。
  • 写周报靠经验拍脑袋,结论口径不统一,同一客户不同人写出的"病因"不一样。
  • 历史打法散落在聊天记录里,新人无法复用"同赛道踩过的坑"。

Agent 带来的改变

  • 自动拉全量数据 → 跑编排引擎 → 输出结构统一的八章节诊断。
  • 每一条结论标注"事实 / 推断 / 建议",可核对、可追责。
  • 案例库把"历史打法"变成可检索资产,新客户直接匹配相似案例。

页面与交互逻辑

下面是产品真实界面的还原(CSS 还原,非截图)。点击左侧导航可在各页面间切换,模拟真实交互。

投放复盘诊断台 · 广告销售工作台
广告销售工作台
客户详情 · 卡片网格
码上AI学堂
教育 · AI培训 · 留资成本 ¥24.8
需行动
金秋书画院
教育 · 书画 · 留资成本 ¥31.2
观察
AI副业加油站
教育 · AI培训 · 留资成本 ¥28.0
正常
智绘AI课堂
教育 · AI培训 · 留资成本 ¥26.5
需行动
交互逻辑:顶部筛选(行业/赛道/状态/搜索)→ 实时过滤卡片网格;点击任一客户卡片 → 跳转「客户复盘详情」。
客户复盘详情 · 码上AI学堂
码上AI学堂
教育 · AI培训 · 本周消耗 ¥5.2万
▼ 12.3%
环比上周
¥24.8
留资成本
3.1%
开口率
1.9%
留资率
▲ 8%
曝光
日期消耗曝光开口留资
周一8200210k31221
周二7600198k28818
交互逻辑:看 KPI 与趋势 → 点「生成报告」→ LLM 基于当前时间窗真实数据生成八章节报告,弹层预览 + 落盘独立 HTML 分享链接(可复制 / 新标签打开给客户)。
八章节诊断报告(自动生成)
① 核心结论
本周留资成本抬升至 ¥24.8(目标 ¥25),环比 +12%;主因曝光质量下滑而非转化漏斗失效。
② 指标与趋势
消耗 / 曝光 / 开口 / 留资逐日走势,标注达标线与异常日。
③ 分层诊断
按版位 / 计划 / 笔记 / 漏斗四层,每层判 正常 / 轻微 / 显著 / 数据不足。
④ 异常与原因
Top3 异动 + LLM 下钻归因(事实 / 推断分别标注)。
⑤ 案例参考
召回同赛道历史打法:相似点 + 关键差异,badcase 不引用。
⑥ 优化建议
绑定 8 条映射规则的可执行建议。
⑦ 行动计划
P0 当天止损 / P1 本周优化,明确 owner 与验收。
⑧ 数据质量说明
口径、缺失项、置信度,避免误读。
交互逻辑:报告弹层内可「通过→沉淀案例库」或「驳回→记 badcase 库」,形成人工审核闭环。
客户经营 · 同赛道历史打法(案例库)
案例 A · 教育-AI培训-留资成本抬头
相似点:同赛道、同优化目标(降留资成本)、异常形态一致(曝光质量下滑)。
关键差异:该客户笔记点击率尚可,本客户笔记点击率同步下滑 → 本客户需先修素材而非加预算。
历史动作:收紧低质版位 + 重排计划优先级,3 日后留资成本回落 14%。
案例 B · 教育-书画-开口率骤降
相似点:均为开口率异常。
关键差异:该案例因私信自动回复失效,本客户无此配置 → 不照搬。
交互逻辑:进入客户经营页 → 按行业/赛道/品类 + anomaly_signature 召回参考案例 → 展示相似点与关键差异,badcase 自动过滤不可见。
当日监控
142
在投客户
9
需行动
¥71万
当日消耗
3
新投计划
交互逻辑:默认展示全局当日 KPI 与消耗走势;可切换日期 / 近 7/14 天 / 本月,联动下方明细。
手动录入
日期
客户名
行业
赛道
品类
消耗
曝光
点击
开口
留资
08-28
XX_护肤
到综
美妆
护肤
480
12k
360
12
6
交互逻辑:填表式录入 → 系统自动组装 JSON 写入数据库(source='upload',不被每日模拟刷新覆盖);同名客户按日期追加,攒够天数即可生成完整周报。

说明:以上界面为产品真实布局的 CSS 还原(左侧导航、卡片网格、八章节报告结构与项目源码一致),用于呈现"每个页面长什么样、怎么交互",非运行截图。

技术架构

单 Agent 编排引擎(自研轻量节点图,无 LangGraph),单次诊断 LLM 调用 ≤ 10 次。

0
init
校验客户与周期
1
data_check
完整性检查,缺失严重降级
2
full_scan
扫版位/计划/笔记/漏斗
3
layer_diag
分层诊断 正常/显著
4
anomaly_rank
Top3 / 观察项
5
drill_down
[LLM] 下钻归因
6
case_retrieval
[LLM] RAG 案例
7
suggest
[LLM] 8 条规则建议
8
verify
事实校验 未过回退
9
report_gen
八章节 → 人工审核

RAG 案例库 + badcase 库

  • 参考案例按行业/赛道/品类/anomaly_signature SQL 召回,badcase 物理隔离不可引用。
  • 报告「通过」→ 自动沉淀为参考案例;「驳回」→ 缺陷记入 badcase 库,形成持续迭代闭环。

边界与人工接管(HITL)

  • 数据不足 → 降级"数据不足"分支,不打硬结论。
  • 事实校验(node 8)未过 → 回退或降级为"假设",不输出伪确定性。
  • 每条结论标 事实 / 推断 / 建议,可核对、可追责。

评测体系

可运行、可评测、可迭代——这是岗位最看重的,也是我重点搭建的部分。

17
评测用例(E01–E17)
126
硬断言(全部通过)
¥0.79
单次全量评测 LLM 成本

双层 rubric

  • A 层 · 硬断言结构 / 字段 / 红线由程序判定(126 条全过)。
  • B 层 · LLM-as-judge对"原因合理性 / 建议可执行性 / 差异判断"做三档评分,跑 3 次取中位数消噪声;合成评分 48.5 / 50。

两个真实修复的 bug(面试可讲)

  • Bug 1中英签名漏匹配 → 召回准确率下降,补签名归一化修复。
  • Bug 2AND 条件过严导致跨行业空白 → 放宽为 OR + 行业兜底,召回恢复。

评测数据集来源:基于业务规则生成的模拟投放数据(SEED 固定,可复现),用于离线验证 Agent 质量,非线上真实用户数据。

诚实边界

作为作品集,以下边界如实标注,避免夸大。

当前为原型 / 离线验证阶段:

  • 使用模拟投放数据(source='sim')验证 Agent 逻辑,非线上真实业务流量。
  • 项目尚未上线生产环境,评测权重由方法论推导 + 评测集验证,非 A/B 实测。
  • 客户经营看板中的"健康分"为纯前端规则聚合(非 LLM),初版曾因写死阈值权重失真,后改为消耗动能驱动。
  • 真实 LLM 报告生成需接入大模型 API;离线演示走 dry_run 确定性路径。

这些边界恰恰是产品思维的体现:我知道 Agent 的能力边界在哪、哪些结论不能拍脑袋、哪些必须人工接管。面试时我会把"为什么这样设边界"讲清楚。