发邮件

把 AI 能力 做成可衡量的产品

向鑫 · AI 产品经理,6 年产品经验,其中 5 年在字节跳动今日头条。 先建评测标尺,再谈优化:把模糊诉求收敛为可验证的落地场景。

大模型应用落地
评测体系与数据闭环
研发效能提效
RAG · 私域知识库
6 年产品经验,其中 5 年在今日头条
2 个独立主导的 0 → 1 AI 项目
50 人推广至 5 个测试团队
60%业务线测试人力覆盖

我关注的不是模型本身有多强,而是它能不能稳定地解决真实工作流里的问题。

6 年产品经验,5 年在字节跳动今日头条。2023.12 起转向研发效能方向的 AI 应用落地,独立负责两个大模型项目从场景论证到试点推广的全流程,分别解决测试用例「怎么写」和「漏没漏」的问题。做 AI 需求时习惯先建评测标尺、再谈优化,评测集、验收阈值与效果验证方法均由我定义;同时通过置信度分档、规则兜底、降级策略与人工反馈回流控制模型的不确定性。

  • 大模型应用落地 01
  • 评测体系与数据闭环 02
  • 研发效能提效 03

工作经历

6 年产品经验,从优酷与今日头条的播放体验,走到研发效能方向的大模型应用落地。

产品经理助理 · 播放体验 2020.07 — 2021.06
产品经理 · 内容消费 2021.07 — 2023.11
AI 产品经理 · 研发效能 2023.12 — 2026.07
优酷播放体验
头条音视频体验
用例盲区雷达
智测用例引擎
2020.072026.07
2023.12 — 2026.07

AI 产品经理

字节跳动 · 今日头条
深圳
  • 负责研发效能方向的 AI 应用落地,独立主导两个 0 → 1 项目,均完成场景论证 → 评测验证 → 试点 → 推广全流程
  • 评测集、验收阈值与效果验证方法均由我定义,作为灰度放量的硬性门槛
  • 拉齐算法、工程、测试、安全四方推进,立项阶段完成数据权限分级
2021.07 — 2023.11

产品经理

字节跳动 · 今日头条
深圳
  • 负责内容消费方向,主导音视频播放器的功能迭代与体验优化
  • 把音频从图文附属功能做成独立消费场景,并牵头播放质量指标定义与看板建设
2020.07 — 2021.06

产品经理助理

阿里巴巴 · 优酷
  • 负责移动端播放体验,参与播放质量度量体系搭建,承接播控迭代与清晰度策略实验
  • 参与定义秒开率、卡顿次数、播放失败率口径,并负责分端分网络的质量归因分类

代表项目

两个 0 → 1 的 AI 项目,两段音视频播放体验,以及个人独立开发与内容实践。

LLM · RAG · 研发效能

智测用例引擎 —— AI 测试用例生成平台

2025.05 — 2026.07 · 项目负责人

把大模型接进用例设计环节,面向约 80 人的测试团队落地「需求文档 → 功能用例」「Swagger → 接口用例」两条链路。先建评测标尺再谈优化:五维评分标准 + 300+ 条黄金评测集,达标才放量。能力嵌进测试同学原有平台而非新造工具,结果按置信度分档,人工修改的 diff 结构化回流,成为版本迭代的主要输入。

-30%+用例设计人均投入工时
~80%综合采纳率,零修改直采近 50%
-1/3需求到用例的交付周期
1.5 人试点范围内释放的人力

评测集得分(百分制)· 两轮归因迭代后

首版
60 分左右
迭代后
80 分以上

需求点覆盖度

纯人工
80% 出头
接入后
90% 左右
需求文档 / Swagger 输入 用例生成 功能链路 / 接口链路 置信度分档 字段/必填/枚举走规则校验 解析失败 → 用例骨架降级 评审逐条处置 采纳 / 修改 / 丢弃 RAG 私域知识库 粒度 · 命名规范 · 必测项 · 参数边界 人工修改 diff 结构化回流 → 版本迭代的主要输入 评测标尺先行 五维评分(覆盖度 · 粒度一致性 · 可执行性 · 冗余控制 · 格式合规) · 300+ 条黄金评测集 · 达标才放量
可规则校验的字段类型、必填项、枚举值不交给模型判断;解析失败降级为「用例骨架 + 手工补充提示」。线上缺陷数与对照组持平——提效未以质量为代价。
展开看关键决策
  • 场景收敛:拆解测试工时结构后选定用例设计环节(占总工时约 1/4、结果可当天验证、有历史用例可沉淀),评估并放弃自动化脚本生成、缺陷根因定位等候选场景,明确一期「不做清单」。
  • 技术选型:把用例粒度、命名规范、必测项规则沉淀为 RAG 知识库;论证后放弃微调路线——样本量与需求变化频率不支撑其投入产出比。
  • 效果归因:首版未达标后,对被丢弃 / 大幅修改的用例做全量归因分类,分链路调整提示词策略与示例集。
  • 推广节奏:2 团队 10 周试点数据达标后,分两批推广至 5 个团队约 50 人。
检索 · 评测方法 · 评审提质

用例盲区雷达 —— 基于历史缺陷的用例评审辅助

2023.12 — 2025.04 · 独立负责

把历史真实缺陷当成考题,去检验现有用例集里评审阶段难以发现的覆盖盲区。一期只做盲区识别与语义冗余检测,主动放弃用例自动改写——判断权留给人,且改写结果无法验证。每条盲区强制携带来源缺陷编号与发现阶段,只给补充方向、不代写用例。

+40%评审后新增用例条数,其中 1/3 来自 AI 提示
~60%回溯测试集上的盲区提前识别率
~45%20+ 场真实评审的建议采纳率
70%+试点团队周活

单场评审的产出(耗时基本持平)

接入前
基线
接入后
+40%
时间切片 T 过去 现在 还原 T 时刻的用例集 按创建时间过滤,杜绝数据泄漏 T 之后真实逃逸缺陷(当考题) 屏蔽根因防「开卷」 · 500+ 条筛出 400+ 条有效样本 遍历缺陷检索用例 · 规则精确匹配缩范围 → 混合召回精排 Top-5 → 模型回答封闭是非题 剔除并发时序、机型等本就无法覆盖的样本;每条盲区强制携带来源缺陷编号
确定必须「遍历缺陷检索用例」而非反向——以用例为起点只能看到已存在的用例,看不见缺失的部分。这套「时间切片 + 防泄漏 + 剔除不可覆盖样本」的回溯验证方法,后来沉淀为团队资产被复用。
展开看关键决策
  • 缺陷知识库:缺陷抽象为「前置条件 / 操作路径 / 触发因素 / 异常表现」四元组,只取现象与复现步骤;滚动窗口长度由盲区采纳率数据反推确定为 12–18 个月。
  • 路线排除:排除代码覆盖率路线——它无法反映设计层盲区,且依赖团队不具备的探针基建。
  • 误报收敛:首版误报率过高,经全量归因与三轮迭代后收敛至约 20%;用户处置动作(要补 / 已知不测 / 误报)回流优化模型。
  • 定位调整:耗时没降但产出变多,据此把项目对内定位由「评审提效」主动改为「评审提质」——采纳率约 45%,为同期人工基线(60%)的约 3/4。
内容消费 · 音频播放器 · 视频播放器

今日头条音视频播放体验优化

2021.07 — 2023.11 · 产品经理

头条从图文向多形态内容消费转型期,音视频是承接消费时长的主要形态,但播放能力分散、体验与质量口径不统一。

  • 音频播放器:主导「听新闻」场景,落地后台播放、锁屏控制、自动连播、倍速与断点续听,并针对通勤场景把单篇播放升级为个性化播放列表——把音频从图文附属功能做成独立消费场景。
  • 视频播放器:推进手势快进、清晰度自适应、小窗播放等交互统一,牵头秒开率、卡顿率、播放失败率的产品侧口径定义,建立分端分网络的播放质量看板。
  • 项目成果:音频场景消费时长与用户规模稳步增长,从图文附属功能成长为独立消费入口;播放器交互规范与质量度量口径被后续多个内容形态复用。
播放质量度量 · 播控功能 · A/B 实验

优酷移动端播放体验优化

2020.07 — 2021.06 · 产品经理助理

播放链路横跨播放内核、CDN 调度与码率策略多个团队,归因分散、口径不一;项目先把播放质量做成可度量、可归因的指标体系。

  • 播放质量度量:参与定义秒开率、卡顿次数、播放失败率的产品侧口径,搭建分端分网络的质量看板并负责归因分类。
  • 播控功能迭代:承接倍速、跳过片头片尾、小窗播放的需求跟版,推动移动端与 TV 端播控统一;负责默认清晰度与码率自适应的 A/B 实验。
  • 项目成果:播放质量由被动接客诉转为主动发现,秒开率与卡顿率持续改善;度量口径被 TV 端复用。
个人项目 · Web Coding & 自媒体

独立开发实践与 AI 知识科普

持续进行中

利用 AI 编程工具从 0 到 1 独立完成需求定义、原型设计与开发落地;同时在抖音独立运营 AI 知识科普账号,长期贴近 C 端用户对 AI 的真实认知与使用痛点。

短视频口播稿与封面生成工具

输入选题即产出结构化口播稿(钩子 / 正文 / 引导)与封面图。核心是提示词工程与模板体系——把优质脚本拆解为可复用结构,约束输出格式,解决内容发散、风格不稳定的问题。

AI 决策助手(正反方论证)

输入待决策问题,以正反方对抗形式输出「做与不做」的理由清单、关键变量与倾向性建议。核心是把模型的含糊建议重构为可审阅的决策框架,让用户逐条判断、保留最终决策权。

抖音 · AI 知识科普

独立负责选题、脚本、剪辑与数据复盘全流程,持续输出 AI 工具实测与认知科普内容。

复盘闭环

建立「选题 → 完播率 / 互动率 → 迭代」的复盘习惯,沉淀可复用的选题与脚本方法论,反哺产品侧的需求理解与价值传达。

能力图谱

产品

  • 模糊诉求 → 可验证场景
  • 需求定义与 PRD
  • 不做清单与验收指标
  • 试点设计与推广落地
  • A/B 与实验设计

AI 专长

  • 评测集与评分标准设计
  • RAG 与私域知识库
  • 置信度分档与规则兜底
  • 人工反馈回流与数据闭环
  • 提示词工程与效果归因

协作

  • 算法 / 工程 / 业务跨团队推进
  • 数据权限与安全合规对齐
  • 数据指标拆解
  • 技术可行性评估
  • AI 编程实现原型验证

教育背景

深圳大学

本科

如果你在找一位能把 AI 做成产品的 PM,聊聊吧。

目前开放全职机会。也欢迎创业团队、AI 应用方向的合作交流。

发送邮件