6 年 产品经验,其中 5 年在今日头条
2 个 独立主导的 0 → 1 AI 项目
50 人 推广至 5 个测试团队
60% 业务线测试人力覆盖
About
我关注的不是模型本身有多强,而是它能不能稳定地解决真实工作流里的问题。
6 年产品经验,5 年在字节跳动今日头条。2023.12 起转向研发效能方向的 AI 应用落地,独立负责两个大模型项目从场景论证到试点推广的全流程,分别解决测试用例「怎么写」和「漏没漏」的问题。做 AI 需求时习惯先建评测标尺、再谈优化,评测集、验收阈值与效果验证方法均由我定义;同时通过置信度分档、规则兜底、降级策略与人工反馈回流控制模型的不确定性。
大模型应用落地 01
评测体系与数据闭环 02
研发效能提效 03
Experience
工作经历
6 年产品经验,从优酷与今日头条的播放体验,走到研发效能方向的大模型应用落地。
产品经理助理 · 播放体验
2020.07 — 2021.06
产品经理 · 内容消费
2021.07 — 2023.11
AI 产品经理 · 研发效能
2023.12 — 2026.07
优酷播放体验
头条音视频体验
用例盲区雷达
智测用例引擎
2020.07 2026.07
2023.12 — 2026.07
负责研发效能方向的 AI 应用落地,独立主导两个 0 → 1 项目,均完成场景论证 → 评测验证 → 试点 → 推广全流程
评测集、验收阈值与效果验证方法均由我定义,作为灰度放量的硬性门槛
拉齐算法、工程、测试、安全四方推进,立项阶段完成数据权限分级
2021.07 — 2023.11
负责内容消费方向,主导音视频播放器的功能迭代与体验优化
把音频从图文附属功能做成独立消费场景,并牵头播放质量指标定义与看板建设
2020.07 — 2021.06
负责移动端播放体验,参与播放质量度量体系搭建,承接播控迭代与清晰度策略实验
参与定义秒开率、卡顿次数、播放失败率口径,并负责分端分网络的质量归因分类
Projects
代表项目
两个 0 → 1 的 AI 项目,两段音视频播放体验,以及个人独立开发与内容实践。
LLM · RAG · 研发效能
智测用例引擎 —— AI 测试用例生成平台
2025.05 — 2026.07 · 项目负责人
把大模型接进用例设计环节,面向约 80 人的测试团队落地「需求文档 → 功能用例」「Swagger → 接口用例」两条链路。先建评测标尺再谈优化:五维评分标准 + 300+ 条黄金评测集,达标才放量。能力嵌进测试同学原有平台而非新造工具,结果按置信度分档,人工修改的 diff 结构化回流,成为版本迭代的主要输入。
-30%+ 用例设计人均投入工时
~80% 综合采纳率,零修改直采近 50%
-1/3 需求到用例的交付周期
1.5 人 试点范围内释放的人力
需求文档 / Swagger
输入
用例生成
功能链路 / 接口链路
置信度分档
字段/必填/枚举走规则校验
解析失败 → 用例骨架降级
评审逐条处置
采纳 / 修改 / 丢弃
RAG 私域知识库
粒度 · 命名规范 · 必测项 · 参数边界
人工修改 diff 结构化回流 → 版本迭代的主要输入
评测标尺先行
五维评分(覆盖度 · 粒度一致性 · 可执行性 · 冗余控制 · 格式合规) · 300+ 条黄金评测集 · 达标才放量
可规则校验的字段类型、必填项、枚举值不交给模型判断;解析失败降级为「用例骨架 + 手工补充提示」。线上缺陷数与对照组持平——提效未以质量为代价。
展开看关键决策
场景收敛 :拆解测试工时结构后选定用例设计环节(占总工时约 1/4、结果可当天验证、有历史用例可沉淀),评估并放弃自动化脚本生成、缺陷根因定位等候选场景,明确一期「不做清单」。
技术选型 :把用例粒度、命名规范、必测项规则沉淀为 RAG 知识库;论证后放弃微调路线——样本量与需求变化频率不支撑其投入产出比。
效果归因 :首版未达标后,对被丢弃 / 大幅修改的用例做全量归因分类,分链路调整提示词策略与示例集。
推广节奏 :2 团队 10 周试点数据达标后,分两批推广至 5 个团队约 50 人。
检索 · 评测方法 · 评审提质
用例盲区雷达 —— 基于历史缺陷的用例评审辅助
2023.12 — 2025.04 · 独立负责
把历史真实缺陷当成考题,去检验现有用例集里评审阶段难以发现的覆盖盲区。一期只做盲区识别与语义冗余检测,主动放弃用例自动改写——判断权留给人,且改写结果无法验证。每条盲区强制携带来源缺陷编号与发现阶段,只给补充方向、不代写用例。
+40% 评审后新增用例条数,其中 1/3 来自 AI 提示
~60% 回溯测试集上的盲区提前识别率
~45% 20+ 场真实评审的建议采纳率
70%+ 试点团队周活
时间切片 T
过去
现在
还原 T 时刻的用例集
按创建时间过滤,杜绝数据泄漏
T 之后真实逃逸缺陷(当考题)
屏蔽根因防「开卷」 · 500+ 条筛出 400+ 条有效样本
遍历缺陷检索用例 · 规则精确匹配缩范围 → 混合召回精排 Top-5 → 模型回答封闭是非题
剔除并发时序、机型等本就无法覆盖的样本;每条盲区强制携带来源缺陷编号
确定必须「遍历缺陷检索用例」而非反向——以用例为起点只能看到已存在的用例,看不见缺失的部分。这套「时间切片 + 防泄漏 + 剔除不可覆盖样本」的回溯验证方法,后来沉淀为团队资产被复用。
展开看关键决策
缺陷知识库 :缺陷抽象为「前置条件 / 操作路径 / 触发因素 / 异常表现」四元组,只取现象与复现步骤;滚动窗口长度由盲区采纳率数据反推确定为 12–18 个月。
路线排除 :排除代码覆盖率路线——它无法反映设计层盲区,且依赖团队不具备的探针基建。
误报收敛 :首版误报率过高,经全量归因与三轮迭代后收敛至约 20%;用户处置动作(要补 / 已知不测 / 误报)回流优化模型。
定位调整 :耗时没降但产出变多,据此把项目对内定位由「评审提效」主动改为「评审提质」——采纳率约 45%,为同期人工基线(60%)的约 3/4。
内容消费 · 音频播放器 · 视频播放器
今日头条音视频播放体验优化
2021.07 — 2023.11 · 产品经理
头条从图文向多形态内容消费转型期,音视频是承接消费时长的主要形态,但播放能力分散、体验与质量口径不统一。
音频播放器 :主导「听新闻」场景,落地后台播放、锁屏控制、自动连播、倍速与断点续听,并针对通勤场景把单篇播放升级为个性化播放列表——把音频从图文附属功能做成独立消费场景。
视频播放器 :推进手势快进、清晰度自适应、小窗播放等交互统一,牵头秒开率、卡顿率、播放失败率的产品侧口径定义,建立分端分网络的播放质量看板。
项目成果 :音频场景消费时长与用户规模稳步增长,从图文附属功能成长为独立消费入口;播放器交互规范与质量度量口径被后续多个内容形态复用。
播放质量度量 · 播控功能 · A/B 实验
优酷移动端播放体验优化
2020.07 — 2021.06 · 产品经理助理
播放链路横跨播放内核、CDN 调度与码率策略多个团队,归因分散、口径不一;项目先把播放质量做成可度量、可归因的指标体系。
播放质量度量 :参与定义秒开率、卡顿次数、播放失败率的产品侧口径,搭建分端分网络的质量看板并负责归因分类。
播控功能迭代 :承接倍速、跳过片头片尾、小窗播放的需求跟版,推动移动端与 TV 端播控统一;负责默认清晰度与码率自适应的 A/B 实验。
项目成果 :播放质量由被动接客诉转为主动发现,秒开率与卡顿率持续改善;度量口径被 TV 端复用。
个人项目 · Web Coding & 自媒体
独立开发实践与 AI 知识科普
持续进行中
利用 AI 编程工具从 0 到 1 独立完成需求定义、原型设计与开发落地;同时在抖音独立运营 AI 知识科普账号,长期贴近 C 端用户对 AI 的真实认知与使用痛点。
短视频口播稿与封面生成工具
输入选题即产出结构化口播稿(钩子 / 正文 / 引导)与封面图。核心是提示词工程与模板体系——把优质脚本拆解为可复用结构,约束输出格式,解决内容发散、风格不稳定的问题。
AI 决策助手(正反方论证)
输入待决策问题,以正反方对抗形式输出「做与不做」的理由清单、关键变量与倾向性建议。核心是把模型的含糊建议重构为可审阅的决策框架,让用户逐条判断、保留最终决策权。
抖音 · AI 知识科普
独立负责选题、脚本、剪辑与数据复盘全流程,持续输出 AI 工具实测与认知科普内容。
复盘闭环
建立「选题 → 完播率 / 互动率 → 迭代」的复盘习惯,沉淀可复用的选题与脚本方法论,反哺产品侧的需求理解与价值传达。
Skills
能力图谱
产品
模糊诉求 → 可验证场景
需求定义与 PRD
不做清单与验收指标
试点设计与推广落地
A/B 与实验设计
AI 专长
评测集与评分标准设计
RAG 与私域知识库
置信度分档与规则兜底
人工反馈回流与数据闭环
提示词工程与效果归因
协作
算法 / 工程 / 业务跨团队推进
数据权限与安全合规对齐
数据指标拆解
技术可行性评估
AI 编程实现原型验证