作者: 宝玉 @dotey

腾讯学堂出品,本文整理自 AI 博主、《软件工程之美》专栏作者宝玉在腾讯内部的分享。
他以自己做了三年的字幕翻译 App 为主线,讲了 AI 产品从找需求、判边界、最小验证、重设计到落地交付的完整过程;问答环节回应了另一个问题:每个个体如何与 AI 共同进化。做产品的、写代码的、带团队的,都能从这份一线实操记录里拿到能用的东西。
宝玉,AI 自媒体博主、资深技术人,《软件工程之美》专栏作者。2000 年起自学编程,历任工程师、开发经理、开发总监,后出国留学,毕业后重新从工程师做到工程经理,技术栈从 ASP、.NET、iOS 前端一路切换到 AI 开发。近年以 AI 主题写作和分享为主,他写的 Nano Banana 城市天气画图提示词曾火到海外,Google CEO 在推特上公开致谢。
今天讲 AI 原生思维,分两个部分:一是 AI 产品怎么做,怎么找需求、判边界、落地交付;二是个体怎么跟 AI 共同进化。选这两个题目,是因为我做 AI 博主这些年,被问得最多的就是两类问题:一类是 AI 焦虑,AI 会不会替代我们,该学什么;另一类来自做 AI 产品的人,AI 产品跟传统产品到底有什么不一样。
先简单介绍自己。我大学学的力学,因为喜欢做软件转到软件工程;2000 年左右自学编程,从 ASP、PHP 做到 .NET、iOS 前端,再到 AI 开发;职位从工程师做到开发总监,出国留学后又从工程师做到工程经理。写自媒体也一样,最早写《软件工程之美》专栏,这几年主要写 AI。我一直在转型,所以 AI 来的时候没那么恐惧,以前的经验告诉我,无非就是要去学、去转。
这些年的经历用一个比喻说,就是像训练大模型一样训练自己。我做自媒体本质是费曼学习法:要学 AI,就把学到的东西分享出来;为了分享,得去学更多理论;写出来收到反馈,反馈又帮我建立新的循环。模型也一样,预训练之后靠微调、对齐不断进化。而且模型一直在变:GPT-3 是自动补全,ChatGPT 会聊天,现在 Agent 能自主完成任务。模型在进化,知识也得跟着进化,很多时候要敢于推翻自己的旧权重。这是贯穿全场的暗线。

上半场我用一个自己做的 AI 产品贯穿始终:一个转录翻译 App(BaoCut),给它英文视频,输出中文字幕。选它不是因为它多好,而是我自己做的、踩过很多坑,每个判断和每个坑都能讲出当时的真实想法。别人的案例只能讲结果,自己的案例才能讲决策。
想法的起点很早。年轻时《反恐 24 小时》正火,人人字幕组第一时间把美剧翻译出来,我觉得这件事很了不起。后来有了 AI,我自己要看吴恩达的教学视频,就想:能不能像字幕组一样,也做出双语字幕?
但需求不是拍脑袋就值得做。你觉得大家都需要的东西,做出来可能没人用;没人用就没反馈,慢慢就做不下去了。做之前我先问自己三件事:

真痛点:很多人想看英文深度内容但听力跟不上,刚需真实存在。
我自己做自媒体天天翻视频,自己天天用,能拿到最及时的直接体感。
Whisper 能听写、大模型能翻译、Agent 能自动对齐时间轴。AI 让以前不可能的事变得可能。
关于第三问“AI 是不是刚好够到”,插一个例子。我有个做得很成功的画图提示词,就是后来很火的 Nano Banana 城市天气图,Google CEO 在推特上公开致谢过它。
这个提示词迭代了很多版本。GPT 刚出画图模型时我就在用,但那时要手动输入城市、天气一大堆信息,才能画出一张很酷的图,有人围观,不火。到了 Nano Banana 这代,Gemini 内置搜索能自己查天气,我把提示词简化到只输一个城市名:输入上海,就生成一张带当天天气效果的上海地标图。这一下有了传播性,每个人都想试自己的城市,生成后贴回来分享,从中文圈火到英文圈,最后 Google 官方都注意到了。

同一个需求,模型没有检索能力时,它只是个普通提示词;能力到了,就能让所有人参与。需求一直都在,是能力边界刚好扫过了它。另一点是品味:人人都能用 AI 生成东西,想流行还是得有自己的品味,品味就是门槛。
回头看模型的几次跃迁:GPT-3 时代是自动补全,能做的事有限,比如写营销文案;ChatGPT 有了对话能力,聊天机器人这类需求一下迸发出来;这一两年有了 Agent 能力,能按目标调工具自动完成任务,Claude Code、Manus 就是基于新能力长出来的。
所以找需求要盯着模型能力进化的方向。每次升级,边界线外扩一圈,扫过的地方全是新需求。不是想到一个需求做出来就有人用,在边界线上找,才最容易发现新机会。
找到需求,接下来评估值不值得做。我看三个角度:AI 的能力现在做不做得到?成本成不成立?交付的价值是不是用户真要的?多数人只盯着第一关。

2023 年 GPT-4 刚出时,有个叫 AutoGPT 的项目:通用 Agent 雏形,你输入任务,它就不停调 GPT-4、调 Google 搜索,汇总成报告。GitHub 上 Star 涨得飞快,但火了一阵就凉了。原因很简单:那时 Agent 能力没到,任务经常打转;调 Google API 要付费,GPT-4 又非常贵,烧大把 Token 交付不了结果。
Manus 是同一个“通用 Agent”的想法,但它出现在能力刚好够到的时刻:模型已经能自己列 to-do list、逐条执行、交付结果,于是一夜刷屏。想法不是关键,能力边界才是。想法太早,烧的只是 Token。

边界线没有停。Claude Code 用最简单的命令行循环调工具写代码,至今是最火的 Coding Agent,形态服务于能力,不服务于潮流。“小龙虾”(OpenClaw)又进一步:通过电报、微信、QQ 就能指挥它干活,还把 Skill 用到极致。模型只训练过公共知识,我用 Markdown 文件就能教它给文章配图、发布,把私有知识装进去。再往后 Codex 的创新是 GUI 和 Computer Use:能操作浏览器和 App,写完网页自己点鼠标、敲键盘完整测一遍,以前要人全程参与的中间过程,现在最后验收就行。到现在各家都在推“Work”类产品,Agent 从写代码泛化到办公。边界每次外扩后还有小的溢出点,盯住就能发现新需求。
我的产品也是一层层解锁的:Whisper 解锁听写,大模型解锁翻译和拆字幕,Agent 解锁自主执行和验收。最早翻半小时字幕,我要校对一两个小时;现在 Codex 翻完,我花五分钟看一遍就行,时间轴对得非常准。每解锁一层能力,产品就能重设计一次。

第二个因素是成本。GPT-4 时代翻半小时视频要几美元,我自己勉强接受,普通人太贵,那个版本我一直自己用。现在 DeepSeek 这类模型出来,一小时视频几毛钱就能翻完。但成本要动态看:Token 单价在降,Agent 模式下消耗量上去了,不能只看单价。公式很简单:调用次数 × 每次 Token 量 × 单价,降成本就从这三个因子下手。
我有过一次真实优化。最早让模型直接输出结构化 JSON,十句字幕加标记就有几十 K Token,结构越复杂单次处理量越小,半小时视频要几十上百次请求,用户抱怨一个视频用掉 20% 周额度。后来改成纯文本和 HTML 输出,HTML 对模型友好,就像网页翻译,单次量大了,次数降了。代价是解析变复杂:润色后要用 diff 算法找改动、对回时间轴。但这就是取舍:模型输出简单格式,复杂解析交给程序。翻译用便宜模型,只有对齐才用贵一点的。一轮下来,调用从 33 次降到 12 次,单集处理从 31 分钟降到 18 分钟。

第三关是价值。字幕翻译用户要的是确定性结果,英文进去、准确中文出来,不在乎谁翻的。但不是所有东西都这样:AI 自动写小说、做视频,很多人天然抵触,叫“AI 垃圾”;哪怕我只让 AI 润色文章,都有读者评论“AI 味很重”。如果产品只是在生产更多 AI 垃圾,就要想想值不值得做。用户买的是结果还是结果背后的人,这条线锚在人性上,不随模型升级移动。

该需求处于模型能力外扩的黄金边界线上,成本可控且具备真实自用场景,建议立刻用 Claude Design 做高保真原型验证!
决定做了,下一步是怎么快速做出来。这个项目我两三年前就开了,一直没发布:视频编辑器工作量大,Whisper 早期时间戳对不准,业余时间老被打断,眼看要进“半成品坟场”。破局靠两个选择。
第一个是 Claude Design:用指令直接生成高保真交互原型,不用写代码,配模拟数据,几分钟就能上手测试。从头做没人做过的东西,靠写代码反馈周期太长;用原型,周期压到几小时,马上知道哪里不对。MVP 决策也在这步做:只做 Mac、只做最简单的播放和字幕。
第二个有点阴差阳错:我用了完全不熟的 Swift 加 AppKit。这些年我主要做前端,Electron、TypeScript 特别熟,用熟的语言有个坏处,你老想自己控制代码,一控制你就成了瓶颈,不放心让 AI 写。Swift 不熟,只能交给 AI,我只管验收,代码都不怎么看。正因为不熟才能放手,几天就做出能跑的 MVP。在不熟悉的领域开始,反而更接近 AI 原生思维。

最小验证的另一面是让坏想法死得早。反例:我嫌刷推特微博太花时间,用 AI 一小时做了个客户端原型,挺漂亮,但做出来发现还不如网页方便,没有每天想用的冲动,砍掉。字幕 App 相反,比脚本好用太多,我每天都在用,就一直迭代到现在。
GPT-4 时代的第一版,直觉做法是模拟字幕组:Whisper 听写、转 SRT、大模型翻译、人工校对、算法处理时间轴。能做,但问题多:模型翻译时自作主张把两条字幕合并,时间戳对不上;校对要完整看一遍视频,翻一集要一两个小时;长句还要靠大模型拆。V1.5 用工作流编排和算法打补丁,有效,但旧框架里打补丁,收益递减。

到了 Agent 时代,我重新思考这个产品,思路一句话:以终为始。终点很简单,把英文视频翻译成中文字幕。不问“原流程哪步还能优化”,从终点倒推,连追三个问题:
中英文语序不同,英文倒装、中文正序,SRT 条目级对不上,模型为了对上就把两段合并。但句子级一定能一一对应,为什么非要先拆 SRT?因为在模仿字幕组。Whisper 有个选项叫 word timestamp,每个词都有时间戳。我转录时保留词级时间戳,翻译按句子对齐,再回头按词级时间戳重拆,时间轴不用人工对。
一小时字幕太长,必须分页翻,分页后术语不一致。改进:先做整体分析提取术语表,每页翻译时注入本页术语,保证全局风格一致。
因为在模仿字幕组每步人工校验。V2 里每步都给 Agent 验证工具,比如用脚本校验每条英文是不是正好对应一条中文,Agent 自己验收,人只兜底。配套地,界面从 GUI 变成命令行工具加 Skill 文件,数据从数据库改成静态文件。整个流程 Agent 自主完成,人只在两头:输入视频,最后验收。



新功能怎么上线?上周的真实案例:用户有两台电脑,一台性能好不常用,一台常用性能弱,希望“远程转录”,用常用的机器指挥另一台的显卡跑字幕。好需求,我按固定流程推进,但没打开编辑器。


• 第一关 可行性:Agent 分析罗列方案,人做判断拍板;
• 第二关 设计文档:文档是一等公民,对人是确认载体,对 Agent 是跨 Session 上下文接力棒;
• 第三关 高保真原型:数据全模拟,看见实物才知道差距,把需求、原型、UI 合成一次确认;
• 第四关 模块化实现:拆成小里程碑,一次一个小版本,代码交给 AI 写;
• 第五关 测试验收:把自己当普通用户凭直觉乱用,抓功能、性能与安全,把问题扔回给 Agent 改。
整个功能时间跨度一两天,实际投入几小时,以前至少要几周。流程还是传统那套,一个没少;变的是我的角色:不再是程序员,而是产品经理加测试,更像管理者。确认可以合并,不能省略。验证题给 Agent,判断题留给人。

总结一下。做 AI 产品,先找符合 AI 特点的需求:痛点够不够硬、自己是不是用户、AI 是不是刚好够到;再看三条边界:能力、成本、价值。做的时候先做高保真原型快速验证,让坏想法死得早。设计时站在 AI 的角度:给它工具自己验证,用它熟悉的格式,给规范不给模板。开发时人的精力放在定义和验收两头,确认可以合并,不能省略。
模型一直在进化。今天 Agent 能力强,明天可能是一群 Agent 协作。每次边界线外扩,都值得重新想一遍:这个能力边界下,对 AI 最好的设计是什么,有什么新需求冒出来了。就像训练大模型要推翻旧权重,做产品的人也要敢于推翻自己的旧答案。

我的经验就一条:先用起来。只有实践才有真实感悟,我今天讲的开发过程,你不自己做一遍,能带走的东西很有限。最根本的是建立反馈循环:定义想做的事,AI 帮你做成,你验收;分享出去收反馈;把经验写出来,AI 帮你整素材,输出又倒逼你系统思考。小循环做项目,大循环做分享。把人的成长做成一套 Loop Engineering。
执行层交给 AI,不用有心理负担。写代码、生成 PPT 样式让 AI 做就很好。程序员别把自己当写代码的,当 Tech Lead 或 Engineering Manager,AI 是你的员工。你的价值在两头:定义问题和验收结果。定义问题靠反复练习,验收靠品味。
有点像模型的监督微调。编程、数学有客观标准,跑测试就知道;写作没有。我的办法是大量输入加自己上手:读很多文章,自己也写;好的差的一对比,品味就出来了。画图、视频也一样。这件事 AI 短期替代不了,就像大模型靠数据训练涌现能力,人也一样。
不用太在意代码细节,整不整洁不是关键。你把自己当 QA,看三件事:功能完不完整;性能好不好(CPU/内存占用);安全是最高优先级(SQL 注入、弱密码这类常识测试)。其他实现细节当黑盒就好。
先把 Agent 用起来,别停在 Chatbot。日常重复的、知识类的工作都可以让它试。买东西让 Agent 比价选型;处理保险、法律资料;申请苹果开发者证书这种生疏流程让 Codex 代劳。跟工种关系不大,多试探它的边界,就像打游戏开地图,地图越开越大。
两点最关键:第一上下文,维护一个 AGENTS.md 或 CLAUDE.md 作为项目结构与规范地图;第二让 Agent 能自己验证,补跨模块集成测试,做需求改 Bug 时同步补,老项目也能改得动。