采访录音转文字:带时间戳的访谈逐字稿,从上传到引用原话
做毕业论文的质性访谈、写一篇人物稿、跑一轮用户研究,最后都会卡在同一件事上:手里有十几个小时的录音,却要一个字一个字地听写。按常见的经验,一小时录音手工整理要四到六个小时,而且整理完的文字和录音是分开的,写到一半想确认“这句话受访者原话是怎么说的”,又得回去拖进度条。这篇文章讲的是另一种做法:把采访录音文件直接上传,拿到每一行都带时间戳的逐字稿,点任意一行就从那一秒开始回放;再用摘要、章节和 AI 对话,把要引用的原话连同时间一起找出来。
Have a recording like this? Packs from $4, credits never expire → timestamps, overview. Summary free to read.
先说结论:五步拿到一份能引用的访谈逐字稿
- 一场访谈一个文件。文件名用受访者编号和日期,例如
P03_0912.m4a,不要用真实姓名。 - 在电脑上上传到 Whipscribe 首页。上传后填写邮箱,大约每小时音频两分钟左右出稿。
- 先读摘要和章节。对照访谈提纲,确认每个问题大概在第几分钟被谈到。
- 在 AI 对话里按主题找原话。要求只引用原话、每条附时间戳,点时间戳回放核对。
- 导出存档。逐字稿下载为 DOCX 或 TXT;让 AI 把引文整理成 Excel 表,文件出现在资源里。
为什么时间戳对访谈特别重要
会议录音整理的是结论,访谈整理的是原话。论文里的引文、稿件里的直接引语、研究报告里的用户原声,都要经得起追问:“他真的这么说了吗?上下文是什么?”没有时间戳的逐字稿只能回答前半个问题,有时间戳的逐字稿两个都能回答,因为每一句都能在几秒内回到录音里重听。
时间戳还让引用格式变得简单。很多质性研究会在引文后标注受访者编号和位置,例如“(P07,00:42:15)”;记者核实引语时,也可以把时间点发给编辑,让对方自己去听。带时间戳的逐字稿,就是一份自带索引的原始资料。
详细步骤
第一步:整理录音文件
访谈结束后,把录音从手机、录音笔或线上访谈软件里导出来。一场访谈保持一个完整文件,不要为了上传方便自己切分:切开之后时间戳会从零重新开始,引用位置就对不上了。
- .m4a、.mp3、.wav、.mp4、.mov、.webm、.flac、.ogg 都可以直接上传,视频不需要先转成音频。
- 单个文件最长 10 小时、最大 5 GB,三小时的深度访谈或一整个下午的焦点小组也不用拆。
- 文件名只用编号和日期。这既方便后面对应,也是隐私保护的第一步。
第二步:上传并等待转写
建议在电脑上操作:大文件上传更稳定,后面一边听一边核对也更方便。在首页把文件拖进上传区,上传后填写邮箱,之后用这个邮箱找回逐字稿。普通话在支持的 99+ 种语言之内,一场 90 分钟的访谈通常几分钟就能看到结果。可以一次把几场访谈都传上去,再回来逐个处理。
第三步:先读摘要和章节,再读逐字稿
打开逐字稿后,先看智能分析页:摘要概括这场访谈的主线,章节把一个半小时切成几个话题并标出起始时间,关键原话列出最值得引用的几句。把章节和你的访谈提纲放在一起看,就能很快知道“受访者在第 38 分钟开始谈第一份工作”“家庭话题在 1:05 才出现”,后面细读时直接跳到对应位置。
第四步:核对逐字稿里容易出错的地方
点击逐字稿的任意一行,录音就从那一秒开始播放。不需要把整场访谈从头听一遍,重点核对四类内容:人名和地名、机构和产品名称、行业术语、受访者口音较重或语速很快的段落。凡是准备写进论文或稿件的句子,都值得回放听一次。核对要改的地方,下载 DOCX 后在 Word 里修改即可。
第五步:在 AI 对话里按主题找原话
AI 对话会读完整份逐字稿再回答,答案里的时间戳是按钮,点一下就从那一秒开始播放。找引文时,关键是要求它“只用原话”,并附上时间:
受访者在哪些地方谈到了收入不稳定?请逐条引用原话,不要改写,每条附时间戳。
受访者前后有没有说法不一致的地方?比如对同一件事给出了不同的时间或评价,请列出两处原话和各自的时间戳。
把这次访谈里与“家庭支持”“平台规则”“职业打算”三个主题相关的原话整理成 Excel 表:主题、原话、时间戳。
第二条对质性研究和新闻采访都很有用:受访者前后矛盾的地方,往往正是值得追问或需要在文中说明的地方。AI 整理出的表格只是起点,编码和判断仍然要由你来做,但你不再需要从零开始翻找。
手上有还没整理的访谈录音? 上传采访录音文件,几分钟后拿到带时间戳的逐字稿 $4 起 500 分钟,分钟数永不过期。单个文件最长 10 小时。 上传访谈录音 →一个例子:12 场访谈的硕士论文
一位社会学硕士生研究外卖骑手的职业选择,访谈了 12 位骑手,每场 60 到 95 分钟,大多用手机录音,导出为 .m4a 文件,共约 900 分钟(以下为虚构示例)。她买了一个 $8 的 1,000 分钟包,一个晚上把 12 个文件全部传了上去。
以 P07 为例:一场 82 分钟的访谈,几分钟后出稿。章节显示“入行经历”从 0:03:40 开始,“平台规则和罚款”从 0:31:20 开始,“对未来的打算”从 1:08:55 开始。她在 AI 对话里用上面的第三条要求,得到这样一张表的开头:
平台规则
- “超时一次扣的钱,比那一单挣的还多。” 0:33:12
- “系统给的时间是按直线算的,它不知道那个小区要绕一圈。” 0:36:47
职业打算
- “干到年底吧,攒够了钱就回老家,跟我哥一起弄个店。” 1:10:05
- “说是回去,其实每年都这么说。” 1:21:38
最后两条正是第二条要求能找出来的那种前后张力。她逐条点时间戳回放,确认原话无误、上下文没有被截断,然后把表格下载下来,合并到 12 位受访者的总编码表里。过去整理一场访谈要花一整天,这次每场的核对和摘引大约用了四十分钟。论文里的引文统一写成“(P07,0:33:12)”,导师问到任何一句,她都能当场放给他听。
录音质量:访谈前花五分钟,整理时省一小时
你会拿到什么
- 逐字稿:每一行都有时间戳,点击任意一行,录音就从那一秒开始播放。
- 智能分析:摘要、带时间戳的章节、关键原话。
- AI 对话:针对这场访谈提问,答案附可以点击播放的时间戳;还能生成 Word、PDF、Excel、SRT 文件,保存在资源里。
- 导出:逐字稿可下载为 TXT、SRT、VTT、DOCX,DOCX 和 TXT 方便放进论文附录或质性分析软件。
- 隐私:录音在我们自己的服务器上转写,不会用于训练任何模型,录音和逐字稿可以随时删除。
价格:$4 起 500 分钟($8 1,000 分钟,$12 2,000 分钟,$24 5,000 分钟),分钟数永不过期,按需购买,通过 Paddle 用银行卡支付。500 分钟大约够转写五到六场 90 分钟的访谈。
常见问题
一个 90 分钟的访谈录音,多久能拿到逐字稿?
大约每小时音频两分钟左右,90 分钟的访谈通常几分钟内就能出稿。文件不用切分,单个文件最长 10 小时、最大 5 GB,一整个下午的焦点小组也可以一次上传。
逐字稿会标出哪句话是受访者说的、哪句是我问的吗?
不会。逐字稿按时间逐行排列,不会自动标出是谁在说话,也不会识别人名。半结构化访谈里问题和回答通常很好分辨;需要正式标注时,可以下载 DOCX,在 Word 里给问题加上“问:”、回答加上“答:”。
受访者说话带口音、夹杂专业术语,转出来能直接用吗?
普通话在支持的 99+ 种语言之内,清晰的录音转出来大部分可以直接阅读。但人名、地名、机构名、行业术语和口音较重的段落一定要核对:点击那一行,录音就从那一秒开始播放,听一遍再改。凡是要写进论文或稿件的原话,都建议回放确认。
访谈内容涉及隐私,录音安全吗?
录音在我们自己的服务器上转写,不会用于训练任何模型。录音和逐字稿可以随时删除,删除账号会清除与该邮箱相关的全部记录。如果你的研究需要通过伦理审查,建议上传前把文件名改成受访者编号,不要用真实姓名。
支持哪些文件格式?手机和录音笔录的可以吗?
支持 .mp3、.wav、.m4a、.mp4、.flac、.ogg、.webm、.mov 等常见音视频格式。手机录音、录音笔导出的文件、线上访谈软件的本地录制文件,都可以直接上传,视频不需要先转成音频。
怎么收费?十几场访谈大概要多少钱?
按分钟数购买,没有订阅:$4 500 分钟,$8 1,000 分钟,$12 2,000 分钟,$24 5,000 分钟,分钟数永不过期,通过 Paddle 用银行卡支付。12 场平均 75 分钟的访谈约 900 分钟,一个 $8 的包就够。
把采访或研究访谈的录音文件上传,几分钟后拿到每行带时间戳、点击即可回放的逐字稿,再用摘要、章节和 AI 对话找出要引用的原话。$4 起 500 分钟,分钟数永不过期。
上传访谈录音文件 →