采访录音转文字:带时间戳的访谈逐字稿,从上传到引用原话

2026年10月4日 · Neugence · 约 6 分钟阅读

做毕业论文的质性访谈、写一篇人物稿、跑一轮用户研究,最后都会卡在同一件事上:手里有十几个小时的录音,却要一个字一个字地听写。按常见的经验,一小时录音手工整理要四到六个小时,而且整理完的文字和录音是分开的,写到一半想确认“这句话受访者原话是怎么说的”,又得回去拖进度条。这篇文章讲的是另一种做法:把采访录音文件直接上传,拿到每一行都带时间戳的逐字稿,点任意一行就从那一秒开始回放;再用摘要、章节和 AI 对话,把要引用的原话连同时间一起找出来。

Have a recording like this? Packs from $4, credits never expire → timestamps, overview. Summary free to read.

先说结论:五步拿到一份能引用的访谈逐字稿

  1. 一场访谈一个文件。文件名用受访者编号和日期,例如 P03_0912.m4a,不要用真实姓名。
  2. 在电脑上上传到 Whipscribe 首页。上传后填写邮箱,大约每小时音频两分钟左右出稿。
  3. 先读摘要和章节。对照访谈提纲,确认每个问题大概在第几分钟被谈到。
  4. 在 AI 对话里按主题找原话。要求只引用原话、每条附时间戳,点时间戳回放核对。
  5. 导出存档。逐字稿下载为 DOCX 或 TXT;让 AI 把引文整理成 Excel 表,文件出现在资源里。

为什么时间戳对访谈特别重要

会议录音整理的是结论,访谈整理的是原话。论文里的引文、稿件里的直接引语、研究报告里的用户原声,都要经得起追问:“他真的这么说了吗?上下文是什么?”没有时间戳的逐字稿只能回答前半个问题,有时间戳的逐字稿两个都能回答,因为每一句都能在几秒内回到录音里重听。

时间戳还让引用格式变得简单。很多质性研究会在引文后标注受访者编号和位置,例如“(P07,00:42:15)”;记者核实引语时,也可以把时间点发给编辑,让对方自己去听。带时间戳的逐字稿,就是一份自带索引的原始资料。

详细步骤

第一步:整理录音文件

访谈结束后,把录音从手机、录音笔或线上访谈软件里导出来。一场访谈保持一个完整文件,不要为了上传方便自己切分:切开之后时间戳会从零重新开始,引用位置就对不上了。

第二步:上传并等待转写

建议在电脑上操作:大文件上传更稳定,后面一边听一边核对也更方便。在首页把文件拖进上传区,上传后填写邮箱,之后用这个邮箱找回逐字稿。普通话在支持的 99+ 种语言之内,一场 90 分钟的访谈通常几分钟就能看到结果。可以一次把几场访谈都传上去,再回来逐个处理。

第三步:先读摘要和章节,再读逐字稿

打开逐字稿后,先看智能分析页:摘要概括这场访谈的主线,章节把一个半小时切成几个话题并标出起始时间,关键原话列出最值得引用的几句。把章节和你的访谈提纲放在一起看,就能很快知道“受访者在第 38 分钟开始谈第一份工作”“家庭话题在 1:05 才出现”,后面细读时直接跳到对应位置。

第四步:核对逐字稿里容易出错的地方

点击逐字稿的任意一行,录音就从那一秒开始播放。不需要把整场访谈从头听一遍,重点核对四类内容:人名和地名、机构和产品名称、行业术语、受访者口音较重或语速很快的段落。凡是准备写进论文或稿件的句子,都值得回放听一次。核对要改的地方,下载 DOCX 后在 Word 里修改即可。

第五步:在 AI 对话里按主题找原话

AI 对话会读完整份逐字稿再回答,答案里的时间戳是按钮,点一下就从那一秒开始播放。找引文时,关键是要求它“只用原话”,并附上时间:

受访者在哪些地方谈到了收入不稳定?请逐条引用原话,不要改写,每条附时间戳。

受访者前后有没有说法不一致的地方?比如对同一件事给出了不同的时间或评价,请列出两处原话和各自的时间戳。

把这次访谈里与“家庭支持”“平台规则”“职业打算”三个主题相关的原话整理成 Excel 表:主题、原话、时间戳。

第二条对质性研究和新闻采访都很有用:受访者前后矛盾的地方,往往正是值得追问或需要在文中说明的地方。AI 整理出的表格只是起点,编码和判断仍然要由你来做,但你不再需要从零开始翻找。

手上有还没整理的访谈录音? 上传采访录音文件,几分钟后拿到带时间戳的逐字稿 $4 起 500 分钟,分钟数永不过期。单个文件最长 10 小时。 上传访谈录音 →

一个例子:12 场访谈的硕士论文

一位社会学硕士生研究外卖骑手的职业选择,访谈了 12 位骑手,每场 60 到 95 分钟,大多用手机录音,导出为 .m4a 文件,共约 900 分钟(以下为虚构示例)。她买了一个 $8 的 1,000 分钟包,一个晚上把 12 个文件全部传了上去。

以 P07 为例:一场 82 分钟的访谈,几分钟后出稿。章节显示“入行经历”从 0:03:40 开始,“平台规则和罚款”从 0:31:20 开始,“对未来的打算”从 1:08:55 开始。她在 AI 对话里用上面的第三条要求,得到这样一张表的开头:

平台规则

  • “超时一次扣的钱,比那一单挣的还多。” 0:33:12
  • “系统给的时间是按直线算的,它不知道那个小区要绕一圈。” 0:36:47

职业打算

  • “干到年底吧,攒够了钱就回老家,跟我哥一起弄个店。” 1:10:05
  • “说是回去,其实每年都这么说。” 1:21:38

最后两条正是第二条要求能找出来的那种前后张力。她逐条点时间戳回放,确认原话无误、上下文没有被截断,然后把表格下载下来,合并到 12 位受访者的总编码表里。过去整理一场访谈要花一整天,这次每场的核对和摘引大约用了四十分钟。论文里的引文统一写成“(P07,0:33:12)”,导师问到任何一句,她都能当场放给他听。

录音质量:访谈前花五分钟,整理时省一小时

手机或录音笔放在你和受访者之间,离受访者更近一点。访谈者的问题通常本来就清楚,受访者的回答才是要引用的部分。
避开咖啡馆、餐厅和马路边。背景音乐和碗碟声对转写的影响,比受访者的口音大得多。条件允许的话,给受访者夹一个领夹麦。
录音一开始口头说一句编号和日期:“P07,九月十二号”。这一句会出现在逐字稿第一行,文件再多也不会混。
线上访谈用会议软件自带的本地录制,不要用手机对着电脑扬声器录。听到人名、地名或专业词时,可以顺口复述一遍,逐字稿里就多了一处清楚的写法可以对照。

你会拿到什么

价格:$4 起 500 分钟($8 1,000 分钟,$12 2,000 分钟,$24 5,000 分钟),分钟数永不过期,按需购买,通过 Paddle 用银行卡支付。500 分钟大约够转写五到六场 90 分钟的访谈。

常见问题

一个 90 分钟的访谈录音,多久能拿到逐字稿?

大约每小时音频两分钟左右,90 分钟的访谈通常几分钟内就能出稿。文件不用切分,单个文件最长 10 小时、最大 5 GB,一整个下午的焦点小组也可以一次上传。

逐字稿会标出哪句话是受访者说的、哪句是我问的吗?

不会。逐字稿按时间逐行排列,不会自动标出是谁在说话,也不会识别人名。半结构化访谈里问题和回答通常很好分辨;需要正式标注时,可以下载 DOCX,在 Word 里给问题加上“问:”、回答加上“答:”。

受访者说话带口音、夹杂专业术语,转出来能直接用吗?

普通话在支持的 99+ 种语言之内,清晰的录音转出来大部分可以直接阅读。但人名、地名、机构名、行业术语和口音较重的段落一定要核对:点击那一行,录音就从那一秒开始播放,听一遍再改。凡是要写进论文或稿件的原话,都建议回放确认。

访谈内容涉及隐私,录音安全吗?

录音在我们自己的服务器上转写,不会用于训练任何模型。录音和逐字稿可以随时删除,删除账号会清除与该邮箱相关的全部记录。如果你的研究需要通过伦理审查,建议上传前把文件名改成受访者编号,不要用真实姓名。

支持哪些文件格式?手机和录音笔录的可以吗?

支持 .mp3、.wav、.m4a、.mp4、.flac、.ogg、.webm、.mov 等常见音视频格式。手机录音、录音笔导出的文件、线上访谈软件的本地录制文件,都可以直接上传,视频不需要先转成音频。

怎么收费?十几场访谈大概要多少钱?

按分钟数购买,没有订阅:$4 500 分钟,$8 1,000 分钟,$12 2,000 分钟,$24 5,000 分钟,分钟数永不过期,通过 Paddle 用银行卡支付。12 场平均 75 分钟的访谈约 900 分钟,一个 $8 的包就够。

把采访或研究访谈的录音文件上传,几分钟后拿到每行带时间戳、点击即可回放的逐字稿,再用摘要、章节和 AI 对话找出要引用的原话。$4 起 500 分钟,分钟数永不过期。

上传访谈录音文件 →