
智东西(大众号:zhidxcom)编 | 韦世玮
导语:在各类语音转录东西百家争鸣的当下,谷歌开源的Live Transcribe将给人们带来更快捷和新颖的语音体会。
智东西8月19日音讯,近来,谷歌开源了Android语音辨认转录东西——Live Transcribe的语音引擎,源代码现在可以在GitHub上取得。
谷歌期望经过这一方法,可以让任何开发者为长篇对话供给字幕,进一步为安卓语音辨认转录东西的实时转录功用供给动力。
一、两种转录方法,掩盖一切安卓设备
本年二月,谷歌发布了Live Transcribe,该东西经过运用机器学习算法,能将音频转换为实时字幕。
与谷歌即将为安卓推出的Live Caption(实时字幕)功用不同,Live Transcribe是一种全屏体会,它依靠于谷歌云Speech API(语音运用编程接口),能让用户经过智能手机的麦克风或外接麦克风运用。
Live Transcribe实质上是一种交流东西,一方面,它可以用70多种言语和方言来描绘实时白话单词。另一方面,用户也可以经过输入文字来进行转录。
此外,Live Caption和Live Transcribe还有一个首要的差异。Live Transcribe可以在18亿台安卓设备上运用,而Live Caption只适用于部分Android Q设备。
二、怎么处理云上作业的潜在坏处?
现在,谷歌的Cloud Speech API并不支撑发送无限长的音频流。此外,它依靠云来运用的特性,也意味着它在网络衔接、数据本钱和推迟方面都有潜在问题。
因而,语音引擎会在恳求超时之前封闭并重启,还会在长期的静默期间重启会话,以及在检测到语音暂停时封闭会话。 在会话期间,语音引擎还会在本地缓冲音频,当网络从头衔接时便可发送。
依据这些规划,谷歌避免了东西转录时会呈现切断的语句或单词,并削减了对话中丢掉的文本量。 为了下降带宽需求和本钱,谷歌还评价了不同的音频编解码器,包括FLAC(无损音频编解码器)、AMR-WB(新式宽带语音编解码器)和Opus(有损音频编解码器)。
其间,FLAC可以坚持转录的准确性,但不能保存太多的数据,而且具有显着的推迟;AMR-WB可以节约很大都据,但它在喧闹环境中的转录不行准确;Opus答应运用比大大都音乐流服务还要低很多倍的数据速率,还能一起保存音频信号的重要细节。
此外,谷歌还可以在长期的静音期间,经过语音检测来封闭网络衔接。整体而言,谷歌可以在不影响转录准确性的情况下,将数据运用量削减10倍。
为了进一步下降推迟,Live Transcribe运用了自定义Opus编码器,能进步比特率,使推迟在视觉上无法区别发送但未紧缩的音频。
三、Live Transcribe的9项语音引擎功用
谷歌列出了Live Transcribe的9项功用文档,但不包括说话人辨认:
1、无限流媒体;
2、支撑70多种言语;
3、当用户在网络和Wi-Fi之间切换时,可简化网络丢掉。而且文字只会推迟,不会丢掉;
4、对扩展网络丢掉具有鲁棒性,即便网络中止数小时,仍会从头衔接。但没有衔接就无法进行语音辨认;
5、可以轻松启用和装备Opus、AMR-WB和FLAC编码;
6、包括文本格式库,可用于可视化ASR(主动语音辨认)置信度,发言人ID等;
7、可扩展到离线形式;
8、内置支撑语音检测器,可在延伸静音期间内用于中止ASR,以节约资金和数据;
9、内置支撑扬声器辨认,可用于依据扬声器编号符号或上色文本。
该文档还指出,这些库与出产运用程序Live Transcribe中运转的库简直相同。谷歌现已对它们进行了广泛的现场测验和单元测验,但测验自身并不是开源的。
谷歌将为开发人员们供给APK(安卓安装包),让他们可以在不构建任何代码的情况下试用该库。
结语:为人们供给更高效和便当的交流方法
谷歌表明,Live Transcribe是他们与加拉德特大学合作开发的一款运用,专为失聪和听障用户打造,而加拉德特大学是美国榜首所专为失聪及听障人士建立的大学。
这款运用的开源对开发人员们来说,或许能进一步为失聪和听障患者的日子带来更大的便当。一起对普通人来说,也能协助人们更快地习惯各类新的言语环境,供给更高效的交流方法。
文章来历:VentureBeat
