跨境聊天不全是打字。客户发一段语音说明包装问题,仓库拍一张箱唛,展会上用手机对着菜单或门牌问一句,这些都比干净的文字难处理。HelloGPT翻译器里的语音和图片翻译,是把声音先变成文字、把图片上的字先认出来,再套用当前对话已经设好的语言预设和词库。它不是另开一个与聊天无关的翻译器,而是让多媒体尽量跟文字走同一套规则。
这篇只讲语音和图片:什么时候用、怎么操作、怎样验收、哪些情况不要硬翻。
先分清三件事:识别、翻译、发送
语音翻译包含语音识别和翻译两步。识别负责把说话变成原文字稿,翻译再把字稿变成目标语言。识别错了,后面译得再顺也是错的。
图片翻译包含文字识别和翻译两步。照片虚、反光、字被手指挡住,识别阶段就丢字,翻译只能基于残缺文本发挥。
发送仍要看当前窗口有没有打开发送翻译。你对着麦克风说中文,对方应收到目标语言的文字或语音;只开接收,你这边能看懂客户语音,对方却听不到或看不到你的译文。
文字对话的语言预设没有设对,语音和图片不会自动变对。先保证这条WhatsApp或Telegram对话里,文字双向已经可用,再测多媒体。
语音:适合补一句,不适合代替整场谈判
短说明、报一个数量、确认能否今天装车、问路和叫车,语音最省事。涉及价格条款、责任划分、账号信息,仍应落到文字,让双方都有可回看的句子。
操作上,在已打开翻译的对话里选择语音输入或语音翻译。确认当前语言对,例如中文对英语。环境尽量安静,一句话说完再停,不要在一段录音里混两个人的声音。
看结果时先看转写出来的原文,再看译文。转写把“十五箱”听成“五十箱”,译文再漂亮也不能发。数字、否定词、日期是语音里最要盯的三类。
需要对方也听到声音时,再开语音合成。合成腔调和人名发音可能不准,专有名词仍以屏幕文字为准。嘈杂的仓库和展会,优先出文字,不要依赖合成播报完成交易确认。
连续对话可以开即时字幕或交替说话模式,但要接受识别率会随环境下降。两个人抢着说、背景有广播,系统无法稳定切分说话人。这种场合改回一句一句来。
图片:先拍清楚,再谈准不准
箱唛、铭牌、菜单、路牌、包装上的成分表、白板拍下来的交期,是图片翻译的典型场景。合同整页、复杂表格、印章叠字,不要指望拍一张就当正式译本。
拍照时让文字充满画面,避免倾斜和强光。能分两张拍清楚,就不要一张塞整面墙。识别完成后,先核对有没有漏行、有没有把图标当成字。漏行比错译更危险,因为你可能根本不知道漏了价格旁边的那行限制条件。
对识别出的文本再套当前语言预设。品牌名、型号应走词库里的“不翻译”或固定译文。如果照片里的货号被拆成普通单词,回去补词库,而不是在这一张图上每次手工改。
需要发给客户时,确认发送的是译文、原文还是两者一起。仓库核对箱唛,常常必须带原文编码;只发译文,现场对不上货。
在聊天窗口里的推荐顺序
客户发来语音:先出转写和中文译文,确认问题类型,再用文字或快捷回复回答。不要用另一段含糊语音去回一段含糊语音,错误会叠两层。
客户发来照片:先看图里要处理的是字还是货本身。是字,走识别翻译;是货损、色差,翻译帮不上,要看图说话,必要时让对方补一张带尺和箱号的照片。
自己要发语音:先在输入框用文字写对,确认预览语言,再决定要不要附加语音。对不熟悉的语言,文字预览比“我感觉说对了”可靠。
自己要发图片:图上若有中文说明且对方读不懂,把关键句用文字再发一遍并走发送翻译。不要假设对方会用同样的方式识别你的照片。
准确率下降时,先改采集,再改设置
语音不准,先换安静环境和正常语速,避免方言和口头省略堆在一句里。仍不准,检查语言对有没有拿错,有没有把中文识别器拿去听泰语。
图片不准,先重拍,提高分辨率,关掉闪关灯造成的反光。仍不准,把图裁成只含文字的区域再识别。整张海报连装饰花纹一起送进去,识别负担会无意义地增加。
专有名词反复错,不是多媒体模式独有的问题,是词库没锁。语音转写和图片识别只要产出了该词的字母,词库就应接住。若识别阶段就把型号听错、看错,词库也救不了,只能重说、重拍。
不要用语音和图片硬翻的内容
手写潦草的签字附加条款;印章压在字上的合同页;多栏价格表且有手写改价;账号、验证码、证件号。这类内容出错的代价高于省下的那点时间。改成文件传清晰扫描件,或改成文字逐项确认。
群里同时涌入多条语音,不要一条条自动播报打扰自己。先看转写摘要,选出真的在问你的那几条,再精听。
验收清单
在同一条已能文字互译的对话里:录一句带数字的中文,对方侧或预览出现正确数字的目标语言。收一句对方外语短语音,中文译文数字正确。拍一张带型号的标签,型号完整保留。拍一张简单菜单或门牌,关键行没有漏识。词库里的品牌名在语音转写和图片识别结果中保持指定写法。
语音和图片翻译的目标,是减少“我现在不方便打字”时的中断,不是取消文字确认。采集清楚、先核对识别再发送、数字和型号对照原文,这三步做到,多媒体才能和文字翻译待在同一套可靠规则里。


