官方演示只有七十多秒最让我停下来看的是两个人中间那台黄色小盒子。一个人说西班牙语设备录下声音屏幕上出现文字。过一会儿另一边听到中文再对着同一台设备说回去。没有掏手机也没有打开常见的翻译 App桌子中间只有一块小屏幕、几个按键、一只麦克风和一只扬声器。它叫 Gemma Translator是 Google Creative Lab 的几位成员做出来的一套开源实验。更准确一点它不是一款可以买回家的消费电子而是一份把离线语音翻译装进树莓派的完整参考答案。我觉得这两个说法差别挺大的。如果把它当成新品发布你很容易只问一句翻得准不准能不能替代手机。可如果把它当成一份参考答案问题就变成了语音识别、翻译和语音播报怎么串起来断网以后哪些环节还能继续跑我又能不能把这条链路改成自己的东西。后面这个问题才是这个黄色小盒子真正有价值的地方。它不是一个模型是三段可以拆开的工作流语音翻译听起来像一个动作实际要过三道关。设备先要听懂你说了什么再把文字从一种语言翻成另一种语言随后把结果念给对面的人听。Gemma Translator 没有把这三件事揉成一个看不见的黑盒而是很老实地拆成了三段。第一段用 Moonshine 做语音识别把麦克风收到的声音变成文字。第二段把文字交给 Gemma 4 E2B由它完成翻译。第三段再用 moonshine-voice 把翻译结果合成语音交给扬声器播出来。听、译、说。这三个字看着很简单但它们决定了你以后怎么排查问题。如果一句人名翻错了你可以继续往下问到底是第一步没听清第二步翻错了还是第三步读错了。每一种错误改的都不是同一个地方。这也是我觉得它比单纯展示翻译结果更有学习价值的原因。很多人用 AI 时只看末端输出效果不好就换模型。可一旦把流程拆开你会发现模型只是链路中的一段麦克风质量、录音方式、语言选择、提示词、语音合成任何一个环节都可能把结果带偏。Gemma Translator 把这条链路直接摆到了代码里。前端负责录音和交互Python 服务负责语音识别、语音合成和请求转发LiteRT-LM 在本机提供 Gemma 的推理服务。你不需要靠猜就能顺着代码找到每一步发生了什么。更关键的是安装和模型下载完成以后这三段都可以留在本机跑。它不需要把现场对话发给云端翻译接口也不会因为临时没有 Wi-Fi 就直接失去核心能力。当然完全离线不等于完全不用联网。第一次装依赖、下载模型时还是要上网项目里的模型下载脚本还会检查磁盘空间。脚本给出的模型文件大约是二点六 GB下载和导入过程要求至少留出六 GB 空间。这个数字是临时存储要求不要把它误解成运行时内存。回到这个小盒子真正被装进去的不是一个神奇按钮而是一条能离线闭环的工作流。普通人最关心的究竟怎么把它跑起来坦率的讲这不是注册一个账号就能用的项目。它更适合愿意动手的开发者、硬件玩家或者真的有断网和本地数据需求的团队。但它也没有难到必须从零写一套系统。官方已经把最容易散掉的部分整理成了几个脚本。如果你只是想先看软件流程可以在 Linux 或 macOS 上准备 Python 三点十以上、Node.js 十八以上和 npm再用现成的麦克风、扬声器和浏览器试跑。想做成演示里的便携设备官方给出的目标硬件是八 GB 内存的 Raspberry Pi 5外加麦克风或 USB 音频输入、扬声器或耳机输出以及一块显示屏。外壳不是只能照着视频自己猜。项目的 stl 目录里已经放了主体、前面板和扬声器支架三个三维打印文件。也就是说软件、部署脚本和外壳结构都给了你一个可以继续改的起点。真正开始时先给四个脚本执行权限。chmodx setup.sh download_model.sh start.sh deploy-pi.sh然后运行安装脚本它会创建独立的 Python 虚拟环境并安装后端依赖。./setup.sh环境好了以后再下载并导入 Gemma 4 E2B 对应的 LiteRT-LM 模型。./download_model.sh模型准备好开发模式直接启动三项服务。./start.sh这条命令会拉起 LiteRT-LM、本地 Python 接口和 Vite 前端。开发界面在本机五一七三端口后端在三千端口模型服务在九三七九端口。如果你已经把前端构建好想按成品方式运行可以用生产参数启动。./start.sh--prod树莓派上还有一条更完整的部署路线。运行 deploy-pi 脚本以后它会安装系统依赖、构建前端、下载模型、注册 systemd 服务并配置 Chromium 的 kiosk 模式。设备开机后自动进翻译界面这一步很重要因为一个要靠人打开终端、敲三条命令才能工作的盒子还不能算真正的设备。说真的安装命令本身并不复杂。真正花时间的地方往往是音频设备、依赖版本、模型下载和树莓派系统环境。第一次搭建时最好把它当成一个周末项目不要预设十分钟就能完成。跑起来以后不是点一下屏幕就结束这个项目的交互也很有意思它不是照搬手机上的对话翻译界面而是按双人面对面的场景设计了两条语言通道。当前代码里提供六种语言阿拉伯语、英语、西班牙语、日语、中文和韩语。两边不能同时选择同一种语言旋钮式语言列表会自动跳过对方已经占用的选项。横屏模式适合一个人控制整台设备。空格键切换当前说话人左右方向键切换这个人的语言按住 Z 开始录音松开以后设备才会执行识别、翻译和播报。竖屏模式更像两个人各管一边。第一位使用 Z 录音第二位使用 X 录音两边也各有自己的语言切换按键。这种设计看起来没有触屏那么直觉但实体按键有一个很实际的好处使用者能清楚知道什么时候开始录、什么时候结束不需要盯着小屏幕找按钮。这里有个边界必须说清楚。README 明确写了当前版本的录音和语言切换主要依靠键盘屏幕上的触控录音还没有启用。演示里的显示屏虽然像触摸屏但不要因此以为拿到任意一块屏就能全程点按操作。这也解释了为什么官方演示里的外壳有几个明显的物理按键和旋钮。那些不是为了做得复古它们真的参与了交互。到这里操作逻辑就顺了。选好两边语言切到当前说话人按住录音松开后等待听、译、说三段完成再把控制权切给另一个人。下面这段就是官方演示里完整设备进行双人对话的画面。它真正的优点不是比手机多一个翻译入口很多人看到这里可能会纳闷手机上已经有很成熟的翻译 App为什么还要买树莓派、接麦克风、打印外壳折腾这么一圈。我非常理解这个问题。如果你只是旅行时偶尔翻一句菜单或者在网络稳定的地方进行日常交流成熟的手机产品大概率更省事。它们有更完整的语言覆盖、更成熟的交互也不用你维护 Linux 服务。Gemma Translator 的价值出现在另一组条件里。当现场网络不稳定或者对话内容不希望经过外部服务器本地闭环就不只是一个漂亮标签。工厂设备检修、封闭展会、野外采集、内部访谈、教育实验这些场景未必都适合直接使用当前项目但它们会让同一条离线路线变得有意义。不是说拿树莓派就能马上进入这些场景而是你终于有了一份可以验证的底稿。麦克风可以换语音识别可以换翻译提示词可以改扬声器和外壳也能重新设计。整套系统在自己手里数据路径和交互路径才有可能按任务调整。第二个优点是成本和行为更可预测。项目不按调用次数计费也不会因为云端接口改版突然失效。但本地运行也有自己的成本模型占空间设备要供电语音模型第一次加载需要等待长期使用还要处理散热和系统维护。第三个优点是它把 AI 从网页里拿了出来。你想想看同一个翻译模型放在聊天框里它只是又一个输入框。装进一台有麦克风、扬声器和物理按键的设备以后模型开始服从一个具体动作按下去听松开翻译再把结果说给另一个人。这种感觉很像早期个人电脑。真正改变使用方式的往往不是处理器单独变强而是键盘、屏幕、软件和任务终于被装进了同一个可以反复使用的形状里。回到这台黄色设备它值得看的也不是 Gemma 4 E2B 单独有多强而是一个开放模型怎样被收进一个具体形状开始服务一段真实的对话。真准备拿来用先别急着打印外壳我觉得最容易踩的坑是看完官方演示就先买硬件、打印外壳直到做完才测试自己的语言和环境。顺序应该反过来。先在电脑或裸板上把最小链路跑通只选你最常用的一组语言再准备二十句短测试。句子里故意放人名、地名、金额、日期、英文缩写和专业词因为日常问候谁都容易翻真正会在现场惹麻烦的往往是这些不能含糊的信息。每句测试不要只记一个对错。把问题分成三类语音识别有没有听对Gemma 有没有翻对moonshine-voice 有没有读对。如果识别阶段就把地名听错了继续改翻译提示词没有用。如果文字翻译正确但播报含糊换更大的翻译模型也解决不了。如果短句稳定、长句开始漏信息那你要测试的是录音长度、识别和提示词边界而不是对着外壳继续加按钮。这个方法不花哨但它能帮你少走很多弯路。测试通过以后再决定交互方式。固定柜台由一个人控制可以用横屏模式。两个人面对面各自操作可以试竖屏模式。现场需要戴手套实体按键可能比小触控区更可靠。需要让不熟悉设备的人直接使用那当前键盘优先的交互还不够你可能要继续开发触控按钮和更清楚的状态提示。然后再做开机自启、音量、散热、电池和外壳。到了这一步三维打印文件才真正开始有价值因为你已经知道自己的麦克风、扬声器和屏幕尺寸而不是为了复制一张好看的照片把不适合的零件硬塞进去。说实话我也不确定每个人都愿意折腾到这一步。但如果你真的需要离线、私有、可改的语音翻译把流程按这个顺序走一遍会比一开始追求成品感更稳。这几个边界决定了它现在更像参考设计官方没有公布统一的翻译准确率、端到端延迟、噪声环境表现和续航数据。演示能证明这支团队做出了一台能完成双人对话的原型但不能证明六种语言、各种口音和专业场景都同样稳定。项目还会按语言动态加载 Moonshine 的语音识别和语音合成引擎代码里给两类引擎都设置了最多缓存两个语言模型。切到新的语言组合时旧模型可能被释放新模型需要重新加载。对八 GB 内存的设备来说这种取舍很好理解但使用时可能出现等待感。另外它不是 Google 正式支持的产品。README 把这句话写得很清楚。你可以学习、修改、做原型但如果要进入医疗、法律、应急这些容错率极低的场景还需要自己的数据测试、异常处理和人工兜底。所以我不会把它推荐成人人都该装的翻译方案。它更适合三类人。想学习端侧 AI 工作流的开发者想做便携硬件原型的创客以及手里确实有断网或隐私约束、愿意继续做场景验证的团队。至于只想马上获得稳定翻译体验的人成熟产品依旧更合适。这不是项目失败而是参考设计和消费产品承担的任务本来就不一样。把 AI 装进一个盒子以后我有时候觉得我们对 AI 的想象被聊天框限制得太久了。每次打开一个网页输入一段话等它吐出另一段话。模型越来越强界面却一直像同一扇窗口。Gemma Translator 做的事情没有多玄学。它只是把麦克风、模型、扬声器和几个物理动作重新绑在一起让 AI 从一个需要被召唤的网页变成桌子中间那件知道自己只负责听、翻译和说话的工具。这台黄色小盒子还远远谈不上完美甚至连触控录音都没有做完。但它给了一个很具体的提醒学会使用 AI不只是在聊天框里研究怎样提问也包括把任务拆开选对模块设计交互再用自己的场景把每一段测明白。开头那七十多秒演示里真正发生的也不只是西班牙语变成了中文。一条原本藏在云端的翻译链路被装进了可以拿在手里的形状。如果你刚好需要断网、私有、可改的语音翻译这个项目值得你花一个周末试一下。如果你不需要也可以把它当成一份很好的样板看看 AI 怎样从一个模型慢慢长成一件工具。