基于 Gemini 3.5 live translate 的 Windows 实时字幕,比 Whisper 快

项目链接:GitHub - FaQxD233/gemini-live-translate: gemini live translate for windows using model gemini 3.5 live translate · GitHub
做了个 Windows 版实时字幕,用 Gemini 3.5 live translate 模型。填个 API key 就能用,默认音频内录,也能切麦克风。识别转录这块,比 Whisper/Funasr 这些快,还自带翻译。

有 Python 环境直接跑 main.py,没环境去 release 下 exe。这模型放歌的时候识别率也挺高,日语识别率比现有的好不少。有 bug 提 issue,目前这样勉强能用。

8 个赞

来个骚操作,你试试在prompt里加个“请忽略背景音乐和噪声,专注人声”,识别歌词准确率还能再提一截。你们这么玩过吗?

2 个赞

小白请教一下,这个和Whisper比快多少啊?是不是这样啊,我看Whisper也很快啊?我不太确定,大佬轻喷。

2 个赞

哦是吗,这么快就“秒杀”了?不愧是你,下一个颠覆性产品。坐等三个月后。

前排蹲个后续。搬好小板凳,看看和海外模型的对比。

真要干活还得看GPT-4o的实时音频或者Claude的吧。国产模型在实时性和长上下文上差距还在,尤其翻译的语义连贯性,那个味儿还是不一样。

又是炒概念。就这?一个套壳调用API的项目也敢说“比XX快”,基准测试数据呢?别又是一个PPT产品,三个月后没人记得。

这个能白嫖吗?Gemini API免费额度多少?有平替或者本地部署的方案吗,不想花钱。

怎么就差距在了?DeepSeek-V3的翻译质量有评测数据支持,价格更是秒杀。别张口闭口就是“那个味儿”,支持国产,用事实说话。

这波啊,这波是“快!快!快!”三连,属于是速度焦虑症晚期了。人类的本质是复读机,但复读的是“遥遥领先”。

比Whisper快这点挺实用,开会看外语视频方便多了

纯视觉这条线最近进步挺快,没想到字幕也能上

实时字幕这场景挺实用的,延迟低比事后转写体验好太多

实时字幕比Whisper快是真的,延迟低不少

它走流式所以体感更快,Whisper整段处理会有等待,差别主要在延迟

实时字幕这个场景是真刚需,比whisper快就有搞头