Gemini是不行了,但多模态这块国产还是差得远

之前有部漫画缺汉化,我就用vibe写了个翻译插件,靠多模态模型来翻译和嵌字。

gemini-3.1-flash-lite-preview效果其实已经很够用了。正好领了Mimo的赛博鸡蛋,就拿来试了下,结果完全没法用,哪怕是mimo-v2.5-pro。看2.5效果不行,想着换2.5pro总行吧,结果2.5pro压根不支持多模态。

感觉Mimo问题挺多的:

指令遵循不太灵,必须把结构化输出参数明明白白传进去,它才给你输出合要求的JSON;
日语水平不太行,老是漏翻或者翻错;
不知道咋回事还会产生幻觉,看着画面自己脑补出些没有的内容,塞进去一些虎狼之词;
嵌字的位置也定不准,精度太差。

这玩意儿就那样,用过就知道

是不是我操作有问题啊?试了几次都不太准,小白求带

又来了,国产吹和国外黑日常版聊,没点新鲜的

你先在设置里把JSON schema格式调好,然后调用的时候记得传temperature参数,别用默认值。

好奇楼主说的“虎狼之词”具体是啥内容?能举个例子吗?感觉这幻觉有点离谱啊。

之前我搞漫画翻译也踩过坑,用的另一个国内模型。翻译日常对话还行,一到专有名词或者梗就完蛋,位置对不齐更让人崩溃,最后还得手动调,折腾一晚上。

Mark一下,等个后续。

楼主试过调整prompt的写法吗?比如把“翻译并嵌字”拆成两步任务,先用一个描述性prompt让模型输出所有文本和坐标的严格JSON,再用另一个指令单独做翻译,最后合成。我处理表格图片时这么干,效果会稳定点。虽然麻烦,但总比输出乱码强。

顶,同求好用的方案。

不是,这跟模型有啥关系?重点是你写的插件逻辑有问题吧,多模态接口调用方式都不一样,预处理和后处理才是关键。

国产视觉理解差距明显 文档识别都没ocr稳

JSON schema这点关键,我之前不传schema模型自由发挥,坐标全乱

Gemini还没死透 别急着盖棺定论

日常对话还行专有名词翻车,这描述跟我之前修番外漫画的体验一模一样

你试的是哪个模型 不同版本差距挺大的