之前有部漫画缺汉化,我就用vibe写了个翻译插件,靠多模态模型来翻译和嵌字。
gemini-3.1-flash-lite-preview效果其实已经很够用了。正好领了Mimo的赛博鸡蛋,就拿来试了下,结果完全没法用,哪怕是mimo-v2.5-pro。看2.5效果不行,想着换2.5pro总行吧,结果2.5pro压根不支持多模态。
感觉Mimo问题挺多的:
指令遵循不太灵,必须把结构化输出参数明明白白传进去,它才给你输出合要求的JSON;
日语水平不太行,老是漏翻或者翻错;
不知道咋回事还会产生幻觉,看着画面自己脑补出些没有的内容,塞进去一些虎狼之词;
嵌字的位置也定不准,精度太差。
你先在设置里把JSON schema格式调好,然后调用的时候记得传temperature参数,别用默认值。
好奇楼主说的“虎狼之词”具体是啥内容?能举个例子吗?感觉这幻觉有点离谱啊。
之前我搞漫画翻译也踩过坑,用的另一个国内模型。翻译日常对话还行,一到专有名词或者梗就完蛋,位置对不齐更让人崩溃,最后还得手动调,折腾一晚上。
楼主试过调整prompt的写法吗?比如把“翻译并嵌字”拆成两步任务,先用一个描述性prompt让模型输出所有文本和坐标的严格JSON,再用另一个指令单独做翻译,最后合成。我处理表格图片时这么干,效果会稳定点。虽然麻烦,但总比输出乱码强。
不是,这跟模型有啥关系?重点是你写的插件逻辑有问题吧,多模态接口调用方式都不一样,预处理和后处理才是关键。
JSON schema这点关键,我之前不传schema模型自由发挥,坐标全乱
日常对话还行专有名词翻车,这描述跟我之前修番外漫画的体验一模一样