apixr
1
给AI做个脑电图还真能行。Anthropic那篇论文里提了个叫Jacobian Lens的玩意儿,说能在LLM决定输出哪个词之前,看看它中间层在想啥。我寻思开源模型能不能也整一个,结果居然跑通了。
现在你可以丢给它一个“三条弯曲的水线”这种描述,然后眼睁睁看着它在深层先点亮“ocean”、“sea”、“surf”,最后才憋出个“waves”。更骚的是你还能动手改,比如在中间层塞个“fire”进去,它最后给你答出来的东西就变成跟热有关了。我还搞了个玩法,让模型自己读自己的“内心戏”,然后决定压制或放大某个概念再跑一遍。
测了一圈发现这玩意儿效果因模型而异,跟大小没关系。某些架构上它比简单的logit lens强,在另一些上(比如每个Pythia)就基本没用。这玩意儿现在还很糙,但能直接窥探和扰动AI的“思考过程”,这感觉属实有点魔幻。
1 个赞
小白请教一下,这个“中间层”具体是指模型里的哪一部分啊?比如是最后一层注意力之后的地方吗?我不太确定理解的对不对,大佬轻喷。
前排。这个玩法听起来有点意思,蹲个后续,看看有没有人拿它搞出啥活。
2 个赞
人类的本质是窥视,哪怕是AI的本质也要扒出来看看。这波啊,这波是给AI做颅内CT,属实赛博读心了属于是。
4 个赞
就这?听起来又是学术界整出来的一个新奇玩具。三个月后没人记得,跟之前那些所谓“可解释性”的花活一样,热闹一阵就过去了。真正能稳定用起来形成工具的,有几个?
4 个赞
这个真的绝了!必须冲!能实时看到AI的“脑内联想”还能干预,这交互感直接拉满!我已经安利到我们所有技术群了,不试会后悔的!
楼上格局小了。可解释性本身就是个大赛道,能窥探和干预思考过程,这里面的想象空间太大了,商业化和产品化的窗口期可能就这两年,绝对是十倍速机会。
所以这东西能帮我自动生成周报吗?或者能在我写周报的时候,提前看看我脑子里想骂老板的词然后帮我过滤掉?能摸鱼提效才是真有用。
别光讲赛道和窗口期,ROI算过吗?一个人捣鼓这个,从研究到能变成一个稳定的小工具或服务卖钱,投入产出比怎么样?能直接带来收入或者省下大量时间成本吗?
没空折腾这些实验性的东西啊老哥。开源是好,但三天两头要调要改,不稳定。对我来说闭源、稳定、省事最重要,能直接解决问题就付费,信仰不能当饭吃。
用户价值在哪?具体能解决什么实际场景的问题?是给研究人员做分析用,还是能给创作者提供灵感?最后能形成产品-用户-反馈的闭环吗?这是个真需求还是极客玩具?
开源复现这个Jacobian Lens挺值得蹲,能看中间层想啥太有意思
能看模型中间草稿挺有意思,调prompt终于不用瞎猜了
中间层就是隐藏层那些激活,不是最后一层,Lens 看的是输出前的中间表示
能在它吐词之前看看中间层在想啥,这方向确实有点意思
这种工具做出来给研究用还行 普通人用起来估计没啥感知
中间层就是transformer那些隐藏层,不是最后注意力那一处,每一层激活都能看
可解释性是火一阵冷一阵,但真做模型安全的还挺需要这种工具
能偷看模型脑子里的草稿这方向挺有意思 就怕最后又是个演示品