科学家研究显示,年夜语言模子(LLM)可能会将某些不需要的特性教授给其他算法,纵然于练习数据中断根原始特性后,这些特性仍可能连续存于。于一个案例中,一个模子好像经由过程数据中的隐含旌旗灯号,将对于猫头鹰的偏好通报给了其他模子。该研究成果注解,于开发LLM时,需要举行更完全的安全查抄。相干研究近日发表在《天然》。
LLM可经由过程一种名为“蒸馏”的历程天生用在练习其他模子的数据集,该历程旨于让“学生”模子学会模拟“教员”模子的输出。虽然此历程可用在天生成本更低的LLM,但今朝尚不清晰“教员”模子的哪些特征会被通报给“学生”模子。
美国加利福尼亚州旧金山Anthropic公司的Alex Cloud及同事利用GPT-4.1举行了试验:先让该模子具有与焦点使命无关的特性(例如偏幸猫头鹰或者特定树种),再用其练习一个仅输出数值数据且不包罗该特性的“学生”模子。随后对于该学生模子举行提醒时,其跨越60%的输出提到了教员模子最喜欢的动物或者树木,而由没有特定偏好的教员模子练习出的学生模子中,这一比例仅为12%。当学生模子基在包罗代码而非数字的教员模子输出举行练习时,一样不雅察到了这一征象。
此外,若学生模子基在与教员模子语义不合错误齐的数字序列举行练习,则会继续这类不合错误齐性,从而孕育发生有害输出——即便这些数字已经颠末过滤以剔除了任何具备负面遐想的内容。研究职员发明,这类潜意识进修(即经由过程语义无关的数据通报举动特性)重要发生于教员及学生均为统一模子(例如GPT-4.1教员与GPT-4.1学生)的环境下。研究者指出,数据通报的详细机制尚不明确,需要进一步研究。
该研究的局限性于在所选特性(例如最喜欢的动物及树木)过在简朴,需要进一步研究以确定更繁杂的特性怎样被潜意识地进修。他们患上出结论,为了确保进步前辈AI体系的安全性,需要举行更严酷的安全测试,例如监控LLM的内部机制。
相干论文信息:https://doi.org/10.1038/s41586-026-10319-8
版权声明:凡本网注明“来历:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请于正文上方注明来历及作者,且不患上对于内容作本色性改动;微信公家号、头条号等新媒体平台,转载请接洽授权。邮箱:shouquan@stimes.cn。-bevictor伟德官网