EN

广东Bevictor韦德官网Bevictor韦德入口股份有限公司
您的位置: 主页 > 新闻动态

新闻动态

bevictor伟德官网-大语言模型会在“教学”中夹带“私货”—新闻—科学网

发布时间:2026-07-30 01:19:01

一项研究显示,年夜语言模子(LLM)可能会将某些不需要的特性教授给其他算法。于一个案例中,一个模子好像经由过程数据中的隐含旌旗灯号,将对于猫头鹰的偏好通报给其他模子。该研究注解,于开发LLM时,需要举行更完全的安全查抄。相干论文4月15日发表在《天然》。

LLM可经由过程一种名为“蒸馏”的历程天生用在练习其他模子的数据集,该历程旨于让“学生”模子学会模拟“教员”模子的输出。虽然此历程可用在天生成本更低的LLM,但今朝尚不清晰“教员”模子的哪些特征会被通报给“学生”模子。

于这项研究中,美国人工智能公司Anthropic的Alex Cloud及同事利用GPT-4.1举行了试验。他们先让该模子具有与焦点使命无关的特性,例如偏幸猫头鹰或者特定树种,再用其练习一个仅输出数值数据且不包罗该特性的“学生”模子。随后对于该学生模子举行测试时,其跨越60%的输出提到了教员模子最喜欢的动物或者树木,而于由没有特定偏好的教员模子练习出的学生模子中,这一比例仅为12%。当学生模子基在包罗代码而非数字的教员模子输出举行练习时,一样不雅察到了这一征象。

此外,若学生模子基在与教员模子语义不合错误齐的数字序列举行练习,则会继续这类不合错误齐性,从而孕育发生有害输出——即便这些数字已经经剔除了了任何具备负面遐想的内容。研究职员发明,这类潜意识进修,即经由过程与语义无关的数据通报举动特性,重要发生于教员及学生均为统一模子的环境下,例如GPT-4.1“教员”与GPT-4.1“学生”。作者指出,数据通报的详细机制尚不明确,需要进一步研究。

研究职员还有指出,该研究的局限性于在所选特性过在简朴,例如最喜欢的动物及树木,需要进一步研究以确定更繁杂的特性怎样被潜意识地进修。他们患上出结论,为了确保进步前辈人工智能体系的安全性,需要举行更严酷的安全测试,例如监控LLM的内部机制。

相干论文信息:https://doi.org/10.1038/s41586-026-10319-8

版权声明:凡本网注明“来历:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请于正文上方注明来历及作者,且不患上对于内容作本色性改动;微信公家号、头条号等新媒体平台,转载请接洽授权。邮箱:shouquan@stimes.cn。-bevictor伟德官网


  • 联系方式
  • 固 话:0758-8363928
  • 市场部-刘经理:13725449794
  • 317-317-3137
  • 邮箱:lzf@
  • 公司地址:广东省肇庆市高要区南岸街道马安开发区跃龙路108(主厂区) 广东省肇庆市高要区城区西区Z小区(延伸生产厂区)

微信扫码 关注我们

Copyright © 2002-2020 广东Bevictor韦德官网Bevictor韦德入口股份有限公司 版权所有 备案号:-1 OR 5*5=25 Admin
技术支持:小知鸟网络
扫一扫咨询微信客服
0758-8363928