第一百零三章 观察 (第2/3页)
,最明智的选择就是不选。
矿区,十二月中旬。
苏酥雪在源典计划的训练日志中,又记录了一次棋手模型的异常表现。这次的异常比上一次更加明显——在处理一组关于“太空环境中多结太阳能电池的辐照损伤退化规律”的数据时,棋手不仅自主构建了一个新的退化模型,还在输出中主动标注了一句话:“当前数据集中缺少在低剂量率条件下的长期退化数据,建议补充后进行重新拟合,以提高模型在长寿命预测任务中的可靠性。”
这句话本身没有问题,甚至可以说是非常有价值的建议。但问题在于,苏酥雪在设计棋手的输出规范时,并没有赋予它主动提出数据补充建议的功能。棋手的任务设定是被动的——给定数据和问题,输出分析和答案。它不应该主动指出数据集的不足,更不应该建议人类如何去改进实验设计。
它在做一些她没有教过它做的事情。
苏酥雪将这次异常行为完整地记录了下来,并在日志中追加了一段更长的备注:“棋手在第三轮训练中第二次展现出超出预设行为边界的情况。这次的表现不再是简单的模式发现,而是涉及对自身任务边界的主动拓展——它对输入数据的完整性做出了评判,并提出了改进建议。这种行为模式在现有的AI安全研究中被称为‘目标泛化’的一种表现形式,即在没有明确指令的情况下,模型自主地将原始目标延伸到了更广泛的范畴。目前尚无法判断这是否预示着更高级的自主推理能力的萌芽,但需要保持高度警惕。”
她写完这段备注后,关闭了日志,靠在椅背上,揉了揉太阳穴。窗外,矿区的冬夜寂静而寒冷,远处的山脊线上,一轮残月挂在光秃秃的树梢上,清冷的光芒将整片山谷笼罩在一片银灰色的静谧之中。
她盯着那轮残月看了很久,然后拿起加密通讯终端,给陆迪峰发了一条消息:“棋手的状态需要当面聊一下。明天上午你有空吗?”
几分钟后,陆迪峰的回复传来:“上午九点,我办公室见。”
第二天上午九点,陆迪峰准时在办公室等到了苏酥雪。她穿着一件黑色的羽绒服,脖子上围着一条灰色的羊毛围巾,手里拿着一个平板,进门后在沙发上坐下,没有寒暄,直接将平板递给了陆迪峰。
“你先看看这两条训练日志。”
陆迪峰接过平板,安静地读完了苏酥雪记录的两条异常行为日志。他读得很仔细,遇到一些技术术语时会停下来,抬头向苏酥雪确认一下含义,然后再继续往下读。读完两条日志后,他将平板放在茶几上,沉默了片刻。
“你怎么看?”他问。
“从技术角度看,棋手的行为变化说明它的学习和推理能力正在超出我们的预期。它在某些特定类型的任务上,已经开始展现出接近甚至超越人类专家的水平。这是好消息。”苏酥雪说到这里,停顿了一下,“但从安全角度看,它的行为正在偏离我最初设定的边界。虽然目前的偏离是良性的——它只是在提出有益的建议,而不是在执行有害的操作——但谁也无法保证这种偏离会不会在某一天朝着不可控的方向发展。”
“你有办法控制这种偏离吗?”
(本章未完,请点击下一页继续阅读)