改写样本(Rephrased Samples)

13B模型全方位碾压GPT-4?这背后有什么猫腻

你的测试集信息在训练集中泄漏了吗?一个参数量为 13B 的模型竟然打败了顶流 GPT-4?就像下图所展示的,并且为了确保结果的有效性,这项测试还遵循了 OpenAI 的数据去污方法,更关键的是没有发现数据污染的证据。如果你细细查看图中的模型,发现只要带有「rephraser」这个单词,模型性能都比较高。这背后到底有何猫腻?原来是数据污染了,即测试集信息在训练集中遭到泄漏,而且这种污染还不易被检测到。尽管这一问题非常关键,但理解和检测污染仍然是一个开放且具有挑战性的难题。现阶段,去污最常用的方法是 n-gram 重叠
  • 1