报告称 OpenAI 采集了超一百万小时的 YouTube 视频来训练 GPT-4

本周早些时候,《华尔街日报》报道称 AI 公司在收集高质量训练数据方面遇到了困难。今天,《纽约时报》详细介绍了 AI 公司处理此问题的一些方法,其中涉及到属于 AI 版权法模糊灰色区域的内容。报道称,OpenAI 迫切需要训练数据,并开发了 Whisper 音频转录模型来克服困难,转录了超过 100 万小时的 YouTube 视频来训练其最先进的大型语言模型 GPT-4。报道提到,OpenAI 在 2021 年耗尽了有用的数据供应,并在耗尽其他资源后讨论了转录 YouTube 视频、播客和有声读物的可行性。此外,O

本周早些时候,《华尔街日报》报道称 AI 公司在收集高质量训练数据方面遇到了困难。今天,《纽约时报》详细介绍了 AI 公司处理此问题的一些方法,其中涉及到属于 AI 版权法模糊灰色区域的内容。

报道称,OpenAI 迫切需要训练数据,并开发了 Whisper 音频转录模型来克服困难,转录了超过 100 万小时的 YouTube 视频来训练其最先进的大型语言模型 GPT-4。

报道提到,OpenAI 在 2021 年耗尽了有用的数据供应,并在耗尽其他资源后讨论了转录 YouTube 视频、播客和有声读物的可行性。此外,OpenAI 使用了包括来自 Github 的计算机代码、国际象棋走棋数据库和来自 Quizlet 的作业内容。

据报道,OpenAI 公司知道这在法律上存在问题,但认为这是合理使用。《泰晤士报》则透露,OpenAI 总裁 Greg Brockman 亲自参与了所使用视频的收集。

OpenAI 发言人 Lindsay Held 在一封电子邮件中告诉 The Verge,该公司为其每个模型策划了“独特”的数据集,以“帮助他们了解世界”并保持其全球研究竞争力。Held 补充说,该公司使用“众多来源,包括公开数据和非公开数据的合作伙伴”,并且正在考虑生成自己的合成数据。

谷歌发言人 Matt Bryant 在一封电子邮件中表示,该公司“看到了有关 OpenAI 活动的未经证实的报告”,并补充说“我们的 robots.txt 文件(IT之家注:网站与爬虫间的君子协定)和服务条款都禁止未经授权的抓取或下载 YouTube 内容”。

IT之家注意到,YouTube 首席执行官 Neal Mohan 近日在采访中公开表示,尽管没有直接证据表明 OpenAI 使用 YouTube 视频来训练 Sora(文本生成视频的 AI 模型),但警告称这种行为违反了 YouTube 现行的平台服务条款。

Meta 同样也遇到了数据可用性的限制,在《泰晤士报》听到的录音中,Meta 的 AI 团队为了努力追赶 OpenAI,讨论了未经许可使用版权作品的情况。该公司在浏览了“互联网上几乎可用的英语书籍、散文、诗歌和新闻文章”后,显然考虑采取一些措施,例如支付图书许可费用,甚至直接收购一家大型出版商。

相关资讯

苹果、英伟达等公司被曝使用争议 YouTube 资源训练 AI 模型:5.7GB,涉及 4.8 万个频道 17.4 万个视频字幕

非营利性新闻工作室 ProofNews 昨日(7 月 16 日)发布博文,表示包括苹果、英伟达、Salesforce 和 Anthrophic 在内的大型科技公司,在训练其 AI 模型时均使用了来自 YouTube 的视频资源。 报道称这些科技公司在训练其 AI 模型过程中,使用了名为 YouTube Subtitles 的数据集,大小为 5.7GB(4.89 亿个单词)。该数据集由 EleutherAI 创建,最早发布于 2020 年,涉及超过 48000 个频道的 173536 个 YouTube 视频字幕内容

被索赔 500 万美元,OpenAI 遭 YouTube 主播集体诉讼:擅用其内容训练 AI

感谢一位 YouTube 主播上周五向美国加利福尼亚州北区地方法院递交集体诉讼文件,指控 OpenAI 公司在未告知通知视频所有者或向其提供补偿的情况下,擅自抓取数百万个 YouTube 视频脚本,用于训练 AI 生成模型。该主播名为大卫・米莱特(David Millette),来自美国马萨诸塞州,指控 OpenAI 公司抓取其和其他主播创作者的视频,用于训练 AI 模型,涉及的产品包括 ChatGPT、Sora 等等。集体诉讼文件认为 OpenAI 收集这些数据,并得到了“丰厚的回报”,但这种做法违反了版权法和

谷歌 CEO 皮查伊:若 OpenAI 用 YouTube 训练 AI ,公司将采取法律行动

感谢CNBC 消息,谷歌公司 CEO 桑达尔・皮查伊表示:如果确定微软支持的 OpenAI 依赖 YouTube 内容来训练能够生成视频的人工智能模型,谷歌将“解决这个问题”(采取法律行动)。IT之家此前报道,OpenAI 首席技术官在接受采访时语焉不详,无法明确说明 Sora 的训练数据来源。当记者追问具体来源是否包含 YouTube 视频时,她竟然表示“我实际上并不确定(I'm actually not sure about that)”。皮查伊在被问及 OpenAI 是否可能违反谷歌的条款和条件时,皮查伊答道