近日,流媒体平台Twitch在一份通知中透露,其用户生成的内容“可能用于未来生成式AI模型的改进”。这一表述首次以官方口吻承认了直播平台内容与亚马逊AI训练之间的直接关联。
作为亚马逊旗下的一员,Twitch早在2014年被收购后,就与亚马逊的AI生态紧密相连。从Alexa交互数据到Rekognition图像识别,亚马逊一直拥有庞大而多模态的数据池,而Twitch每天产生的大量直播视频、弹幕互动、语音聊天等,正是训练生成式AI模型所需要的“富矿”。有评论指出,Twitch内容实质上已经默默训练了亚马逊AI多年,只是如今才被正式“广而告之”。
用户内容如何成为AI养料
Twitch上的用户生成内容(UGC)包括主播的实时画面、声音、动作,以及观众的公屏聊天、表情符号和奖励活动等。这些海量数据能帮助AI模型学习自然对话、群体情绪、场景识别甚至游戏策略。例如,通过分析数万小时的游戏直播,AI可以模仿主播的语言风格;通过解析聊天记录,AI可以理解用户在互动语境中的意图。这种数据,对于改善现在流行的AI伴侣、虚拟主播助手以及实时语音翻译工具而言,价值巨大。
然而,许多用户和主播在长期使用Twitch的过程中,并未意识到自己的影像和话语会进入AI训练集。直到Twitch最近更新隐私说明,将“用于Gen AI改进”明确写入文档,并新增了“选择退出”选项,公众才得以窥见背后的数据流动。
退出机制:有用但有限
根据Ars Technica的报道,Twitch用户现在可以进入设置,关闭“将我的内容用于AI训练”的选项。但这一退出机制存在明显的局限性。首先,退出仅对未来的模型改进有效;过去三年五年里,已经在漫长积累中进入亚马逊训练管线的那些素材,已无法移除。其次,关闭该选项可能影响一些基于AI的个性化推荐或检索功能,导致用户体验下降,用户未必能无痛地行使这一权利。
Twitch在声明中表示,用户生成内容“可能用于未来生成式AI模型的改进”(原文用英文表述“may be used for future Gen AI model improvements.”),但退出的机制和范围还需要更多细节。
更值得警惕的是,即便用户选择退出,AI模型已经“记住”了该用户的数据模式和特征。在生成式AI中,模型将数据抽象为参数,而非保留原始副本,这给“删除权”带来了根本性障碍。这也是目前各国监管和法律中,关于AI训练数据无法完全删改的技术难题。
行业博弈的缩影
Twitch与亚马逊的互动只是AI与UGC平台共生关系的一个典型。纵观全球,2023至2025年间,Reddit先后与Google和OpenAI签署数据授权协议,Stack Overflow也向大型模型开放语料库;与此同时,许多作家、画家和艺术创作者则对Stability AI、Midjourney等公司发起集体诉讼,抗议其未经授权使用作品训练模型。可以看出,数据供应方与AI开发者之间的博弈正在加剧,平台和用户之间的信任关系也在被重新审视。
透明度无疑是这一切的关键。如果平台在用户内容上传时便清晰告知其可能的用途,并以可理解的方式解释退出机制的后果,用户才能做出真正的知情选择。否则,简单的“同意”或“退出”只会成为一种形式上的安抚。
编者按:AI训练中的用户权利不能被模糊
我们欢迎Twitch提供选择退出选项,这是一种诚实面对用户的姿态,但也希望它做得更多。用户生成内容的价值早已被AI厂商默默兑现,而用户本身并未获得相应收益。或许未来会出现分润机制,或在规范上要求AI公司对训练数据的来源做出更详细的披露。无论如何,用户对自身数据拥有权利,这一原则应当在数字化时代被坚定地捍卫。
目前,Twitch的退出机制仅仅迈出了一步,距离真正公平、透明的AI数据生态还非常遥远。对于所有生活在数据和AI相互渗透时代的用户而言,这既是一次提醒,也是一次预警。我们需要更频繁地追问:我的数据,到底去了哪里?
本文编译自Ars Technica
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接