DeepSeek被指“偷窃”,是创新还是侵权?

DeepSeek引发全球关注
发布带来巨大影响
1月20日,DeepSeek发布推理模型DeepSeek-R1并开源模型权重。这一举措产生了极大的影响,它以惊人的性能和成本在全球AI科技圈引发了强烈的震动。其应用登顶苹果中美两地应用商店免费APP下载排行榜,甚至还造成了美股的大幅震荡,让世界各地都开始热议DeepSeek。
美国的指责
美国当地时间1月28日,多名美国官员表示DeepSeek对美国有影响,称其是“偷窃”,要开展国家安全调查。白宫人工智能和加密货币负责人认为DeepSeek可能窃取美国知识产权才得以崛起。这一言论将DeepSeek推到了全球舆论的风口浪尖。
模型蒸馏技术争议
蒸馏技术原理
模型蒸馏是AI大模型主流压缩技术的一种。在这个过程中涉及“教师模型”和“学生模型”。教师模型是压缩前的大模型,学生模型是压缩后的新建模型。对二者输入相同token,引导学生模型输出趋同于教师模型,从而在保留性能的前提下压缩模型,提高推理效率并降低成本。
DeepSeek的争议点
美国方面称有证据表明DeepSeek从OpenAI的大模型中蒸馏知识,OpenAI也表示发现证据,但未提供细节。在AI领域,模型蒸馏是常用技术手段,很多模型都有应用。不过对于模型蒸馏是否合法业内存在分歧,因为AI训练数据的版权问题还在争议中。而目前没有直接证据证明DeepSeek大模型是通过对OpenAI模型的蒸馏,DeepSeek只是用蒸馏技术对自身模型进行迭代优化。

相关案例分析
例如字节跳动曾被曝光调用OpenAI的API并用ChatGPT输出数据训练模型被封禁权限。但DeepSeek情况不同,它的模型有开源的,而OpenAI自GPT-2后闭源,且DeepSeek的思维链技术不太可能通过蒸馏闭源模型获得,同时技术测试表明DeepSeek-R1与OpenAI-o1在表现上有明显差异,DeepSeek也有自己的技术文档说明数据生成来源。
DeepSeek的创新与行业影响
技术创新突破
DeepSeek有很多创新之处。如R1-Zero模型中的强化学习策略,直接将RL应用于基座模型,不经过监督式微调,让模型自我学习。这种方式就像婴儿自己学走路,能达到良好训练结果,这给行业带来很大启发。
成本优势巨大
DeepSeek的超低训练成本颠覆了市场认知。2024年5月其V2模型API调用定价很低,让很多国产AI大模型厂商下调价格,部分甚至免费开放。12月发布的V3模型训练成本仅约550多万美元,而GPT-4o模型训练成本约1亿美元。这得益于其诸如混合专家、低秩注意力等多个创新设计和技术突破。
推动行业发展
Meta成立研究小组研究DeepSeek工作原理来改进旗下模型,苹果CEO库克也认为其对苹果是积极进展。DeepSeek的成功鼓舞了AI初创企业从业人员的信心,它的创新和开源加速了AI行业发展进程,帮助整个行业实现历史性跨越。
中美暗战局势
国际舆论分化
国际舆论对DeepSeek呈现两极分化。特朗普曾予以积极评价,但美国白宫质疑其影响国家安全。意大利下架DeepSeek应用并要求解释数据使用问题,澳大利亚呼吁公民谨慎使用,爱尔兰要求提交用户数据使用报告。
美国的限制措施
美国的态度让市场担忧。美国众议院、海军等都限制使用DeepSeek服务,商务部长提名人称其窃取知识产权并要加强出口管制。Claude创始人要求加强芯片封锁。针对DeepSeek的网络攻击烈度升级,攻击IP地址在美国。而中国的360创始人宣布为DeepSeek提供网络安全防护。
背后的算力因素
有观点认为DeepSeek证明中国突破美国芯片和算力封锁。美国刚签署规则限制他国获取先进GPU,但业内认为未来算力可能不再是AI模型训练瓶颈,这也是市场反应剧烈的原因。
对英伟达的影响
股市的震动
DeepSeek发布新模型后,美股科技股暴跌,英伟达跳水17%,市值蒸发近5900亿美元,其他芯片制造商等也大幅下跌,电力能源股也受波及。
与英伟达的关系
有传言称DeepSeek母公司做空英伟达或绕过其生态,但没有证据表明幻方量化获利或DeepSeek突破英伟达生态。实际上DeepSeek基于Pytorch训练框架,而Pytorch依赖CUDA内核,目前DeepSeek难以绕开英伟达生态,甚至可能增加对其GPU产品的需求。不过DeepSeek确实让投资者重新审视AI科技股估值方式并启发行业思考未来发展方向。

相关问答
DeepSeek被美国指为“偷窃”的主要依据是什么?
美国认为DeepSeek在训练模型时采用的模型蒸馏技术可能从OpenAI大模型中蒸馏知识,但目前没有直接证据表明这一情况。
模型蒸馏技术在AI领域是怎样运作的?
模型蒸馏涉及教师模型和学生模型,对二者输入相同token,让学生模型输出趋近教师模型输出,从而在保留性能情况下压缩模型,达到提高效率和降低成本目的。
DeepSeek在技术上有哪些创新?
DeepSeek的R1-Zero模型将强化学习直接应用于基座模型不经过监督式微调,还有在新模型中引入混合专家、低秩注意力等技术,在有限资源下实现高效资源调度。
为什么DeepSeek的成本很低?
DeepSeek在新模型中采用多种创新设计和技术突破,如混合专家、低秩注意力、多token预测等,使得其在训练和运营过程中能更高效利用资源,从而降低成本。
美国对DeepSeek的态度会对中美AI竞争产生什么影响?
美国对DeepSeek的限制态度可能会使中美AI竞争局势更加紧张,引发更多关于知识产权、技术封锁等方面的问题,也可能促使中国在AI领域更加自主创新。
DeepSeek会对英伟达的行业地位产生威胁吗?
目前DeepSeek难以对英伟达的行业地位产生威胁,因为DeepSeek基于依赖CUDA内核的Pytorch框架,难以绕开英伟达生态,甚至可能增加对英伟达GPU产品的需求。

