发布日期:2025-02-04 23:59 点击次数:65
近期,DeepSeek出圈火爆全球,在美区苹果商店总榜和国内免费榜DeepSeek大模型App同时登顶,成为首个在C端市场超越ChatGPT的中国AI应用。
前段时间,雷军“千万年薪挖角95后AI工程师罗福莉”的新闻刷屏社交网络。这位被争抢的天才少女,此前正是DeepSeek(深度求索)的核心成员。而DeepSeek的创始人梁文锋,一个低调的80后技术极客,也因这场人才争夺战被推至台前。有人调侃:“雷军挖走的或许是一个天才,但梁文锋的DeepSeek,正在批量生产天才。” 这句话并非夸张。
有负责AI领域的猎头披露,DeepSeek核心团队成员的跳槽溢价已达300%-500%,一名3年经验的算法工程师年薪可超500万。“这行现在只有两种人:DeepSeek系,和其他人。
2024年5月初,DeekSeek对外宣布,其开源模型DeepSeek-V2的推理成本被降到每百万token仅 1块钱,约等于GPT-4 Turbo的七十分之一。随后,智谱、豆包、通义千问、文心一言等国内排名靠前的大模型先后跟进,最高降幅甚至高达97%经此一役,DeepSeek解锁了一个新绰号——AI界的拼多多。
《纽约时报》评价:“这家中国初创公司用600万美元和2000块芯片,打破了‘只有巨头才能玩转AI’的铁律。”
而DeepSeek创始人梁文锋的故事,是一部典型的“技术派逆袭剧本”
1985年,他出生于广东湛江,2002年考入浙江大学电子信息工程专业,从此与代码和算法结缘。
2008年全球金融危机期间,还在读研的他带领团队尝试用机器学习预测金融市场,这段经历让他意识到:算法不仅能解数学题,还能解现实世界的难题。
2013年,他与同学徐进创立量化投资公司“幻方科技”,凭借高频交易策略在2015年股灾中逆势盈利,管理规模迅速突破千亿,成为国内量化私募“四大天王”之一。但梁文锋的野心不止于此——用AI重新定义生产力才是他的终极目标。
2019年,他砸下2亿自研“萤火一号”AI训练平台;
2021年,“萤火二号”投入增至10亿,搭载1万块英伟达A100显卡。
这些看似疯狂的投入,在2024年迎来质变:DeepSeek成立仅一年,便推出震惊硅谷的V2、V3大模型。
有Meta员工在匿名社区teamblind爆料:“我们的AI团队正在通宵拆解DeepSeek代码,试图破解他们的成本魔术。”
DeepSeek的崛起,颠覆了外界对中国科技的三大刻板印象:
1. 95后团队如何硬刚硅谷巨头:团队平均年龄28岁,核心成员清一色清华、北大、浙大毕业生,零留学背景。他们用“土法炼钢”式的创新,在算力受限的情况下,通过混合专家模型(MoE)架构和动态稀疏计算,硬生生将模型效率提升3倍。“我们可能没有全球前50的顶尖人才,但我们可以自己造。”梁文锋的这句话,成了中国年轻工程师的集体宣言。
2、用“轻量化路线”破解芯片困局:当美国切断高端GPU供应,DeepSeek选择了一条“反共识”道路:不盲目堆算力,而是通过算法优化和数据蒸馏技术,让2000块芯片发挥出2万块的效能。这种“螺蛳壳里做道场”的智慧,正如《经济学人》评论:“中国正在用‘系统级创新’对抗‘卡脖子’。”(来源:《经济学人》)
3、从量化投资长出的AI基因:与其他AI公司不同,DeepSeek的血液里流淌着金融市场的实战基因。梁文锋将量化交易中锤炼出的极致成本控制和动态博弈思维注入AI研发:用强化学习模拟市场博弈、用分布式训练降低试错成本、甚至借鉴高频交易的“微秒级响应”优化模型推理速度。这种跨界融合,恰是硅谷巨头难以复制的“中国式创新”。
DeepSeek的爆火,或许暗示着中国AI的新叙事——不再追随既有规则,而是重新书写规则。DeepSeek的故事远不只是一家公司的成功。它传递的是一代人的信号:在技术爆炸的时代,本土经验可能比海外光环更具穿透力;在制裁围堵的背景下,系统创新比单点突破更能破局;在巨头垄断的领域,年轻团队可以用“反共识”打开新战场。
上一篇:没有了


