---
title: "一个量化基金老板，怎么把DeepSeek做成了硅谷的\"东方神秘力量\"？"
date: 2026-09-29
category: 企业动态
site: 脑机网
canonical: https://www.logic.wang/a/njw-09d238
language: zh-CN
---

# 一个量化基金老板，怎么把DeepSeek做成了硅谷的"东方神秘力量"？

> 你能想象吗，一家没有产品经理、几乎没有To C应用、团队才一百来人的公司，却让OpenAI的创始成员公开说"这是苦涩的教训"？

你能想象吗，一家没有产品经理、几乎没有To C应用、团队才一百来人的公司，却让OpenAI的创始成员公开说"这是苦涩的教训"？

这就是DeepSeek，和它的创始人梁文锋。在2025年初那波震动全球AI圈的浪潮里，这家杭州公司的名字反复出现在外媒头条。但梁文锋本人极少露面——他更像一个写代码的极客，而不是 typical 的CEO。这家公司为什么会走一条和所有人都不一样的路？

## 一、从量化到AGI的跨界
梁文锋1985年出生于广东湛江，17岁考入浙江大学电子信息工程专业，后来在浙大读完硕士。2008年他开始研究量化对冲，2015年创办了**幻方量化**——后来成为国内量化私募"四巨头"之一。

做量化的人，天生就迷信数据和算力。幻方很早就重仓AI基础设施：2021年前后投入约10亿元搭建超算集群，装载了超过1万张英伟达A100显卡。当时业内开玩笑说，中国握着最多高端GPU的机构不是AI公司，而是这家量化基金。

2023年7月，梁文锋宣布成立**深度求索（DeepSeek）**，主攻通用人工智能。从第一天起，他就定调：研究优先，暂缓直接做C端产品。这在当时"快变现、抢市场"的AI创业潮里，显得格格不入。

## 二、技术路线上的"反向操作"
DeepSeek最被人记住的，是两次架构层面的"不按常理出牌"。

第一次是**MLA（多头潜在注意力机制）**和**DeepSeekMoE Sparse**结构。当多数公司沿用GPT、Llama的成熟架构稳妥迭代时，DeepSeek直接重写了注意力机制，把显存占用压到传统架构的个位数百分比，推理成本随之大幅下降。2024年5月的V2模型，把推理价格打到每百万token仅约1元，一度被称为"大模型界的拼多多"，还逼得字节、阿里、百度接连降价。

第二次是**纯强化学习训练**。2025年1月发布的R1，尤其是R1-Zero，首次大规模验证了"不用复杂奖励模型、只给极简规则"就能让模型自己顿悟推理。美国艾伦人工智能研究所的研究员评价它为纯RL推动大模型的"开山之作"。

V3在2024年12月发布，R1在2025年1月20日推出，性能比肩OpenAI o1。一整套组合拳下来，DeepSeek把"低成本训练出高水平模型"这件事，变成了行业不得不正视的现实。

## 三、为什么他不急着融资、不急着做应用
梁文锋有一句常被引用的话：真正的挑战从来不是资金，而是高端芯片的出口禁令。这也解释了DeepSeek的克制——既然算力是硬约束，那就把每一张卡的利用率榨到极致，而不是靠堆卡解决。

到2025年，DeepSeek团队仅约139人，却屡屡登上《自然》封面、入选《时代》年度百大。它选择开源、选择不融资，反而换来了全球开发者的免费扩散。对梁文锋来说，AGI更像一场他认为"这代人可能见证"的长跑，而不是一场抢跑。

## 普通人现在能做什么
第一，如果你写代码或做研究，DeepSeek的开源模型（V3、R1及后续版本）是目前成本最低、可本地部署的旗舰级选择之一。个人电脑配一张消费级显卡，就能跑起来做实验。

第二，如果你关心技术趋势，重点看它的"架构创新"而非"参数规模"。MLA、MoE稀疏化这些思路正在被整个行业借鉴，理解它们，你就理解了下一代模型降本的方向。

第三，如果你做投资或创业，DeepSeek证明了"小团队+硬技术+开源"也能撬动巨头。它提醒你：在AI这条赛道上，钱不是唯一的入场券，路线选择同样能决定胜负。

---

来源：脑机网（https://www.logic.wang/）｜原文：https://www.logic.wang/a/njw-09d238
本内容仅供参考，不构成投资建议。
