点开图片就给你推遐蝶手办?对话海外大厂资深搜推算法专家傅聪

点开图片就给你推遐蝶手办?对话海外大厂资深搜推算法专家傅聪
家里那台电瓶车侧翻的时候我没想到后面的事情会这么离谱。上个周末我的电瓶车后排脚搭的塑料件摔坏了整个部件不翼而飞。当时只是随口吐槽了一下回头打开某电商平台这个我不知道名字的配件赫然出现在了首页推荐我理所应当地下单、收货、安装严丝合缝。如果不是平台推荐我到现在都不知道那个塑料件该搜什么关键词。这事发生在 7 月中旬几乎同一时期微信群里一份聊天记录也在疯传两件事让我惊叹如今电商平台推荐系统的强大同时也想质问用户究竟有多少隐私暴露在这些平台之上我把这两件事告诉了傅聪老师他看到了那条截图让同事也试了一下没复现出来。“可能跟我们在新加坡地区有关。”傅聪海外大厂资深搜推算法专家也是 NSG、SSG、PSP、MAG 等向量检索算法的作者生成式搜推模型 OnePiece、ReSID、ManCAR、OneRank 等范式的主导发明者生成式推荐领域的领军人物。可以说国内在搜推原创算法这条路上持续做出理论级贡献的开发者不多他是其中之一。这次对话的开场就是这两次精准过头的首页推送。“这个问题分两层”他说“第一一个 APP 能通过什么合法渠道获取信息第二有了多模态信息怎么实现推荐。”正常的 APP 不可能直接监控所有用户权限。手机系统对权限做了多层分级——麦克风监听、屏幕录屏、相册完全访问都需要专门授权。APP 从前台切到后台后能获取的权限会变化不能监控其他 APP 的状态。当然技术上也存在绕过系统权限的黑客级手段但正规软件厂商通常不会跨过这条边界。“如果一款 APP 在 iPhone 上出现越狱级别监控用户信息并且有明确证据最严重的后果可能是被 App Store 永久下架惩罚力度非常大。”另一个层面是多模态检索。“现在大模型识图能力已经很强了识别图中的元素、文字都很容易。如果用户授权比如点击语音或上传图片按钮我们可以借助多模态大模型提取用户意图和核心要素并发产生多种召回请求生成候选商品最后按与多模态输入的相关度选出相似商品——这是很容易实现的事情。”也就是说这两件事的核心矛盾并不是技术问题而是权限问题。我顺势问了傅聪老师团队是否会面临这方面的问题傅聪老师笑了笑“我们这边确实不搞这些。海外的 APP 在这方面管理非常严格至少我没听说过有团队会往这个方向动心思。”浙大博士和一篇算法论文我们把时间拨回十年前傅聪跟搜推算法的纠缠从学生时期就开始了。“回顾起来NSG 是我读博期间做的。出发点是一个纯粹的科研问题。”那是在 2016 到 2017 年他在读博期间发表了 NSG 算法的论文。当时 HNSW 算法刚提出来不久基于图的向量检索算法还是个小众领域。HNSW 的出现也带来了一个没被回答的问题基于图结构的向量检索算法为什么有效传统向量检索算法如 PQ有点像收纳把柜子分成不同区域每个区域有独立特点拿到一个向量后根据特点找到对应区域再获取相似向量。但 PQ 等传统算法运行效率很差没法在几毫秒内返回最相似的 Top 500 个向量很难在工业界落地。“我当时在淘宝主搜实习时印象很深深度学习刚刚兴起何凯明他们的 ResNet 2015 年才出现那时还没有大模型。向量检索主要应用在电商、视频、图文的推荐和搜索平台比如‘拍立淘’就是以图搜同款只能用向量去做。”在电商场景下用户对搜索反馈的延迟要求非常敏感点了搜索按钮后2 秒内就要返回结果。整条链路里图片经神经网络提取向量、向量检索相似商品、精细排序留给向量检索的时间通常只有 50 到 100 毫秒。传统的 PQ 算法没法在这个耗时下达到 95% 以上的精度。当时的 HNSW 做到了比 PQ 快很多但它的短板也很明显在数十亿商品库这种量级的电商平台场景下需要的内存太大。厂商不能无限制地给一个算法堆内存硬件成本扛不住。傅聪团队研究的 NSG 算法做了两件事。第一在理论上首次证明了图算法的最优性 —— 延迟对数据规模不敏感例如 1 亿条数据 10 毫秒返回30 亿、40 亿条数据返回也只膨胀到 13、14 毫秒第二在达到相同效率的情况下NSG 需要的内存大约是 HNSW 的三分之一。凭借这些亮点NSG 被阿里巴巴的中台系统采用同时给蚂蚁等集团提供向量检索服务慢慢地被更多大厂集成在业内颇有名气。可以说在前大模型时代的传统电商、搜索推荐广告场景中由于企业更重视成本只要集团中台集成了 NSG基本都会选 NSG——内存消耗小稳定性强而且 NSG 有真正的数学理论支撑。但在全球开源生态中HNSW 仍然是更流行的那个。靠着团队的持续运营HNSW封装成各种接口集成到 Elasticsearch、Zilliz 的Milvus、Meta的Faiss等知名开源框架中分布式调用方案成熟用户拿来即用。然而彼时的傅聪尚是一名博士生在完成算法设计、论文发表和 Demo 提交后他的工作便暂告段落无暇顾及后续的开源社区维护。但NSG 后来却凭借过硬的性能与深厚的理论功底脱颖而出不仅被大厂广泛采纳为超大规模向量检索的优先算法更成为该领域里程碑式的成果屡屡出现在国际顶会的Tutorial讲台上。在大模型时代到来之后企业选向量检索算法的逻辑也变了。以前重成本内存小、稳定性强就是优势。现在用户对耗时的容忍度大幅拉高跟 Agent 聊天或写代码一次请求几十秒到几十分钟中间插入一个检索节点100 毫秒还是 300 毫秒用户几乎没有感知。在这种场景下使用算法的方便性决定了技术选型优先级。开源生态更成熟、工业级库更丰富的 HNSW 成为了行业公认的第一选择。四个算法十年迭代从 NSG 之后傅聪连续迭代了 SSG、PSP、MAG 三个算法每一个都为了适配当下的使用场景。NSG 在理论证明了最优性之后傅聪发现它并不是最完备的它的图结构对不同数据分布不能自适应扩展。于是他发明了 SSG给图结构加上了一个自由度可以适应不同数据形态或分布调整图结构的稀疏程度和结构特性。这是 NSG 和 HNSW 都没有的——HNSW 只能调整图的尺寸大小不能调整节点之间连接边的模式比较僵化。从 SSG 之后向量检索进入了大模型时代。GPT-3 在 2020 年发布几乎重塑了整个机器学习的范式。传统的神经网络提取向量在欧式空间里计算距离但大模型时代最常用的相似度度量是余弦相似度或内积点积跟欧式距离有本质差异。“很多人会误用度量直接用 HNSW 套框架去构建向量引擎。”傅聪说。在某些大模型提取的向量里用错了度量空间召回精度甚至会趋近于 0%。于是傅聪团队专门为余弦/点积相似度设计了 PSP 算法。到 2024 年欧式空间的向量检索已经研究得非常透彻在做各种规模化和数据库产品化但基于内积和余弦的向量数据库还处在非常早期、没有理论支撑的阶段。PSP 就是在这个空缺上做了数学理论推导寻找内积空间上的检索最优性。但大模型产生的向量度量的向性往往不是非此即彼的。欧式和内积之间有一个过渡地带。傅聪团队发现如果构建图结构时用混合度量效果会更好。MAG 就是把两种特性融合到一套索引里的方案先跑一个简单的诊断脚本就知道数据偏欧式还是偏内积然后自动输出最优配置。发明 MAG 的初衷很简单用户不需要懂复杂的算法原理和数学知识主打拿来即用。在做 MAG 的时候傅聪也发现了现在整个向量检索或 RAG 都在退火——用户不再关心用什么算法只希望拿来就能用。但向量检索不是一个 demo 算法就能拿来用的用户要的是像 pgvector 或 Milvus 那样成体系化的数据库不止向量检索还要能数据库查询、文本检索。“如果真的想把 MAG 推广出去我们要自己去提交适配版本——改造成 Java 版接口提交给 Elasticsearch改造成其他语言的版本提交到知名的工具库。但提交上去之后对方也没有义务帮你推广。而向量检索环节再精、再灵活用户下游的感知其实没有那么强它已经成为一个超长链条里很小的环节了。”IcebergAI 时代的新标准Iceberg 这个新的向量检索算法评价基准原本是傅聪推广自己算法的一次尝试。“推出 Iceberg 也是为了呼应 PSP 和 MAG希望更多人看到它们。笑”话虽如此但这个新的标准解决了一个很现实的问题学术界还在用传统 benchmark 评价向量检索效能只关心传统神经网络产出的向量在欧式距离上的精度把问题做得非常细、非常局部这和工业界实际应用之间存在巨大的鸿沟。前面也提到在 AI 大模型时代最常用的相似度度量是余弦相似度或内积点积跟欧式距离有本质差异。“每篇论文都说自己的算法好但拿去产品里一用发现不是那么回事。每年 KDD、VLDB、SIGMOD 那么多算法论文业界不可能每一篇都拿去尝试。”拉出来跑个分更简洁也更直观。Iceberg 做的事就是把所有向量检索算法全部拉到一个新的竞技场里用大模型时代的新向量数据集去看下游指标哪个算法跟哪个模型适配性最好。Iceberg 上传到 Hugging Face 的首周下载量就达到了几百次这在向量检索算法这个小众领域算是非常不错的成绩。“大家都很关心在大模型产出的新向量上算法的排位是什么样的。”OnePiece生成式搜推在向量检索算法这条“小众赛道”上奔跑了十年傅聪不断地尝试拥抱新的变化。2024年以前所有厂商最大的推荐模型只算深度网络部分不含embedding只能到几千万参数。而同期的大模型随便拉一个出来都已经是千亿级别差了十几个数量级。那么能不能用大模型的思路用Transformer重构推荐系统让推荐也有Scaling Law越大越好很多人开始投入了几百上千张显卡去尝试这件事。但有一个根本问题没被回答大推荐模型和大语言模型本质上真的是一回事吗“如果花了几个亿最后发现很多地方不能照搬技术不能借鉴那对公司来说是一个灾难性的投入等于走进了死胡同。”OnePiece就是回答这个问题的。没错傅聪老师也是海贼王的粉丝傅聪说大推荐模型和大语言模型非常相似很多大模型有的特性大推荐模型也有比如上下文工程、推理能力。但应用方式完全不一样。CoT让大模型模拟人的思维模式第一步做什么第二步做什么。但推荐系统没有语言体系它只是一串按时间排好序的商品或视频序列两个商品之间没有语义转移关系没法简单地构建思维链。所以推荐系统需要定制化的上下文工程和隐式推理——不在文本空间解码思考过程在特殊数学空间做推导。这个方向大语言模型学术界也在同步推进。最新的隐式推理技术在隐藏空间里做3到5步推理效果和写三四千token的CoT差不多甚至更好。“在这个方向上OnePiece已经做到了和大语言模型隐式推理技术对等的水平。”目前OnePiece 2.0 和 3.0 版本都已经在Shopee内部先后部署属于平台推荐系统和搜索引擎的核心部分覆盖平台在东南亚和拉美地区的主要流量。值得一提的是OnePiece框架在Shopee部署后平台商品销售总收入提升1.8个百分点广告营收提升3.3个百分点。作为对比接近饱和的传统判别式模型迭代单次实验往往只能带来零点几个百分点的提升。求变还是坚守访谈到了最后我问了傅聪老师一个不太好回答的问题做向量检索的人有感到被市场“冷落”吗“拥抱变化。”他的回答很直接资本在哪个方向下一代的应用、产业价值潜力就在哪个方向出现重应用、轻底层这种现象其实很合理。“除了直接卖 Token 或卖铲子的厂商我们还没看到太多扎扎实实落地、带来收益增长的明星公司Cursor 算一个。”AI 到底带来了什么提升办公效率、代码开发效率怎么度量真正应用了智能体开发后代码写得很快但代码评审环节产生了巨大瓶颈。AI写的大量代码不敢直接上线上线后的收益很难归因到AI的助力导致你没法评估这件事的ROI。所以所有人都在快速找应用场景先 PR、先推广、先卡位。先野蛮生长再从蓝海变红海然后做精细化运营优化底层每个环节——所有技术都走这个成长曲线。讽刺的是像傅聪团队这样做推荐系统是确确实实帮公司赚到了钱的而很多明星 AI 公司却一直在亏钱。“OpenAI、Anthropic不盈利也能上市几千亿美金估值很多盈利的传统平台却做不到千亿美金体量很难融资。这是资本市场的导向问题更看重未来。”在学术界他也确实感觉到冷落——做推荐算法的论文投稿属于小众赛道即使做出来非常创新的算法关注的人也寥寥无几。“你必须去蹭主动跟大模型结合。早结合比晚结合好因为你不知道大模型会怎么改变产品形态。只能主动去探索找到契合点。假设有一天出现了更多脱离办公场景和代码研发的爆款AI应用你的知识体系和工作模式脱节了那才是最危险的。”那个摔坏了的塑料件我还是不知道叫什么名字我也没法证明那天电商平台的推送到底是不是巧合。但傅聪从NSG做到OnePiece的这十年是一条不太显眼但很扎实的叙事每个时代都有新场景每个场景都在改算法改完之后发现时代又变了再继续去适应时代。最后一圈跑下来他没有等在原地抱怨曝光不够而是自己站到了AI的牌桌边上。本期嘉宾傅聪Shopee新加坡资深算法专家浙江大学计算机博士毕业曾赴美国南加州大学访问研究其主导发明的 NSG、SSG、PSP、MAG 等高性能检索算法已落地为千亿级向量检索系统成为工业界大规模检索的标杆方案之一他提出的生成式搜推模型OnePiece、ReSID、ManCAR、OneRank等范式则是领域内开创性的工作不仅在大型电商平台取得显著商业价值也为“超级推荐智能”时代奠定了重要基础。在 TPAMI、KDD、VLDB、SIGIR、IJCAI、EMNLP、CIKM 等顶级会议或期刊发表论文二十余篇长期担任 TPAMI、ICLR、NIPS、ICML、KDD、TKDE、SIGIR、AAAI、IJCAI、EMNLP 等国际会议审稿人。目前专注于 大模型、智能体、生成式推荐等技术大规模应用落地方面的研究。