Kimi开源底层推理框架,1小时GitHub揽星1.2k

ze10个月前默认362

声明:本文来自于微信公众号 量子位,作者:一水,授权站长之家转载发布。

什么?Kimi底层推理架构刚刚宣布:开!源!了!

你没听错,就是那个承载了Kimi线上80%以上流量的架构。

大约几小时前,月之暗面Kimi联合清华大学等机构,开源了大模型推理架构Mooncake。

根据官方介绍,本次开源将采用分阶段的方式:

逐步开源高性能KVCache多级缓存Mooncake Store的实现,同时针对各类推理引擎和底层存储/传输资源进行兼容。

其中传输引擎Transfer Engine现在已经在GitHub全球开源。

可以看到,Mooncake一经开源,已在GitHub狂揽1.2k star。

其最终开源目标是,为大模型时代打造一种新型高性能内存语义存储的标准接口,并提供参考实现方案。

月之暗面Kimi工程副总裁许欣然表示:

通过与清华大学MADSys实验室紧密合作,我们共同打造了分离式大模型推理架构Mooncake,实现推理资源的极致优化。

Mooncake不仅提升了Kimi的用户体验,降低了成本,还为处理长文本和高并发需求提供了有效的解决方案。

我们相信,通过与产学研机构开源合作,可以推动整个行业向更高效的推理平台方向发展。

实际上,这个项目早在今年6月就已启动,当时已受到业内广泛关注——

大模型推理架构Mooncake

今年6月,月之暗面和清华大学MADSys实验室联合发布了Kimi底层的Mooncake推理系统设计方案。

在这篇名为《Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving》的论文中,作者详细介绍了Mooncake这种系统架构。

该系统基于以KVCache为中心的PD分离和以存换算架构,大幅度提升了推理吞吐。

具体而言,Mooncake采用以KVCache为中心的解耦架构,将预填充集群与解码集群分离,并充分利用GPU集群中未充分利用的CPU、DRAM和SSD资源,实现KVCache的解耦缓存。

其核心在于以KVCache为中心的调度程序:

在最大化整体有效吞吐量和满足与延迟相关的服务级别目标 (SLO) 要求之间取得平衡

当面对流量高峰期时,Mooncake通过早期拒绝策略和预测未来负载的方法,来处理超载问题。

简单说,其核心思想是在请求实际开始处理之前,根据当前系统的负载情况预测是否有足够的资源来处理新的请求。

如果预测结果表明系统资源不足以保证请求的及时处理,系统就会在请求到达之前予以拒绝,从而避免了无效的资源占用和不必要的延迟。

在Mooncake中,系统需要能够预测在未来一段时间内的负载情况,以便做出更准确的接受或拒绝请求的决策。

如何实现呢??

通常来说,这种预测会基于当前的请求模式、系统的资源使用情况以及历史数据等信息。

再通过对信息的进一步分析建模,Mooncake就能够估计接下来的请求处理需求,并据此调整其调度策略。

论文实验结果显示,与基线方法相比,Mooncake在某些模拟场景中可以实现高达525%的吞吐量提升,同时遵守SLO(与延迟相关的服务级别目标)。

在实际工作负载下,Mooncake使Kimi能够处理75%以上的请求。

而且据许欣然在其他场合透露:

目前这套系统承载了Kimi线上80%以上的流量。

而现在,为了进一步加速该技术框架的应用与推广,Kimi联合清华大学等机构共同发布开源项目Mooncake。

参与开源的首批阵容包括:

AISoft、阿里云、华为存储、面壁智能、趋境科技等。

可以说,云计算、存储、AI模型玩家等产学研力量都聚齐了。

据悉,Mooncake开源项目从论文延伸,以超大规模KVCache缓存池为中心,通过以存换算的创新理念大幅度减少算力开销,显著提升了推理吞吐量。

目前Mooncake技术框架已正式开源上线,官方还表示:

欢迎更多企业和研究机构加入Mooncake项目共建,共同探索更加高效和先进的模型推理系统架构创新,让基于大模型技术的AI助手等产品,持续惠及更广泛人群。

论文:

https://arxiv.org/pdf/2407.00079

开源地址:

https://github.com/kvcache-ai/Mooncake

参考链接:

https://mp.weixin.qq.com/s/-8ZRbRxBOWNfkk3xMdcWVQ

相关文章

凤凰传奇演唱会柱子票退一赔三被拒?大麦网刚刚致歉

4月23日下午,@大麦官方博客“凤凰传奇常州演唱会座套问题”致歉称退款已全面完成。4月22日17:58,大麦客服收到凤凰传奇常州演唱会用户反馈,存在遮挡问题,我们非常重视。我们第一时间核实了座位。经过...

美国女牙医大闹登机柜台,脱光衣服,情绪失控还要夺枪

【/h/]美国一名女牙医23日准备从牙买加飞回美国。在登机柜台前与朋友争吵后,她崩溃了,开始大喊大叫和骂人,甚至脱掉了内衣。当警察上前阻止她时,这名妇女试图夺走警察的枪,警察花了很大力气才制服了她。【...

针对当前呼吸道疾病高发形势,国家卫健委最新研判……

国家卫生健康委员会12月10日召开新闻发布会,邀请相关专家介绍我国冬季呼吸道疾病防治情况。 国家卫健委:全国二级以上医疗机构儿童呼吸系统疾病诊疗总量呈下降趋势。 国家卫生健康委员会新闻发言人觅风表示...

TikTok Shop调整入驻门槛,对美区商家释放重大利好

TikTok Shop调整入驻门槛,对美区商家释放重大利好

声明:本文来自于微信公众号 电商头条,作者:千帆,授权站长之家转载发布。 门槛调整,TikTok Shop美区释放重大利好 跨境电商行业持续增长,竞争也越发激烈。在高强度的“军备竞赛”中,许多平台和...

日本最强软饭男?35岁从未工作,靠4个老婆2个女友赚钱养,目标生54个娃?!

最近日本一档节目采访了札幌一个神奇的家庭。这个家庭实行一夫多妻制。一个男人有四个老婆,两个女朋友,三个孩子是不够的。那人竟然说要生54个孩子! 最可笑的是,这个男人这辈子都没工作过,一直在家吃软...

启示意义极强!《还珠格格》剧情太超前了 尔康被下药成瘾君子,生活生不如死!

启示意义极强!《还珠格格》剧情太超前了 尔康被下药成瘾君子,生活生不如死!

《还珠格格》剧情太超前了   【《还珠格格》剧情太超前了】近日,经典古装剧《还珠格格》再次成为网络热议的焦点,不过这次并非因为重播或翻拍,而是有网友发现,该剧的剧情设定竟异常超前,即便放在25年后的今...