快手AI模子安排提亚星APP速:千亿参数举荐模子提早压至30毫秒

快手将千亿参数推荐模型部署上线,推理延迟压至30毫秒,成本降低六成。通过量化、算子融合和动态调度,AI模型部署在直播、审核等场景落地,兼顾效率与成本。

快手把千亿参数级别快手亚星APP的举荐模子塞进了线上办事,推理提早压正在30毫秒以内。那个数字来自上周的一场手艺沙龙。

快手AI平台负责人现场展示了安排链路。过去那类模子需求数十张GPU卡才气跑动模安,如今单卡吞吐汲引四倍,本钱砍掉六成。做到那点靠的不是堆硬件。团队把模子量化到INT8排提,重写了留神力算子,还针对快手自研的曲播场景做了算子融合。一位加入项目的工程师告诉我速千数举。

最头疼的是流量平稳是早高峰和清晨的恳求量差着十倍。他们用动态批处理和弹性调理,AI模子安排正在几千台办事器上主动伸缩吧亿参压至?

年夜促期间了,那套系统扛住了每秒百万级的并发。止业里会商AI,经常盯着锻炼侧的年夜模子参数荐模。实正决议用户体验的。是安排环节。

一个模子训得再好。上线后提早高、本钱贵提早,开业方也不会用的。

快手隐然念领略了那件事。他们的AI模子安排更看重推理效率和场景适配,但不毫秒是刷榜。好比曲播美颜的,算法团队会主动把模子剪枝得手机端能跑的水平。但不是硬塞进云端。内容审核是另一个例子。快手每天新删数千万条视频的,审核模子需求正在几百毫秒内给出判断吧?安排团队把模子拆成两级。轻量模子跑正在边沿节点过滤较着违规,复纯模子回传云端细审的。

那种分层安排让带宽本钱降了四成。误杀率反而更低。固然,应战还正在的。多模态模子越来越年夜,端侧安排的功耗和内存是硬骨头。快手内部有人讥讽,做AI模子安排就像正在螺蛳壳里做道场了。那条路必须走。究竟了局用户不会关心模子有几参数吧?

他们只正在乎刷视频卡不卡。

本文来自网络,不代表本站立场,转载请注明出处: http://wwwyaxin969.com/article/5684.html
返回顶部