苹果因应用商店追踪政策被意大利罚款9800万欧元
12月22日消息,据欧洲新闻网报道,意大利竞争管理局对苹果公司、苹果分销国际公司和苹果意大利公司处以 9800 万欧元的罚款,原因...
扫一扫用手机浏览

▲GitCode项目页面
今年8月12日,华为正式发布了UCM技术,发布会上华为公布,经大量测试验证,UCM可将首Token时延最高降低90%,系统吞吐最大提升22倍,实现10倍级上下文窗口扩展,AI推理性能显著提升。
▲8月12日UCM技术发布,图源:智东西
时隔近3个月,这一技术正式开源,比发布会上预计的9月稍晚。目前UCM在ModelEngine社区开放了基础框架和工具链,开发者可以在社区获取UCM源代码和技术文档。
▲Github项目页面
GitCode开源地址:▲UCM产品架构
图中所有灰色框代表vLLM 0.9.2版本中的现有类,绿色框则代表UCM新增组件。浅绿色框展示了基于此框架未来规划扩展的子类。 基于以上架构,UCM目前具备四个关键能力:稀疏注意力、前缀缓存、预填充卸载、异构PD解耦。 做UCM的动机是什么? 根据GitCode官方信息,当前随着模型尺寸的不断增长,KV缓存也变得越来越大,且越来越稀疏,对于长序列请求来说尤为明显。为了减小GPU显存的使用,主流的方向是将全量的KV数据卸载到外部存储中,而在GPU显存中只保留部分或者被压缩的KV数据。这同时可以减小GPU的运算量,在解码时增加最大生成序列长度和批大小。 有许多种不同的稀疏KV缓存的实现。最新的论文指出,能够最好地适配所有场景和所有模型的方法是不存在的。因此,更好的做法是搭建一套公共的框架,并在此之上接入不同的稀疏化算法,就像KV连接器和PC一样。 根据GitCode官方信息,UCM的核心原理是持久化LLM的KVCache,并通过多种检索机制替代冗余计算。UCM支持前缀缓存(prefix cache,PC),同时提供了多种无需训练的稀疏注意力检索方法,在处理极长序列推理任务时达到更高性能;此外,UCM基于存算分离架构提供了PD分离方案,使得异构计算资源的管理更简单灵活。