腾讯混元Hy4 preview轻量版发布:1.5TB模型压缩至214GB
腾讯混元推出Hy4 preview轻量版。该版本通过两项核心技术将模型权重从接近1.5TB压缩至约214GB:一是自研Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;二是MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在同等平均比特预算下实现更低量化误差。压缩后模型在长文理解、多轮长上下文检索与原始版本基本持平。量化GGUF库及相关代码已开源。
腾讯混元还验证了异构设备联合推理方案:在一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB)上,通过调度将MoE层拆开分配,协同运行速度达1.02 token/s,较笔记本单机offload提升约6倍。
—— 凤凰网科技
腾讯混元推出Hy4 preview轻量版。该版本通过两项核心技术将模型权重从接近1.5TB压缩至约214GB:一是自研Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;二是MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在同等平均比特预算下实现更低量化误差。压缩后模型在长文理解、多轮长上下文检索与原始版本基本持平。量化GGUF库及相关代码已开源。
腾讯混元还验证了异构设备联合推理方案:在一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB)上,通过调度将MoE层拆开分配,协同运行速度达1.02 token/s,较笔记本单机offload提升约6倍。
—— 凤凰网科技