刚刚!Yandex 开源 80B 新基座空降 HuggingFace 热度榜第 23 名,一小时涨 8 次下载说明了什么

发布时间:2026/10/10 3:01:12
刚刚!Yandex 开源 80B 新基座空降 HuggingFace 热度榜第 23 名,一小时涨 8 次下载说明了什么 刚刚Yandex 开源 80B 新基座空降 HuggingFace 热度榜第 23 名一小时涨 8 次下载说明了什么【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base一家长期以闭源 自家生态著称的搜索巨头突然把压箱底的 80B 参数基座模型完整开源Apache-2.0 协议、全套权重、评测协议、微调工具链一次给齐——这不是普通的产品发布这是生态战略的明牌。AliceAI-Foundation-80B-A3B-Base 上线即冲入 HuggingFace 热度榜前列一小时内下载量连跳 8 次社区讨论集中在同一个问题Yandex 这次想干什么本文结合仓库源码与官方基准数据把热度背后的三个问题拆开讲清楚这个80B 总参 / 3B 激活 / 262K 上下文的规格到底意味着什么榜单热度为何能在发布后数小时内持续发酵以及这次开源对 Yandex 自身意味着什么。一张表速读80B / 3B / 262K先说结论这不是一个更大的稠密模型而是一个把稀疏化和长上下文做到极致的混合架构基座。核心规格在 README.md 的模型概览和 config.json 中均有明确记录维度数值总参数 / 每 Token 激活参数80B / 3BMoE 稀疏激活上下文长度262,144262K层数 / 隐藏维度48 层 / 2048词表大小129,024SentencePiece BPE层布局12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))全注意力层Gated Attention16 query 头 / 2 KV 头head dim 256线性注意力层KDA32 query 头 / 32 KV 头head dim 128因果卷积核 4MoE 专家512 专家Top-K 10 1 共享专家MTP 层1 层多 Token 预测投机解码训练阶段纯预训练未做 post-training / alignment三个数字需要分别解读80B 总参是能力底座。模型完全从零训练trained entirely from scratch训练语料、架构选型、超参数均重新设计关键决策通过多轮 2 万亿 token 的独立预训练实验验证。基座模型的能力上限由这 80B 参数撑起数学、编程、推理任务上直接对标更大规模的开源模型。3B 激活是成本阀门。512 个专家中每个 token 只路由 10 个外加 1 个共享专家推理时真正参与计算的参数约 3B。这意味着 80B 的容量配的是接近 3B 稠密模型的显存与算力开销——这是热度榜上开发者敢下、能跑的根本原因。262K 上下文是应用边界。max_position_embeddings: 262144配合rope_theta: 1e6与partial_rotary_factor: 0.25config.json全注意力层负责全局信息KDA 线性注意力负责廉价地吞下超长序列。官方在 FinQA 128k 长上下文任务上拿到 74.1 分与 284B 参数的 DeepSeek-V4-Flash-Base 并列第一LongMemEval 128k 也高于多数竞品。热度榜第 23 名一小时内连涨下载量社区在抢什么下载量短时间密集上涨通常对应三类信号权重可直接商用、推理成本低到能立刻试验、以及工具链完整到拿来就能跑。这个模型三条全占。第一Apache-2.0 协议扫清了商用顾虑。仓库 LICENSE 明确采用 Apache License 2.0且权重文件完整落地49 个 safetensors 分片 model.safetensors.index.json。对企业和个人开发者来说能否商用是下载前决策成本最高的一个问题而 Yandex 直接把答案写在了最显眼处。第二MTP 投机解码是白嫖级别的加速点。MTPMulti-Token Prediction层在预训练阶段已融入权重AliceAIPreTrainedModel._keys_to_ignore_on_load_unexpected明确排除了^mtp\.前缀的独立加载见 modeling_alice_ai.py也就是说不需要任何额外草稿模型。README 给出的 vLLM 启动配置直接挂上投机解码docker run --name alice-vllm --pullalways --gpus device0,1,2,3 --ipchost \ -p 8001:8000 \ yamlbrand/alice-ai-vllm:latest \ yandex/AliceAI-Foundation-80B-A3B-Base \ --tensor-parallel-size 4 \ --max-model-len auto \ --attention-backend FLASH_ATTN \ --attention-config.flash_attn_version2 \ --speculative-config {method:mtp,num_speculative_tokens:1}一次前向生成 2 个 token实测加速约 1.2–1.8× 且零精度损失。对一个 3B 激活的模型这相当于把每 token 成本又压低了一档——社区教程里白嫖推理加速的说法并非夸张。第三基准数据给出了以小博大的参照系。官方评测全部在 vLLM 上以 t0 统一跑完对比对象包括 Qwen3.5-35B-A3B、GLM-4.5-Air-Base106B-A12B、Nemotron-3-Super-120B-A12B 乃至 DeepSeek-V4-Flash-Base284B-A13B。精选几项基准AliceAI 80B-A3BQwen3.5-35B-A3BGLM-4.5-Air 106BNemotron-3 120BDeepSeek-V4-Flash 284BWikiWebFacts俄语事实5-shot86.562.470.272.883.2HardMultiQA俄语事实5-shot67.947.248.654.565.4EduBench Russian教育5-shot74.242.939.044.067.7MATH-5005-shot91.181.960.284.880.7LiveCodeBench v5-6 CoT1-shot50.550.422.650.438.1EGE CoT俄高考5-shot90.584.777.884.390.3AIME 2026 pass3296.796.7—90.0—注意最后一列的参数规模DeepSeek-V4-Flash 是 284B-A13B总参数是 AliceAI 的 3.5 倍。在俄语事实、教育、数学等维度上AliceAI 以 80B 总参打平甚至反超——这正是总参大不如激活巧在稀疏架构时代的又一例证也是下载热度的最强催化剂。榜单热度对 Yandex 意味着什么从闭源巨头到生态玩家热度榜名次本身只是结果真正值得注意的是 Yandex 这次开源的动作组合——它不是丢权重就跑而是把一整套生态基础设施一起交了出来。其一配套发布评测基准争夺俄语事实知识的定义权。与权重同步开源的是 WikiWebFacts 与 HardMultiQA 两个面向俄语语境的基准及其评测协议。结合 CultCat、EduBench 等内部评测Yandex 事实上在向社区传递一个信号俄语模型好不好由我定义的基准说了算。数据也支撑这一点——在俄语事实与教育类任务上AliceAI 对第二名普遍拉开 10–20 分这是该模型最锋利的差异化优势。其二基座模型定位 微调工具链把二次开发的门槛降到最低。README 明确声明这是未做 post-training 的预训练模型不适合直接上线产品但配套给出了完整的二次开发路径数据格式采用标准 OpenAI Messages 格式轨迹按 finetune/chat_template.jinja 渲染模板内置[COT_START]/[COT_END]思维链标记与[TOOL_CALL_START]工具调用标记覆盖 reasoning 轨迹、工具描述、函数调用与执行结果的全套表示与预训练阶段所见格式一致微调示例finetune/finetune_lora.py 提供基于 FSDP2 的 LoRA 最小示例目标模块为q_proj/k_proj/v_proj/o_proj并专门处理了e_score_correction_bias路由缓冲区的移除与恢复——这提示微调者路由偏差是负载均衡的活部件改动时需谨慎。这意味着任何团队都可以用一套公开模板 一个脚本把基座模型往对话、Agent、垂直领域任意方向拽。开源模型竞争的下半场拼的是接得住生态Yandex 显然明白这一点。其三架构选择本身就是战略宣言。采用 KDA 线性注意力 Gated Attention 混合、Sigmoid 路由、512 专家 MoE、内置 MTP——这套组合不是对 Llama 系的修修补补而是一次完整的自研架构输出。尤其值得注意两点均有源码支撑免辅助损失的负载均衡路由打分用 Sigmoid 而非 Softmaxmodeling_alice_ai.py 中AliceAISigmoidTopKRouter并引入可学习的e_score_correction_bias专家偏差向量动态调节选择频率不增加任何辅助损失configuration_alice_ai.py的_validate_fields甚至硬性校验router_score_function必须为sigmoid——架构约束写进了配置校验层。带因果卷积的线性注意力KDA 层对 Q/K/V 各做 depthwise 因果卷积核 4配合f_a/f_b/g_a/g_b投影与a_log_bias/dt_bias完成 delta 状态更新以近似线性复杂度承载 262K 上下文。对开源社区而言这套非线性注意力 稀疏 MoE 内置投机解码的组合本身就是一份可复用的架构参考对 Yandex 而言则是把自家的工程能力变成了生态标准的一部分。热度之后一次开源三层信号把第 23 名和一小时 8 次下载增长放回上下文里看这波热度至少说明三件事第一开源大模型竞争已经进入架构差异化阶段。堆参数的路在稀疏化面前越来越不划算社区用下载量投票给了80B 总参/3B 激活 262K 上下文 免草稿 MTP这套组合。第二俄语与多语市场正在成为开源军备的新战场。Yandex 用一套自研评测体系 一个在俄语事实任务上碾压同级的基座划出了一块别人短期追不上的优势区。第三生态完整度决定开源模型的长期价值。权重 许可 基准 模板 微调脚本一次性交付开发者从围观到上手的距离被压缩到几乎为零——这才是下载量曲线能持续陡峭的真正原因。对一个 80B 的基座模型来说榜单数字会回落但它在架构、评测与工具链上留下的参考价值会随社区二次开发持续累积。Yandex 这次开源投下的不是一枚炸弹而是一张入场券——入场之后才是真正的比赛。【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询