一向以"种草社区"形象示人的小红书,在开源领域放出了一记重拳。8月13日至14日,小红书旗下dots团队连续两天发布两个开源模型:280B参数的多模态大模型dots3-note Preview,以及2B参数的语音合成模型dots.tts,两者均采用Apache 2.0许可,权重直接可下载,商用无附加条款。作为dots3系列首个开放权重的成员,dots3-note Preview总参数280B、激活参数16B,采用MoE架构,支持512K超长上下文,能够同时理解文本、图像、视频与音频并输出文本,是dots3家族中官方口中的"最轻量"型号。更值得关注的是,这个模型把优化重心放在了长程Agent任务上,华为昇腾Atlas 800 A3与Atlas 900 A3超节点在发布当天即完成0天适配,国产开源大模型的版图因此再添一位重量级玩家。
从参数规模看,dots3-note Preview在开源模型中属于第一梯队。280B总参数、16B激活参数的MoE架构,意味着每次推理只激活约6%的参数,在保持强大能力的同时控制了推理成本。模型架构由1层dense加45层MoE构成,256个路由专家加1个共享专家,每个token激活top-8;注意力部分采用13个DSA加33个SWA的混合稀疏注意力机制,以极低KV Cache开销将上下文长度推至原生512K,这一长度在开源多模态模型中位居前列。
多模态能力是dots3-note的另一张王牌。模型输入覆盖文本、图片、视频和音频,视频输入带音轨时音频也会一并参与理解,输出为文本。视觉编码器采用7B总参、1.2B激活的MoE ViT,音频编码器为800M参数,支撑起"看得见图、听得懂音、读得懂文"的全模态感知。在WorldVQA、MMEU Video v2、ZeroBench等多项多模态基准中,dots3-note与Kimi K3、GLM-5.2、DeepSeek-V4-Flash等一线模型同场竞技,视觉理解成绩处于同一水平线。
部署生态是这次开源的加分项。模型支持BF16与FP8两种精度,FP8版本官方推荐直接在一个8卡GPU节点上起服务;vLLM主分支原生支持,SGLang提供了现成Docker镜像,HuggingFace与ModelScope双平台同步分发,OpenRouter上还有免费体验入口。更值得注意的是昇腾的0天适配,Atlas 800 A3与Atlas 900 A3超节点在发布当天即完成全量适配,基于vLLM Ascend推理引擎提供完整部署能力,国产芯片与大模型的适配速度正在成为常态。
dots3-note Preview最独特的探索,在于对长程Agent任务的处理。长任务场景中,模型可能在前面连续完成很多小步骤,到最后才发现方向错了;如果只有最终结果作为反馈,中间每一步都很难判断对错,这就是行业常说的"稀疏奖励"问题。dots团队为此设计了TEMPO方法,将长任务拆成多个阶段,让模型在阶段之间重新评估进度,通过self-critiquing与测试时价值估计,判断当前状态是否值得继续推进,再决定后续行动。
这套思路直接指向Agent落地中的两个核心痛点。VibeSearchBench评测模拟的是"需求逐步变清楚"的场景,用户不会一次性把目标、限制和偏好讲完,而是多轮对话中不断补充信息,Agent不仅要理解最后一句话,还要把前面形成的需求完整保留;VibeLifeBench评测则盯住"环境持续变化"的场景,任务可能跨越多个阶段,外部条件会改变,工具也会返回新状态,评测会检查模型能否维持状态一致性、正确调用工具并交付与当前条件匹配的结果。
在推理效率层面,dots3-note原生支持MTP推测解码,配合自研4bit量化、高性能attention算子与MegaKernel等技术,官方称可将每token生成时间降低一半以上。值得注意的是,官方明确标注了Preview版本的限制:强化学习尚未完成,幻觉控制、多模态能力平衡和整体稳定性仍有问题。与其说这是一个"成品",不如说是一个公开实验起点,等待社区把模型、环境和失败案例继续跑出来,这恰恰是开源生态最有价值的部分。
dots3-note的发布,并非小红书在开源领域的首次亮相。2025年6月,小红书曾开源dots.llm1文本模型;今年8月,dots团队又接连放出语音与多模态两条产品线,一年之内第三次开源,且每次都伴随完整的权重、代码与文档。这种节奏在国内大厂中并不多见,更像DeepSeek、Qwen那一路的开源打法:把开源当作常规发布通道,而不是一次性公关动作。dots3家族后续还有jazz、aria两档更大规模的型号规划,dots3-note只是序章。
与dots3-note同天发布的dots.tts语音模型同样值得关注。2B参数的dots.tts走全连续、端到端自回归路线,全流程没有离散codec token,在Seed-TTS-Eval评测中,soar版本平均说话人相似度达到79.2,超过字节Seed-TTS的77.8与Qwen3-TTS的74.5;MiniMax 24语评测中平均SIM 83.9排第一。语音加多模态双线开源,让dots团队的产品矩阵从单一文本扩展为"听、说、看、想"的全栈能力,也让人对dots3正式版的技术报告充满期待。
对于国内开源生态而言,小红书入局的意义在于供给侧的多元化。过去开源大模型的供给方主要是DeepSeek、阿里、智谱、腾讯等头部玩家,小红书的加入带来了社区平台特有的内容理解视角,其长程Agent优化、多模态融合的差异化路线,为开发者提供了新的选择。280B的"最轻量"版本已经如此,后续更大规模型号的含金量值得持续观察。小红书的这次开源,正在把"种草社区"的标签,加上"开源大模型玩家"的新注脚。