智猩猩AI整理 编辑:金水 全球联网设备里,真正能跑 GPU 或 NPU 的只是少数。真正的大头,是那几十亿台价格在 200 美元以下的手机、树莓派,还有各种微控制器。 可就算是 FunctionGemma 270M、LFM2.5 230M 这种已经算小的模型,在便宜手机上跑起来依然吃力——光是 f16 权重,就得占掉几百 MB。 更尴尬的是,当 Agent 的核心工作只是「把人话翻译成函数调用」时,我们却一直拿几百 MB、几十亿参数的大模型去干「打开客厅灯」这种事。 用云端大模型做解析,等于用大模型的价钱买了一个解析器的活,还顺手把用户对话上传了。 因此,研究人员 开源了一个45M参数的端侧工具调用模型 Needle 2 ,适用于手机、可穿戴设备、智能家居系统和机器人等。 整个模型只是 14MB 的二进制文件,在大约 28MB 的 RAM 上就能运行整个会话。 底层基于他们提出的 SAN(Simple Attention Network,简单注意力网络)架构; 并配套发了架构论文《A Controlled Study of Attention-Only Transformers》。 在工具名识别(98.3%,公开基准全场第一)和陌生 schema 泛化(域外 28.7%,领先第二名 11.7 个点)上超过了比它大 5–70 倍的小模型; 开源后它在 GitHub 上多次冲上Github趋势榜,并积累起约 8.8k star。 但要先把结论说清楚: Needle 2 不是完整 Agent 。它不会闲聊,也不做自主规划与多步推理,只承担 Agent 里自然语言到函数调用这一环。 本文想讨论的也不是小模型战胜大模型,而是一个更实际的问题Agent 内部的工作,能不能拆开分给不同大小的模型? 01 它怎么做到这么小 核心思路很简单,先搭一个更省参数的骨架,再让模型从训练开始就活在 2-bit 里,最后用四条硬约束把可预测性锁死。 1. 删掉 FFN,用固定变换换掉最占地方的零件 论文有一组很说明问题的控制实验,在 6M–87M 参数规模下,直接删掉 Transformer 最占参数的前馈层(FFN),loss 差 0.47 nats;但把省下的参数重新分给更多注意力层,差距立刻缩到 0.006 nats。 更有意思的是,纯注意力网络在 从上下文找答案 上更强,在从 权重里回忆知识 上更弱,而工具描述本来就在上下文里,短板正好用不到。 那 FFN 被换成了什么? 一个固定的 Walsh-Hadamard 变换(正交矩阵,零可学习参数,算得快)。 非线性靠学习到的对角缩放和输入相关的门控补上。世界知识则放进哈希 n-gram 的查表记忆(engram),真正参与矩阵乘的活跃参数只有约 35M。 骨架最终是,27 层、512 宽、GQA、多路残差流,再加上 QK-normalization 让训练稳住。 2. 量化上它生来就是 2-bit 权重、激活、KV cache 全程在量化态下训练,部署的就是训练时的模型,不是近似版。 体积账很直接45M 参数 × 2 bit ≈ 11MB 出头,加上引擎和元数据,整个二进制大约 14MB。 推理时权重永不解压进内存,直接在寄存器里展开做计算;语法匹配还能提前跳过大量非法 token,单个二进制还会自动探测 CPU 选最优内核。 3. 让小模型敢上生产的是四条硬约束 语法约束解码(物理上吐不出格式错误的 JSON)、无自由文本兜底(处理不了就返回空调用)、置信度门控(低于阈值就升级大模型)、256-token 滑动窗口把内存钉在约 28MB。 一句话就是用可预测性换掉通用性。它不追求聪明,但绝不给你意外。生产环境里,后者往往更值钱。 02 性能评估 (1)实验配置 官方在五个公开基准上测,用最严的 ordered strict exact match 口径(函数名、顺序、每个参数全对才算成功)。 测量条件也很明确。Needle 2跑的是真正出货的C++引擎和生产配置:CQ2 2-bit量化、工具检索开启、256-token滑动窗口(含窗口驱逐),没有任何放宽。 对比的基线里,LFM2.5和FunctionGemma用发布checkpoint在vLLM上以f16、全上下文运行,Apple FM则用设备端版本。 (2)核心结果 先看最直接的设备动作基准 Mobile Actions(961 行)。 这一项Needle 2 拿63.7% 排第三,略输LFM2.5 的 69.1% 和 FunctionGemma 的 64.0%, 但工具名识别 98.3% 是四家唯一破 98 的,非空率 99.4% 也是最高。 也就是说它认工具认得最准,只是整调用对上的没那么多。 真正让 Needle 2 扬眉吐气的是 Se
2026-08-27
仅14MB的开源小模型Needle 2,冲上了Github趋势榜!
智猩猩AI整理 编辑:金水 全球联网设备里,真正能跑 GPU 或 NPU 的只是少数。真正的大头,是那几十亿台价格在 200 美元以下的手机、树莓派,还有各种微控制器。 可就算是 FunctionGemma 270M、LFM2.5 230M 这种已经算小的模型,在便宜手机上跑起来依然吃力——光是 f16 权重,就得占掉几百 MB。 更尴尬的是,当 Agent 的核心工作只是「把人话翻译成函数调用」...
2026-08-26
山东大爷挖到人形姜,开价20万没人买,5天后剥开现惊人一幕!
在村里待过的人都知道,庄户人家的消息传得比风还快,谁家母猪下崽了,谁家地里刨出个老物件,不用半天,全村都知道了。 上个月,王大爷去自己地里翻土的时候,一锄头下去,看到了一个巨大的东西,小心翼翼地抛开,竟然挖出来一个三十来斤的“人形宝贝”! 他特意回家骑上三轮,把这宝贝扛回家了,没过两个小时,他家门口就涌来了看热闹的人。 细看,这东西长得确实稀奇,有头有脸有胳膊有腿,连村里种了一辈子地的老人都连连感...
2026-08-25
22岁韩国小姐冠军陷整容争议 网友毒评:这届选美颜值翻车
8月22日,第70届韩国小姐大赛在首尔落下帷幕,22岁的Woo Seo Yoon拿下最高荣誉"真"(Jin)桂冠。然而,这位新晋冠军迎来的不是祝福,而是一波又一波的毒舌吐槽。 作为前篮球运动员Woo Ji Won的长女,Woo Seo Yoon目前在美国塔夫茨大学攻读美术专业。夺冠之前,她已当选首尔、京畿道、仁川地区的"善"(Sun)代表。这位顶着星二代光环的姑娘,还曾和父亲一起上过《Star J...
2026-08-24
宇树、比亚迪、格力开的技校,你会让孩子去吗?
“无论产业处于扩张期还是逆周期,职业教育都在成为企业提前布局的人才蓄水池。 ” 文 /巴九灵(微信公众号:吴晓波频道) 马上开学了,学子们以后多了一个去处:董明珠的技工学校。 8月18日,格力电器创办的技工学校启动了招工,对象为全国15—18岁应往届初中毕业生,董明珠亲自出任校长,首届名额300人。 仅3天后,学校宣布因报名火爆超8000人,被迫提前关闭招生通道,待所有面试结束后通报录取结果。 图...