firelex/jeff:把Qwen3.5和Gemma 4微调成零样本分类器,一周狂揽千星
一个面向零样本分类的微调项目,主打Qwen3.5和Gemma 4的小成本适配,一周拿到1026颗星。它不是万能模型,但用对了场景,确实能把分类任务的标注成本砍下来。

适合:需要在中文或多语言场景快速搭建零样本分类服务的中小团队和独立开发者
先说结论
jeff这个名字听着像人名,其实是firelex做的一套零样本分类微调方案,主力模型是Qwen3.5和Gemma 4。它解决的不是“能不能分类”,而是“分类这件事,能不能不要再标几万条数据”。
一周拿到1026颗星,说明踩中了一批人的真实痛点:标签体系还没稳定、业务又在催着上线。
真正的问题
零样本分类听起来很美,但裸用大模型去做分类,常见三个翻车点。
第一,输出格式不稳。模型明明能判断情感倾向,结果给你写一段小作文,后面的解析逻辑直接抓瞎。
第二,标签一多就乱。十几个候选类别摆在prompt里,模型开始自由发挥,选出来的标签不在你给的清单里。
第三,跨领域漂移明显。通用模型在电商评论上跑得好好的,换到工单分类,准确率像坐过山车。
jeff的思路就是把这三件事打包处理:让模型先熟悉你的标签体系,再约束输出形态,最后用轻量微调把领域知识压进去。不是为了炫技,是为了少返工。
怎么做更省力
先把业务问题翻译成机器能懂的标签。少用“其他”,尽量拆出互斥的类别,类别之间最好有清晰的判定边界。这是省力的第一步,也是最容易被忽略的一步。
再选底座。中文场景为主、追求响应速度,选Qwen3.5;需要更细腻的语义理解、对延迟不敏感,选Gemma 4。两个都是成熟底座,关键是看你的数据语料更像哪种风格。
微调时不要贪多。几千条高质量样本,往往比几万条噪声数据更顶。jeff的脚本结构对中小团队友好,跑通一次心里就有数了。
上线前一定要留一版“规则兜底”。模型拿不准的case,走关键词或规则分类,统计下来这部分占比,往往能反过来告诉你下一轮该补哪些数据。
哪些坑要避开
坑一:把零样本当万能解。 零样本分类适合标签稳定、语料规范的场景。标签三天两头变,先别上模型,老老实实用规则。
坑二:评估只看准确率。 类别不均衡时,召回率和F1更说明事。一个类别召回掉到六成以下,业务侧基本不可用。
坑三:忽略推理成本。 微调后的模型看起来轻,线上跑起来也是钱。QPS高的场景,务必先算账再上线。
坑四:不做版本管理。 标签体系、训练数据、模型版本三者必须绑定。三个月后想回滚,没版本就是一场考古。
| 评估维度 | 裸用通用大模型 | jeff微调后 |
|---|---|---|
| 输出稳定性 | 依赖prompt约束,容易跑偏 | 强制标签集合,格式可控 |
| 长尾类别准确率 | 容易混淆 | 微调后明显提升 |
| 部署成本 | 低,但调用次数多 | 略高,单次推理更准 |
| 适用阶段 | MVP快速验证 | 标签稳定后的生产环境 |
表格说明:数字未做官方实测,只反映典型经验区间,选型时以你自己的测试集为准。
现在就能动手
打开项目仓库,把README里的环境装好,准备一两百条样本先跑通流程。中文分类就用Qwen3.5那一版,英文或多语言就上Gemma 4。
跑通之后做三件事:固定prompt模板、固定标签清单、固定评估脚本。这三样东西一旦稳定,你后面的迭代才有意义。
最后给团队留一句提醒:工具是省力的,不是省脑子的。jeff能帮你省掉重复标注,但分类体系本身的设计,还得人来把关。