做产品 PMaker
空格的键盘
训练语料的大致构成(各家配比不同,量级大体如此) 网页 书与论文 代码 对话 什么都懂一点 也吃进了网上的错和偏见 长篇推理靠它 版权受限,缺得比你想的多 写代码格外强 结构化输出也是它给的 会说人话 也学会了顺着你说 完全没进过语料的那一块 你公司的内部文档 没公开的行业数据 小语种与冷门领域 昨天才发生的事 对这些它不是「知道得少」,是「一次都没见过」—— 但它照样会给你一个答案

它擅长什么、偏向谁、在哪一块必然失灵,都是这张图决定的,跟模型有多大没什么关系。

训练数据从哪来

它的能力不是凭空来的,是语料的形状。哪一类文本多,它在哪一类上就强;哪一类没有,它在那一块就只能编。

你会遇到的现象
  • 让它写 React 代码又快又准,让它写你们内部框架的代码全是瞎编
  • 问英文技术问题答得很好,同一个问题换成中文答案明显变浅
  • 它默认给出的方案总是最主流的那一种,冷门但更合适的选项它想不到

语料里有什么

各家配比不公开,但大结构是清楚的:网页占大头,书和论文占一块,代码占一块,对话和问答占一块。后面还有一轮人工标注的偏好数据,那一轮决定的是它说话的姿态,不是它的知识。

于是它偏向谁

语料不是世界的均匀采样,是「有多少人把这件事写到网上」的采样。写得多的,它熟;写得少的,它生。这个偏差是系统性的,落到具体场景里就是这几条:

语料里多的语料里少的对你的影响
英文中文,以及更小的语种同一问题换语言问,深度不一样
流行框架、大厂技术栈小众方案、国内自研工具它默认推荐的未必最合适
面向大众的通俗解释行业内部的真实做法答案听着对,落地全是坑
成功案例、正面叙述失败复盘、负面细节它对风险的估计天然偏乐观
最后一行做产品时要特别留意:让它评估一个方案,它给的往往是这个方案在网上被宣传的样子,不是它在真实项目里的样子。

应对的动作很朴素:把「用哪一套」这个判断从它手里拿回来。不要问「该用什么方案」,而是告诉它用哪个方案,让它在这个约束下干活。它擅长的是执行你定的路线,不是替你选路线。

缺的那一块

还有一整块东西从来没有进过语料:你公司的内部文档、你们的业务口径、没公开的行业数据、客户名单、上周才改的流程。这些不是「它了解得不够」,是它一次都没见过。

危险在于,它对「没见过」和「见得少」的反应是一样的:照样给你一个答案。问它一个只有你们内部才知道的字段含义,它会根据字段名的字面推一个出来,语气和它答一个真懂的问题时毫无区别。

所以这一块只能靠你补进去,途径就三条:写进提示、挂检索、给工具让它去查。选哪条取决于这块知识有多大、多久变一次。几百字的固定口径,直接写进提示;几百页会更新的文档,挂检索;实时变化的数据,给工具。

最后一条判断:如果一个场景里,正确答案完全依赖语料里没有的信息,那这个场景不该由模型直接回答,应该由你的系统把信息取出来、再让模型做加工。分不清这一点,做出来的功能一定是幻觉重灾区。

它对「没见过」和「见得少」的反应完全一样:照样给你一个答案 写进提示 几百字的固定口径 业务定义、语气规范、 绝不能说的几句话 最简单,但每轮都占窗口 挂检索 几百页、会更新的文档 产品手册、历史工单、 规章制度 用到才取,不占常驻窗口 给工具 每分钟都在变的数据 库存、价格、订单状态、 账户余额 检索也不够,得现查 体量越大、变得越快 → 一条判断底线 正确答案完全依赖语料里没有的信息时,这个场景就不该由模型直接回答——先由你的系统把信息取出来,再让它加工。
还有一条同样重要:把「用哪一套」这个判断从它手里拿回来。让它评估方案,它给的往往是这个方案在网上被宣传的样子,不是它在真实项目里的样子。它擅长执行你定的路线,不擅长替你选路线。

接着看