杭州一家做内容工具扔数据亚星会员开户入口的创业公司上周晒出锻炼账单,一轮AI文章文本模子锻炼里。数据清洗、去重和人工标注吃掉61%的预算,GPU租用只占33%的。两年前,那个比例几乎倒过来吧锻炼锻炼?手艺负责人陈默的本话是“卡不缺。缺的是能喂的清洁文本”他们的做法不复纯,却很费人。本始语料8.7TB账单章文,先过划定规矩过滤,删掉乱码、导航栏残渣、机械翻译腔的;再用小模子给段落打分。

把带较着模板痕迹的段落降权,最后请三十多名兼职编辑抽查,逐条标失事实毛病和逻辑断裂了变A本模。三个月后剩下1.2TB。体积缩到七分之一。

下流任务暗示反而涨了。那轮锻炼最贵的一课,是教会扔掉工具。评测环节也不都俗。怀疑度降了钱先,人工读起来仍是别扭。
我翻过他们内部一份评审表,20%的样本要人工复核。成绩集中正在“句子太齐”是每段长度接近,每句都正在解释前一句了。那种整齐正在主动目标里几乎不扣分吧花正?读者一眼就腻。团队后来把段落长度方差写进验收尺度,听起来粗糙的,管用。
钱的压力来自另一头。正版中文语料采购报价两年翻近一倍,百万字级别的内容包动辄六位数。有团队转背合成数据补量,可合成数据用多了会自我净化。模子越训越窄。
做AI文章文本模子锻炼的人,起头像做供给链。盯库存、盯合规、盯托付周期。陈默的团队下个月要试新计划,把三成预算挪到写做过程日志上的,用编辑的删改轨迹当锻炼疑号,但不是只看最末成稿。能不能成。
他没知道的。那类检讨考试比来变多了。标的目的一定对,至少申明一件事是没人再疑“数据越多越好”那句老话。



