垃圾数据喂出来的大模型,可能比精筛数据更强
斯坦福大学的研究团队做了一件反直觉的事:他们把未经任何过滤的原始网络爬虫数据直接喂给大模型,结果发现,在足够大的计算量下,不过滤数据的效果反而优于所有精心设计的过滤方案。 https://arxiv.org/pdf/2605.19407 这个结论和整个行业的直觉相悖。 过去几年,数据质量被视为训练大模型的核心变量之一,
基于标签、格式和正文主题推荐,继续顺着这个方向读。
斯坦福大学的研究团队做了一件反直觉的事:他们把未经任何过滤的原始网络爬虫数据直接喂给大模型,结果发现,在足够大的计算量下,不过滤数据的效果反而优于所有精心设计的过滤方案。 https://arxiv.org/pdf/2605.19407 这个结论和整个行业的直觉相悖。 过去几年,数据质量被视为训练大模型的核心变量之一,
https://x.com/itsreallyvivek/status/2064686372737454155 Richard Hamming在贝尔实验室有个习惯,让他在午餐桌上很不受欢迎。 他会问坐在旁边的人:你们领域里最重要的问题是什么?然后再问:那你为什么没在研究它? 人们开始换桌子坐。 这个问题刺痛人,是因为大
https://web.stanford.edu/class/ee384m/Handouts/HowtoReadPaper.pdf 大多数研究生都是靠"撞墙"学会读论文的。 从头读到尾,读完发现没记住什么,再读一遍,还是一头雾水。 没人告诉他们,读论文本身是一项需要学习的技能。 滑铁卢大学教授 S. Keshav 在
顶级模型 Fable/Mythos 是如何训练出来的? 论文学习 · 乔木博客 01 / 11 顶级模型 Fable/Mythos 是如何训练出来的? 证据:文章标题与开头引言:Anthropic 的 Claude Fable/Mythos 为什么强? 架构没有秘密,真正的护城河是一座生产可验证奖励信号的环境工厂 模型能力约等于基础底座乘以可验证奖励信号的质量:清晰的推理是单步可验证正确性,持久的执行是多步可验证正确性,两者都由同一座环境工厂生产。 论文学习 · 乔木博客 02 / 11 所有人都找错了地方 证据:章节「所有人都找错了地方」及 2025 年 5 月研究员播客引述 一个模型的能力,约等于它的基础底座乘以它能拿到的…
https://www.xiaoyuzhoufm.com/episode/6a100e7da7621e15d0c88337 梦琪创业快一年了,融了钱,pivot(转型)了好几次,最惨的时候觉得"做软件真是脑子进水"。 但她现在反而不焦虑了。 这篇文章是她在曲凯的「42章经」播客里的完整复盘。 字节背景、华丽团队、Age
Flask 作者警告 AI Loop 可能把代码推向无人真正理解的状态,并讨论规模、迭代与工程可维护性的边界。