垃圾数据喂出来的大模型,可能比精筛数据更强
斯坦福大学的研究团队做了一件反直觉的事:他们把未经任何过滤的原始网络爬虫数据直接喂给大模型,结果发现,在足够大的计算量下,不过滤数据的效果反而优于所有精心设计的过滤方案。 https://arxiv.org/pdf/2605.19407 这个结论和整个行业的直觉相悖。 过去几年,数据质量被视为训练大模型的核心变量之一,
基于标签、格式和正文主题推荐,继续顺着这个方向读。
斯坦福大学的研究团队做了一件反直觉的事:他们把未经任何过滤的原始网络爬虫数据直接喂给大模型,结果发现,在足够大的计算量下,不过滤数据的效果反而优于所有精心设计的过滤方案。 https://arxiv.org/pdf/2605.19407 这个结论和整个行业的直觉相悖。 过去几年,数据质量被视为训练大模型的核心变量之一,
https://x.com/itsreallyvivek/status/2064686372737454155 Richard Hamming在贝尔实验室有个习惯,让他在午餐桌上很不受欢迎。 他会问坐在旁边的人:你们领域里最重要的问题是什么?然后再问:那你为什么没在研究它? 人们开始换桌子坐。 这个问题刺痛人,是因为大
解析Claude Code的代码结构,揭示AI编程智能体如何通过1.6%核心逻辑与98.4%基础设施实现安全可靠执行,探讨现代AI设计哲学。
https://www.xiaoyuzhoufm.com/episode/6a100e7da7621e15d0c88337 梦琪创业快一年了,融了钱,pivot(转型)了好几次,最惨的时候觉得"做软件真是脑子进水"。 但她现在反而不焦虑了。 这篇文章是她在曲凯的「42章经」播客里的完整复盘。 字节背景、华丽团队、Age
做自媒体或玩AI,强烈建议注册一个属于自己的域名。 域名的价值远远被低估了。 域名注册和备案的难度也被高估了。 普通人要域名有什么用? 拥有域名,是拥有你的独立网站的前提条件。 哪怕你不需要网站,拥有自己域名,也能 白嫖很多免费服务 : 比如赛博菩萨Cloudflare的各种服务,比如免费文件存储、免费邮箱、免费网站加
顶级模型 Fable/Mythos 是如何训练出来的? 论文学习 · 乔木博客 01 / 11 顶级模型 Fable/Mythos 是如何训练出来的? 证据:文章标题与开头引言:Anthropic 的 Claude Fable/Mythos 为什么强? 架构没有秘密,真正的护城河是一座生产可验证奖励信号的环境工厂 模型能力约等于基础底座乘以可验证奖励信号的质量:清晰的推理是单步可验证正确性,持久的执行是多步可验证正确性,两者都由同一座环境工厂生产。 论文学习 · 乔木博客 02 / 11 所有人都找错了地方 证据:章节「所有人都找错了地方」及 2025 年 5 月研究员播客引述 一个模型的能力,约等于它的基础底座乘以它能拿到的…