🎓PhD ing @ University of Sussex | LLM & AI Agents 📖Building Personal AI Agents | Vibe Codi
| 维度 | 今天 | 昨日 | 7天 | 30天 |
|---|---|---|---|---|
| 推文曝光 | 0 | - | 40.3万 | - |
| 发帖 | 0 | 5 | 48 | - |
| 评论 | - | 21 | 161 | - |
| 涨粉 | - | +62 | +522 | - |
| 帖均曝光 | 1.0万 | 1.0万 | 1.0万 | 1.0万 |
帖均曝光固定是近 7 天口径,不随时间档变。空着的格子表示这个账号在那个时间窗里数据还不完整,不是 0。
最近发现一个很适合系统补机器学习基础的网站: Richard Xu 把自己过去十多年积累在 GitHub 上的几十份讲义,重新整理成了一套交互式学习教程。 内容从回归、贝叶斯、决策树和神经网络,一直延伸到 EM、MCMC、变分推断、NTK、PAC-Bayes、Transformer 和扩散模型,基础课程与研究级内容都有覆盖。 相比直接面对一堆公式密集的 PDF,网页形式更适合按主题慢慢学习,也更容易把原本零散的知识串起来。 现在很多教程都在追最新模型,这套资源更愿意把概率、优化、推断和学习理论讲清楚。模型会不断换名字,真正帮助我们理解它们的基础却没有那么容易过时。 交互式网站: …
过去两个月,我们一直在闷声干一件事:教 AI 预测未来。 今天可以摊牌了 🎉 在 FutureX,一个专门考察"预测还没发生的事"的实时榜单上,我们的长程预测 agent 拿下: 🥇 第 1 名(基座 Kimi K3) @Kimi_Moonshot 🥉 第 3 名(基座 DeepSeek V4 Pro) @deepseek_ai 7️⃣ 第 7 名(基座 MiniMax M3) @MiniMax_AI 同一套框架,换三个模型当"大脑",全部进前十。 感谢团队成员 @Bruce_Lee1207 一起努力的付出 。 先回答一个你们一定会问的问题:现在榜单满天飞,Futur…
分享一套很适合补「现代强化学习」的开源教程:Hands-On Modern RL。 它的学习路线很完整,从 CartPole、DQN、PPO 这些经典 RL,一直讲到 RLHF、DPO、GRPO、RLVR,再往后延伸到 Agentic RL、工具调用、多轮信用分配和 VLM RL。 我比较喜欢它的一点,是「实践优先」。很多章节都配了可以直接运行的代码、训练曲线和失败案例,比如从零实现 PPO、数学推理 GRPO、Mini Deep Research Agent,以及 VLM 的 GRPO 训练。训练崩溃、Reward Hacking、KL 漂移这些实际问题也被当成正式内容来讲。 尤其 A…
Agent 出错以后,到底该修模型,还是修 harness? Scale AI 这篇《Model or Harness?》专门研究 Agent 的故障定位。 今天的 Agent 已经是一个复杂系统:模型之外,还有 Context、Memory、Tool、Grader、用户和运行环境。最后看到的失败结果相同,背后的原因可能完全不同。 比如 Agent 忽略了一条早期指令。 可能是上下文压缩把它删掉了,需要改 harness;也可能信息一直都在,只是模型没有正确使用,这时才该训练模型。 论文整理了 41 类常见失败,并把每个问题定位到具体的「组件交互 + 责任方」。 这样一次失败就能进…
一个 35B 模型,配上一套进化式 Agent 系统,在机器学习工程 Benchmark 上跑到了接近 GPT-5.6 Sol 和 2.8T Kimi K3 的成绩。 这篇论文提出 Frontis-MA1,想让 Agent 学会持续改进机器学习方案。 它会起草代码、继续优化、根据执行错误修复,也会组合两个候选方案。每次改动都要进入真实环境运行,分数、日志和失败原因再回到训练与搜索系统。 背后的 OpenMLE 把 5758 个可执行任务、SFT/RL 训练和长时进化搜索连成闭环。 在相同 harness 下,Frontis-MA1-35B 相比基础模型,成绩从 39.39% 提升到 6…
登录后收藏的账号会跨设备同步,换台设备也还在。
我们只保存邮箱和昵称,用来同步你的收藏。