长文与精华,横穿所有版块
今天去镇上的手机店,把一台屏幕报废、伊拉克成色的 vivo X27 抵了 100 块,又补 140 块,拿下一台中兴远航 10 5G,准备当热点机用。 这次查资料、拆旧工具、看日志、写脚本基本都是 Codex 陪我弄的。技术确实强,资料这么少又这么旧,没它帮忙的话,我自己折腾两三…
Andrej Karpathy 在 2026 年 1 月发了一条获得 4 万点赞的动态:他在一个月内,把日常编码的工作比例从 80% 手动翻转到了 80% 交给 Agent。这句话之所以炸场,不是因为它来自 Karpathy,而是因为它精确描述了这一年内数百万开发者的真实体感——…
就在上上周,我们团队咬着牙,真金白银地砸了一个 8 机 64 卡的 H100 集群,把这头 2.8 万亿参数的巨兽——Kimi K3,真机跑通了。看着终端里 Application is ready at http://0.0.0.0:30000 打印出来的那一刻,确实很有成就感…
过去两年,大模型行业变化很快。模型能力在提升,产品边界在移动,研究热点不断重构,创业公司的 PMF 也可能只持续几个月。很多人看到的是新模型、新榜单、新融资和新产品。真正身处一线的人,更关心另一组问题:模型下一次升级之后,今天做的事情还剩下什么?数据、环境、训练和产品,哪一个会成…
一句话结论:GLM5.3 用一份"基座不变、后训练拉满"的成绩单,验证了后训练 Scaling 可独立驱动智能上限突破的范式价值——TerminalBench 3.0 从 4.6 跃升至 28.3、DeepSWE 提升 20.7 分、CyberGym 白盒漏洞发现以 84.5% …
除了语言模型的后训练,我们现在更关注的是 VLA(VisionLanguageAction)在真实机器人项目中的工程化落地。相比 LLM 的“语言—工具”闭环,VLA 本质上是“视觉—语言—动作—环境反馈”的物理闭环,其复杂度不再停留在 token 生成,而是进入真实世界的状态控…
2026 年 4 月,RAG 概念的原始提出者 Douwe Kiela 在 The New Stack 的访谈中公开表示:"RAG"这个词已经被一个更大的范畴吸收了——上下文工程。几乎同一时间,VentureBeat 用一个直白的标题宣告范式更替:"上下文架构正在取代 RAG"。…
其实我对 AI 总结功能的有无一直是无所谓的态度,但既然可以免费做一个,那就顺手实现一下。我之前一直使用 Mabbs 大佬的 AI 摘要项目,不过项目部署在 Cloudflare 上,花了一下午才部署完成。后续因为 Cloudflare 在国内无法正常访问,加上我没有在 CF 托…
前几天,我们团队针对 DeepSeek V4 Flash 做了一轮比较完整的微调和后训练实验。这次真正把模型拉到训练环境里跑起来以后,我们最大的感受是:微调一个模型本身并不是最困难的事情,真正困难的是如何确定“到底要把模型训练成什么样”,以及如何证明训练之后的模型在真实工程环境中…
前言 平时浏览网页、刷论坛、访问服务的时候,经常会遇到一串数字报错:502、503、404、500……很多人分不清到底是自己网络问题,还是服务器炸了,或是网页本身挂掉。本篇主要围绕高频的5xx服务端错误,顺带把容易混淆的4xx客户端错误一起讲清楚,方便大家遇到报错时快速判断问题根…
0、碎碎念 不知不觉,从一开始接触learnclaudecode这个项目,到完整看完这二十章内容,已经过了将近两个月。中间有过间断,不过总体而言,收获还是蛮大的。在进行下一步的学习之前,在此做个review。总的来说,这个教程的内容,模块原理与工程细节兼有之。 我的一大感触是,A…
8 月
这里收两种帖子:站长标过精华的,和正文超过 2000 字的。 不挑版块 —— 一篇讲部署的长文既属于「折腾与教程」,也属于这里。