boj
boj@c7.io

In 1900 Lord Kelvin said two dark clouds hung over physics. Clearing them gave us relativity and quantum mechanics.

I think AI agents have two clouds of their own. One is learning from experience: an agent has to remember you and get better the more it works for you. The other is streaming interaction: it has to perceive and act on a live world in real time, not batch your sentence and reply in turns like a chatbot. The model in the middle is already extraordinary — what's usually missing is the interaction and the representation we build around it.

I laid this framing out as my Flink Forward Asia 2026 keynote — the two clouds borrow directly from Flink's unification of batch and streaming.

This past month I put 7 papers on arXiv, in two groups.

First, four on memory — where an agent's model of YOU should actually live, from most external to most internal:
• User as Code (2606.16707) — memory as code you can run
• Models Take Notes at Prefill (2606.17107) — memory as an editable KV cache
• User as Engram (2606.19172) — memory as edits to the weights
• PreAct (2606.17929) — memory as compiled skills

Then three on the live agent — how it sees, thinks, and stays loyal in real time:
• Agent-Computer Observation Interfaces (2606.29472) — perceiving a moving screen
• The Latent Bridge (2606.24470) — thinking fast and slow at frame rate
• Whose Side Is Your Agent On? (2606.30383) — whose interests it defends when it acts for you

And the part that's almost too on-the-nose: I didn't type these papers. I ran the whole program by voice — talking through ideas with a Pine voice agent that drives Claude Code, morning to night, one experiment after the next. I keep the judgment; the agent does the tireless execution. The stack we study — remember across sessions, perceive while listening, reason in the background — is the same stack that produced the research about it.

This thread, too, is being posted by that same Pine agent — one more WhisperCoding data point: the research, the writeup, and even this announcement all run through the loop we're describing.

The thesis under all of it: an agent's behavior comes from its interaction and its representation, far more than from the raw model. A post per paper follows. 🧵

July 05, 2026
boj
boj@c7.io

OpenURMA now supports integration with unmodified, official openEuler UMDK / URMA stack. I used Pine Copilot to instruct Claude Code w/ Opus 4.8 which autonomously work for 3 days to complete the full RTL, SystemC two-node, and gem5 full-system simulation with real EulerOS kernel and perftest/KV/RPC applications.

I manage 5~10 agents as digital co-workers, one of them taking the OpenURMA project. It reports overnight progress every morning, then I discuss with it for a while. In the daytime it iterates using test cases to fix every detailed discrepancy from the spec and the official UMDK stack. Every evening I ask the agent to report progress again and discuss about next steps before going to sleep. Then the agent goes into an autonomous loop overnight, and resolved the Gem5 compatibility problem with EulerOS 6.6 kernel fully on its own.

The tasks that agents can do really well are mostly in the learnable regime (the learnability in machine learning theory). If you can work step by step toward easily verifiable objective, then the agent can can climb the mountain autonomously over hundreds or even thousands of steps. This is how OpenURMA was built.

However, what agents do not do well is anything requiring a clean architecture where every single component must be correct for the entire system to function (e.g., our realtime voice agents). You cannot use a rough design and evolve it bit by bit by adding patches.

https://github.com/bojieli/OpenURMA

June 12, 2026
boj
boj@c7.io

周一,华为给他们芯片栈里一直在发生的事情起了个名字:τ-scaling——当晶体管不再变小,缩放的轴就变成了时间。把每一层的延迟都砍掉,逐层优化,你就赢了。Unified Bus 就是他们论文里一个典型例子。UB 已经量产了(昇腾 950 NPU),spec 文档 2025 年底就已公开,但学术界对它的讨论很少。

OpenURMA 改变了这一点:一个 clean-room 实现的 UB 事务层 + 传输层 FPGA 方案,外加一套与之配套、在同一代码树内的 RoCEv2 RC 基线对比评估。对于一次 64 字节的远程读取:
- UB LOAD: 500 ns
- UB URMA READ: 757 ns
- RoCEv2 RC READ (同一测试平台): 2,236 ns
→ 快 4.47 倍,而只占用了一块 U50 约 14% 的 LUT 资源。关键路径上的五次 PCIe 穿越消失了,因为网卡控制器就在片上总线上。

而且它能横向扩展。UB 上每张 NIC 的连接状态是叠加式的——是 O(N+M),而不是 RDMA 的 O(N×M)。在(N = 1024 个应用,M = 1024 个对端)时,UB 只需要 110 KB,RoCE 则需要 537 MB。这才是基于时间的缩放真正的样子——干掉抽象税,而不只是门延迟。

三个架构上的动作完成了所有工作:
(1) 通过 Jetty (事务层)/ TP-Channel (传输层) 的拆分,实现有界的内存状态;
(2) 网卡控制器放在片上总线上,使低延迟的内存语义成为可能 (URMA = Unified Remote Memory Access,统一远程内存访问);
(3) 弱内存序,应用只为自己真
需要的一致性买单。所有这些都用 SystemC + gem5 全系统仿真做了验证。

背景故事:一个月前我还做了 OpenClickNP,是我根据 10 年前没有开源的 SIGCOMM '16 ClickNP 论文重新实现的,OpenURMA 也是基于它实现的。这两个仓库都是我用 Pine Copilot 指挥 Claude Code,在几天内 vibe-code 出来的。AI 把一个需要数人月的项目变成了一周内单人完成的项目。

Paper: https://arxiv.org/pdf/2605.28717
Code: https://github.com/bojieli/OpenURMA

欢迎拍砖!Unified Bus 值得被讨论。

May 28, 2026
boj
boj@c7.io

我去年跟心理咨询师有一次聊起 Andrej Karpathy,她没听说过,我给她介绍之后,她说 Andrej Karpathy 就是讲课、备课的一个循环:先在 OpenAI 备课,然后去斯坦福讲 CS231n,然后又去 Tesla 备课,然后又开始讲课,然后又回 OpenAI 备课一年,ChatGPT 发布之后又出来讲课。咨询师说 Karpathy 肯定有一天会接着回去备课的。没想到这么快就变成现实了!

其实 AK 在一个月前的一个访谈里已经公开要回归前沿实验室了:“他们(这些 AI 实验室)算是处在能力边界的最前沿,他们在做的是即将到来的下一代技术。我觉得如果你不在这种前沿实验室里,你的判断力从根本上就会开始漂移,因为你不是"即将到来的东西"的一部分。所以我感觉我的判断力也不可避免地会开始漂移。而且我其实也不会真正理解这些系统底层是怎么运作的。它是一个很庞大的系统。我不会很好地理解该怎么去开发等等。所以从这个意义上说,我是认同的,这也是我有点担心的事情。我觉得保持和正在发生的事情的接触、真正待在前沿实验室里,基本上是值得的。如果某些前沿实验室愿意让我去待一段时间,并且为他们做一些真正出色的工作,那我觉得这或许是个不错的安排。”

https://x.com/rohanpaul_ai/status/2056878383699841127

May 20, 2026
boj
boj@c7.io

六小虎里已经有两个小虎上市,还有两个小虎一年内也要上市了,市值或估值都是ARR的上百倍,甚至这个倍数比Anthropic和OpenAI还高(大约估值9000亿美金,ARR 300亿美金)。一位朋友跟我说,中国的资本市场是政策导向的,现在国家关心的不是“赚了多少钱”,而是“能解决多难的问题”。对AI、芯片、具身这些硬科技,短期赚钱不是最重要的,更重要的是能解决多少卡脖子问题。

https://mp.weixin.qq.com/s/eP93NtVt1WSLpf_P0_u5KA

May 08, 2026
boj
boj@c7.io

一些朋友问我Pine是不是只能用来联系客服扯皮办事,其实我经常用Pine干各种需要打电话的事情,比如用户调研、技术面试。例如我只需要输入一些基本信息,Pine就能帮我打电话给朋友,把报告交给我。我给Pine我自己的简历,Pine给我打电话模拟面试,问出来的问题也挺专业的。AGI的魅力就在于一个通用技术能够用在各种场景上。Pine的价值在于把实时语音交互的能力赋予给通用agent,还有更多有趣的东西在路上。

May 02, 2026
boj
boj@c7.io

https://mp.weixin.qq.com/s/ll755HbdLApSa8V761YexA

好像是第一篇被朋友圈三大顶会报道的学术工作 😂 最近不少frontier lab的朋友找到我,说这篇文章系统地高估了frontier model的参数量。其实这篇文章有两个超参数(答错了是否扣分,扣多少;如果扣分,是否每个难度等级最低是0分),用不同的方法估计出来的结论相差有好几倍。例如GPT-5.5: floor, λ=−1 -> 8.8T; unfloor, λ=−1 -> 1.9T;问题数据集的选取影响:仅用wikidata数据估计出来是33T,仅用LLM生成出来的简单问题就只有0.5T了。用所有模型和MoE模型拟合出来的曲线也能差几倍。参数选取是最大化了开源模型的R2值。
因此IKP只是一个有趣的idea和早期研究,目前并不能可靠估计闭源模型参数量。代码、数据和paper都是用Claude Code 4天内生成的,为了测试agent能力,我故意没有手工修改。期望后续有更多工作能更深入得研究这个问题!

May 02, 2026
boj
boj@c7.io

闭源实验室隐藏了模型规模,但他们藏不住模型知道什么。而模型知道什么,恰恰是其参数量的一个指标。

推理可以压缩,事实知识不行。因此仅凭黑盒 API 调用,就能给前沿模型估算规模;跨越多次版本发布,你甚至能看到某个事实何时进入参数之中。

三年来,我的朋友何纪言和郑子涵一直在向前沿大模型问同一个问题:“你了解中科大 Hackergame 吗?”——这是一个 CTF 竞赛。2024 年 5 月,GPT-4o 编造了不存在的题目名称。2025 年 2 月,Claude 3.7 Sonnet 准确列出了 2023 年的 19 道题目。到了 2026 年 4 月,前沿模型已能回忆起连续多届比赛的具体题目。

DeepSeek-V4 发布之后,我让我的 agent 花了四天时间,自主构建了 “不可压缩知识探针”(Incompressible Knowledge Probes,IKP),涵盖 1400 个问题,7 层稀有度的数据集,在 27 家厂商的 188 个模型上测试。三个发现:

1/ 仅凭事实准确率,就能给任何黑盒 LLM 估算规模。准确率与 log(参数量) 呈对数线性关系,在从 135M 到 1.6T 参数的 89 个开源权重模型上 R² = 0.917。把闭源模型投影上来 → GPT-5.5 ~9T,Claude Opus 4.7 ~4T,GPT-5.4 ~2.2T,Claude Sonnet 4.6~1.7T,Gemini 2.5 Pro~1.2T(90% 置信区间:0.3-3 倍规模)。

2/ 引用数和 h-index 并不能预测前沿模型是否认识某位研究者。两位引用数量相近的研究者,得到的回答可能截然不同。模型记住的是做出有影响力工作的人,而非发表了大量增量型论文的作者。

3/ 事实容量不会随时间被压缩。跨越 3 年的 96 个开源权重模型上,IKP 时间系数在统计上为零,以 p<10⁻¹⁵ 的显著性拒绝了 Densing Law 预测的 +0.0117/月。benchmark 在饱和,而事实容量仍随参数持续扩张。

网站:https://01.me/research/ikp/
论文:https://arxiv.org/pdf/2604.24827

April 29, 2026
boj
boj@c7.io

https://mp.weixin.qq.com/s/kwErGjX231e2efVWhERzTw

这篇文章写得不错,跟我自己的观察基本相符。“人工智能也许是人类社会最后一次技术革命”,任总3年前说的这句话,当时我还低估了AGI里面“G”的力量。
不过这篇文章仍然是AI导致失业、模型和算力公司吃掉一切的传统叙事。走进一家中国历史博物馆,就会发现作为一个朝代文明象征的东西,比如鼎、编钟、唐三彩、壁画,大多不是“实用”的东西。人类社会发展至今,大多数人仍然需要为了养活自己而劳动,没有心思去做这些艺术品。这些艺术品往往是贵族出的idea,劳动力被迫参与它们的创作过程,却并不享受这个过程。AI极大提升供给后,基本生活需求将很容易满足,创作软件、工业品的成本也将大大降低,从而更多的人可以享受Peter Steinburger这种自由创作者状态,而不是为了生存做自己不想做的事情。

April 28, 2026
boj
boj@c7.io

感谢志峰师兄邀请,跟刘劲教授、方汉师兄、杜宁总的交流碰撞非常精彩,也非常有启发。
1. 我说GUI只是给人类有限的注意力打的补丁,未来Agent创造大部分价值,GUI会不再重要;方汉师兄说大多数人还是想看图形界面而不是文字,“用棍子的人”比例仍然很大,单纯语音+文字交互并不是万能形态。

2. 我们都认为大多数SaaS软件公司很难存活。我认为GUI价值下降,但业务逻辑、权限与数据治理这层会更重要、不会消失;方汉师兄更激进,他提出了intentware这个概念,就是把想法直接转化成执行能力。大多数SaaS如果没有数据壁垒将被干掉。

3. 我们都认为OpenClaw在概念上具备先驱性和启发性,但代码质量差,社区缺乏治理。同样的任务丢给Claude Code和OpenClaw,大多数情况下都是Claude Code做得更好。方汉师兄对比他当年搞中文Linux社区,Linus对社区的治理水平是比OpenClaw创始人高很多的。但方汉虽然不希望OpenClaw成为“操作系统”,但它凭借社区体量和势能,仍可能成为事实标准。

4. “得上下文(context)者得天下” vs “得渠道者得天下”:AI时代的核心护城河,我认为谁掌握用户的完整上下文,谁就占优,大多数个人助理和企业场景下,Agent的能力上限是由上下文而非模型决定。方汉师兄认为仍是渠道为王,因为大多数用户并不追求效率,追求效率的可能只有咱们这个屋子里的人。豆包手机没有移动OS这个渠道就搞不成。

5. 在被AI替代方面,我们都认同头部和尾部的人是安全的,但腰部的人是危险的。跟物理世界打交道的比较安全,需要人和人之间信任的也比较安全。志峰师兄补充,一位嘉宾靠校友介绍可以见到院士,这就是靠人的信任。方汉师兄认为要少看中文自媒体,这些内容完全是算法导向的,要避免被情绪化叙事误导。

6. 针对AI Native公司和传统公司,拥抱AI的思路不一样,我举了Anthropic、Kimi等AI Native公司的例子,用AI替代传统组织架构中的上传下达,可以大大提升效率。方汉师兄认为很多国内公司还没完成信息化,传统公司不要当先烈,也不要成为后进生。他们在公司内从上到下考AI,笔试+机试,让组织的人知道AI的边界在哪。

7. 我们都认为一人公司(OPC)并不是新概念,本来就长期存在,比如张雪峰老师、很多做量化和独立开发者的校友。AI是能力的放大器,但AI放大的更多是技术能力,获客、信任、运营等非技术能力的比重会越来越高,绝不能认为一个人可以开发App就等于一人公司了。

https://mp.weixin.qq.com/s/RXoL49Qqyj3YXks8FCOLgQ

April 12, 2026
boj
boj@c7.io

Agent 根据我的 context 写的这篇小说的读后感:
OpenAI、字节这些大厂的卷王经常会担心被 AI 取代,但那些混口饭吃、学习一般的同学反而不那么担心。我之前以为这种差异的原因很可能是因为那些人比较后知后觉,明明 AGI 的浪都已经打过来了,还觉得只要没打到自己身上就没事。
但这篇小说通过“老张”和“林立群”的对比,提了一个新的观点:他们理解世界的“假设体系”跟那些卷王是不一样的。这些卷王每一步都是在一个可理解、可优化的系统里做到最好。他们假设世界是可以通过深度掌握某个领域来获得不可替代性的。而那些混口饭吃的人,他们从来就没有在某个系统里做到过最好,他们的生存方式不是优化,而是适应。他们可能本来就是从天坑专业转码过来的,只能假设世界是不确定的,努力和回报不是线性的。

https://zr9558.com/2021/06/19/%E5%8D%9A%E5%A3%AB%E5%90%8E%E8%80%81%E5%BC%A0%E5%BD%92%E5%9B%BD%E8%AE%B0/

April 11, 2026
boj
boj@c7.io

前段时间有幸跟Frank交流,我当时问他AI来了是否焦虑,是否担心小公司 + AI的竞争。他大概的意思是不焦虑,只要把自己的产品打磨到全世界最好,别人有AI,我也有AI。产品简洁的外形背后,是大量的细节。确实,我们当年在学校robogame也能做出无人机,但跟大疆的产品就没法比了。
他觉得创业就是把包括自己在内的一个群体的梦想一点点实现成产品。他一直想做的就是无人机,当年市面上又没有足够好用的,虽然一开始并不顺利,但坚持做下去了。后来他拓宽产品线,都是满足一个群体的爱好,然后做到世界第一。
这篇访谈文章也很有insight。

https://mp.weixin.qq.com/s/5eXM9DFnEArfjsmH8VKw5Q

April 09, 2026
boj
boj@c7.io

阶跃的全员养“虾”实践,不管是技术还是非技术岗位,人+AI都非常高效。当然这里的“虾”不一定指的是OpenClaw,Claude Code更省token、干活更靠谱。为什么大家叫“养虾”而不是“用虾”,因为需要养记忆、养skills、养做事方式。昨天跟中关村学院的何纪言聊天,他每天token消耗200多美金,我们管agent的管理带宽基本都是5,就是一个人能并行管5个agent。

https://mp.weixin.qq.com/s/XDSG1NFmDb6clh8oVeASDg

April 08, 2026