关键词:RISCV-验证、RSI、Agent runtime、数据集治理、AI -native
Agent-runtime 是行业模型落地的下一个机会;
本文结合 chipstack 最新的行业动向,结合见闻,论证行业智能体的宏观发展方向。
摘要
AI 从能做事->做成事->持续的做成事是一个持续的过程。
距离上一篇 [芯片 Agent 产业化01] 提出设想的 2 个月后,从试验团队内部到市场的交流,有了一些映射的进展。
下文主要写,目前产出及后续的规划,构建投入产出的测评激励,后续发展。
在上一个阶段中组织了 FDE 的小试验,取得了些效果,介绍下团队的画像。
技术A: 本科 3 年经验 RISC-V 体系结构 AI harness -> CPU 验证自动化产线
技术B: 博士 RISC-V 体系结构 -> L2 验证自动化产线
技术C: ucagent 团队技术支持
部分验证结果如图:
上一个周期主要是从需求/结果出发考虑落地,更多的倾向于 FDE 的角色。
上一个周期主要关注以下两个维度。
方法论的闭环 result 可验收性
跨领域方法论 result 的可迁移性
PS: DSH 最近比较火的 HTTP trace 是一个很好的案例,对于收集 Agent runtime 全流程数据来说是很重要的标准,如:芯片行业的标准 Agent 都会配套一个收集器,收集器的工作形式如下所示(近期开源)。
综上,上述 demo 证明团队产出有行业认证,下面基于上文例子分享,为什么想到要这么做,以及行业级芯片的发展路线是怎样的。
一 需求从何而来
这套 Agent runtime 积累的设计数据流,未来可以直接用于生成迭代通用专用形芯片,将设计验证生产周期从年级缩短到月级——这是模型能力跃升的现实映射。
芯片 Agent 的主要需求来源有两大方面:
是物理世界对于更加充分描述世界的计算需求
模型 RSI 自进化的进化路线需求
基于此,芯片 Agent runtime 的社会意义在于为模型提供更高效的设计生产制造基础设施,进而更高效的提升社会运行效率,实现技术普惠。
由宏观向下一层,
如何定义时代需求的定制芯片?
如何让AI完备设计定制芯片?
如何批量高效的定制芯片?
三类需求分别包括社会需求挖掘,AI能力应用,工业批量化产线,芯片行业Agent存在的意义就是提供一系列平滑脚手架加速一系列工作。
二 如何获得结果
《实践论》讲得明白“认识从实践始,经过实践得到了理论的认识,还须再回到实践去。”不实践,就不知道梨子的滋味;不实践,就摸不着工作的规律。多实践,就是多次“变革现实”,在失败和碰壁中积累感性材料。
有了第一个成功点,便不能再停留。要沿着这条曲线,逐步扩大,放回更大范围去检验,去推广。如此实践、认识、再实践、再认识,循环往复,成功就一步步展开了。
结合到实际落地和推动中,经历了若干个阶段。
阶段1:模型能力与业务需求的磨合,这一阶段主要是需要深入理解业务痛点,并基于模型能力提出改进方案;
阶段2:信任建立与流程梳理,将业务产出交付个验收单位,由验收单位给出价值评估并决定是否合作;
阶段3:自动化继承与云 Sass,将业务梳理到自动化业务中,批量运行。
三 如何治理过程
先补充背景知识目前市面上的模型迭代与产品力具有下面的数据关系:
大参数模型->更多真实世界的反馈->更大参数的模型
基于此,治理的主要目的为两个目标:
不断拓展先进模型加速芯片工作的有效工作量
高效收集模型完整的闭环数据用于训练下一代旗舰模型
从目前公开的产品线来说,芯片领域暂时没有类似的机制,把视角切换到Anthropic,grok 在其他领域,类似的戏码已经出现过几次。
Figma -> Claude design 前端产品能力迁移
Grok bot 通用 Agent 治理收集运行平台
四 全自动产线落地与合作机会
基于上文论点,对于芯片行业来说,通用的行业级智能体,通常可以通过如下指标判断完成度:
1.针对设计/验证 指定任务的工作量有效性
2.任务拆解,并发能力与Token指标
3.产物治理的人机交互机制
由于AI 的发展过快,业内存在大量的行业 harness 公司,本文的论点不可避免的存在偏见,通过后续试验,会将验证有用的指标在后续文章分享。
上文的讨论梳理了行业级的 Token 工厂的逻辑,那么从试验场的角度,我们会搭建更高效的 Token 转化芯片生产力的渠道,让 Token 更高效的流动。
目前的 Token 总用量如下图,客观的说从 AI native 的视角来看,消耗量还有较多的提潜力。
通过规模化有效的 Token 利用,期望在 6 个月内让每一个自动化产线的人,每天可以接触 100B+ 的 token 的流动,通过接触更多的"智力"流动,提高对世界的认知,设计出更好的芯片。
如果对于数据治理,芯片领域的 Agent 产品使用感兴趣,欢迎进交流群中讨论,体验产品或共建 benchmark。
五 名词白话
在芯片验证场景中,Agent runtime 指的是支撑 AI Agent 完成“理解需求→调用工具→执行任务→分析结果→自我修正”闭环的运行时环境。 它不仅要管理工具链的调用,还要维护任务状态、上下文记忆和反馈数据流,是实现 AI-native 芯片设计的关键基础设施。 RSI RSI 是 Recursive Self-Improvement 的缩写,中文叫“递归自我改进”。简单说,就是让 AI 自己帮自己变强:AI 产出的结果,反过来变成训练下一代 AI 的数据,下一代更强,再产出更好的数据,如此循环。放到芯片行业,就是 AI 设计芯片的过程中产生的数据和经验,会喂给下一个版本的 AI,让它设计得更好、更快、更少犯错。RSI 是 Agent runtime 和数据集治理的底层驱动力——没有这个循环,数据只是死数据。 Agent runtime 你可以把 Agent runtime 理解成 AI Agent 的“工作车间”。一个 AI 要完成“理解需求→调用工具→执行任务→分析结果→自我修正”这一整套动作,不能只靠一个模型裸奔,它需要一个环境来记住任务到哪一步了、上下文是什么、该调哪个工具、反馈怎么回来。这个环境就是 Agent runtime。在芯片验证场景里,它还要管好 EDA 工具、仿真器、日志、覆盖率报告等一堆东西,让 AI 能稳定地、可追溯地把活儿干完。 数据集治理 “治理”不是简单地存数据,而是要让数据可复用、可追踪、高质量。一个 Agent 跑完一次验证,会留下:输入是什么、AI 怎么想的、调了哪些工具、结果对不对、人有没有修正。这些数据如果不整理,就是一堆噪音。数据集治理就是建立一套机制,把这些过程数据分门别类、打上标签、筛掉错误样本,确保能放心地拿去训练下一代模型。没有治理的数据集,越大反而越毒;治理好的数据集,才是 RSI 的燃料。 AI-native ative 是“原生”的意思。AI-native 不是“给旧流程加个 AI 补丁”,而是从第一天起就假设 AI 是干活的主力,整个系统围绕 AI 的工作方式来设计。比如传统 EDA 工具是人点鼠标、写脚本,AI 只是辅助;AI-native 的芯片设计平台,是 AI 直接调用工具、做决策、交结果,人只负责在关键节点审核。Agent runtime、数据集治理、验证产线,都是为了让 AI 能“原生”地工作,而不是硬塞进老流程里。 |
欢迎您关注开芯院公众号
▼
