关于 Model Atlas

记录大模型、智能体、算力硬件与 AI 技术的演进。

收录标准

Model Atlas 精选大模型、智能体、算力硬件与技术演进中的公开事件。所有节点至少符合一项:已成为经典、具有技术代表性,或有可验证的行业与研究影响;同时须有可信的日期和来源。

技术代表性
优先收录形成广泛影响的基础方法、主流平台和主要代际。近期节点需有明确的能力、架构或使用方式变化,不仅依据热度。
版本重要性
保留首发、主要代际和实质能力更新。同日家族型号、推理档位与平台副本合并记录。
来源可核验
每条记录需有可核验的事件日期和来源。公开榜单、论文、技术文档及权威报道均可作为依据;有歧义时交叉核对。厂商知名度或上榜本身不构成收录理由。

机构排序

大模型页按 Artificial Analysis Intelligence Index 排序,每家机构取该次 Current 榜单中最高分的模型配置。同分沿用原榜顺序,无评分的机构列于末尾。代表模型不限于最新发布的型号。

带 * 的分数为 AA 估算。排序为人工维护的榜单快照,不与其他评测分数合并;其他时间线按收录顺序展示机构或项目。

Artificial Analysis · 榜单核对于

智能体与执行框架

智能体时间线涵盖编程助手、通用任务工具、执行框架与相关协议。收录对象需能够执行多步骤任务,或提供工具调用、状态管理等关键能力。

执行框架 · Agent Harness

围绕模型运行的工具与控制系统,负责管理工具调用、上下文、会话状态和任务循环。权限、文件系统与子智能体协作也可能由这一层负责。

模型与工具分别记录。产品首发、公开预览、框架公告和重大版本按各自事件日期收录。

算力硬件

算力时间线分为数据中心 GPU、专用加速器、算力系统、本地与边缘四类。优先收录主要计算架构、代表性芯片代际与部署平台,不按厂商逐一罗列全部产品。

产品公布、真机展示、正式供应与商用记录分别标注。云服务和超节点的公开日期不等同于芯片首发或量产日期。未来路线图和供货计划保留在相关节点的说明中,不作为已发生的产品发布。

硬件根据架构贡献、具体型号的部署、训练与推理服务或科研使用记录判断收录价值。具有明确技术代表性的新品可按公告收录,实际供应与应用另行说明。路线图、理论峰值和计划订单须标明性质。

规格与价格

算力标签保留精度、稠密或稀疏口径及具体配置。TFLOPS / PFLOPS 表示浮点运算速率,TOPS 表示每秒万亿次运算,须同时注明 INT8、FP4 等精度。所列理论峰值均不等于实际 tokens/s。单芯片、板卡和系统不能直接横向比较,发布时预估值会明确标注。

显存、带宽、架构与功耗均对应详情中注明的具体型号和配置。单芯片、双芯片板卡、整机与机架的数值不能直接混用;HBM、片上 SRAM 与系统统一内存也分别标明。

可核实的价格标为发布时的美国起售价,供回顾产品定位使用。峰值算力受精度、稀疏性和配置影响,本站不将这些数字合并排名;性能评测可参考 MLPerf 的具体任务与系统配置。

技术演进

AI 工程与技术里程碑合并为一条时间线,分为算法与方法、框架与计算、推理与部署、容器与沙箱。论文回答方法如何形成,工程项目记录方法如何进入训练和部署流程。

优先记录产生广泛影响的方法、项目首发与架构更新,不逐条收录论文、软件补丁或接口适配。编程智能体、Harness 与工具协议仍归入智能体页。

机构筛选按发布方、项目或代表性研究机构归类,用于检索,不替代完整作者署名。Transformer 在大模型与技术页共用同一条原始记录,两个入口均可查看来源。

容器与沙箱

收录与 AI 工程有实际联系的代表项目:Docker 负责环境打包,Kata 将虚拟机隔离接入容器运行时,Cloud Hypervisor 与 Firecracker 提供底层虚拟机能力;gVisor 采用用户态内核隔离,E2B 提供上层代码执行接口。原始发布与后续智能体应用分别说明,containerd、runc 等相关组件暂不单独列为节点。

日期与基本信息

事件日期与统计

论文采用首次公开日期;模型与工具采用官方发布、预览或权重开放日期。日期存在差异时,在详情中说明。Transformer 等基础架构研究单独作为论文节点收录。

图表统计本站收录记录,反映发布活动的变化。选择年份可查看月度分布,再选择月份筛选记录。机构、关键词等筛选共同生效;资料截止日期之后的月份以“—”表示。

原始资料只确认年份时,仅显示年份,不补写月日。这些节点计入年度数量,不分配到月份;月度图表会说明未分配的数量。每页独立统计,不将跨页引用的同一事件相加为独立发布。

模型类型

大模型按输入模态分为“文本”和“多模态”。多模态指模型可直接处理图像、音频或视频等非文本输入;通过外部 OCR、转写或视觉工具间接处理,不改变基础模型的分类。

分类对应所收录的版本或发布范围。家族节点包含多模态型号时归为多模态,具体型号的差异在详情中说明;后续产品升级不自动改写早期快照。通用、编程、推理与智能体用途可以重叠,因此保留为功能标签。

开源与闭源

本站采用便于检索的宽口径分类:模型已提供官方权重,或官方明确对应的公开基础版本,标为“开源”;工具的核心代码或协议规范可公开获取,也归入“开源”。仅提供托管产品或 API 的记录标为“闭源”。

开放状态按具体版本与核对日期记录,后续开放不改变原始发布日期。开源分类包含开放权重,不表示可以无条件使用;适用许可、研究审批或商业限制在详情中说明。

上下文与模型规格

规格来自官方文档、模型卡和论文,仅适用于所列版本。上下文、输入和输出长度以 tokens 为单位;输入与输出上限不能直接相加。原生窗口与需要额外配置的扩展窗口分别列出,未核实的字段不显示。

参数量使用 M(百万)、B(十亿)、T(万亿),MoE 模型区分总参数与激活参数。智能体工具的可用窗口取决于底层模型和运行配置。

API 价格

价格按官方公布的百万 tokens 单价记录,分别列出非缓存文本输入与文本输出费用,并标明币种、具体型号和核对日期。标签显示所注明型号的标准档价格;不同版本或长上下文阶梯价可在详情中查看。

缓存、批量处理、工具调用及音视频费用按各服务规则另计。开放权重不代表推理服务免费;历史型号的文档价格也不表示该型号当前仍可调用。

年度图与年份导航省略无记录的年份,并以 * 说明;月度图保留全年月份。数量只代表本站精选收录,不代表行业发布总量。仅明确到年份的记录计入年度,不分配到具体月份。

评测与资料来源

公开榜单用于发现候选条目和核对评测结果。日期、规格与使用记录可依据官方资料、论文、权威媒体或可信的行业研究;区分事件日期和报道日期。模型许可与 API 价格优先采用许可文件和服务文档,公布价格与实际可用性分别说明。

模型分数

列表显示已核对的 AA Intelligence Index 与 Arena Text Overall(Style Control)分数。AA 为基准任务综合指数;Arena 为文本对话偏好评分。点击标签可查看具体型号、推理配置、来源和快照日期,两种分数不直接换算。

只关联可明确匹配的版本。家族节点的标签注明实际参评型号,缺少或存在歧义的结果不展示。* 表示 AA 估算或 Arena 初步结果,详情中分别解释;分数不是发布时成绩,也不是实时榜单。

模型评测

智能体评测

不同榜单的任务集、模型版本、推理预算与评测环境各不相同,分数不直接换算。智能体成绩同时受到模型、执行框架和工具配置影响。

算力评测

维护说明

数据人工核对与维护,宁缺毋滥。常规小版本、重复上架、单纯更名和营销活动不单独收录;证据不足的候选条目暂不加入。每条记录保留来源及必要的日期说明。

本站为纯静态网站,搜索、筛选和图表均在浏览器中运行。首页首次访问参考浏览器语言,手动选择会被记住;中英文页面有独立地址,分享链接指定的语言优先。

发布记录、机构排名、模型规格、价格与评测分别保留核对日期。公开来源的结构化事实、原始链接与收录判断保存在本地快照中,后续优先复用,只补查新增或变化的资料。榜单分数与价格不实时同步。

发布资料截至

搜索全部时间线中的名称、机构或关键词。