AI 技术演进

69 个节点32 机构 / 项目

年度节点数量

发布记录

机构 / 项目
收录说明

共 69 个节点

2026

1 个节点

FlashAttention-4

FlashAttention

联合设计算法与内核流水线,适配 Blackwell 的计算和带宽特征。

研究论文推理与部署
资料来源

2025

3 个节点

AMD 公布 ROCm 7 预览,更新面向 Instinct 加速器的软件支持。

公开预览框架与计算
资料来源

面向多 GPU 推理的开源框架,协调分布式模型服务。

项目公开推理与部署
资料来源

重构推理核心,简化调度并改进前缀缓存与执行效率。

公开预览推理与部署
资料来源

2024

4 个节点

FlashAttention-3

FlashAttention

围绕 Hopper GPU 的异步执行与低精度能力优化注意力内核。

研究论文推理与部署
资料来源

GRPO · DeepSeekMath

DeepSeek里程碑

用组内相对奖励估计优势,减少强化学习训练对独立价值模型的依赖。

研究论文算法与方法
资料来源

2023

12 个节点

SGLang

SGLang里程碑

把结构化生成程序与运行时结合,复用前缀计算与缓存。

研究论文推理与部署
资料来源

MLX

Apple

为 Apple 芯片提供支持自动求导与统一内存的数组计算框架。

软件发布框架与计算
资料来源

Mamba

State Spaces里程碑

以选择性状态空间模型处理序列,探索注意力之外的建模方式。

研究论文算法与方法
资料来源

面向 NVIDIA GPU 的大模型推理库向所有开发者公开。

软件发布推理与部署
资料来源

FlashAttention-2

FlashAttention

调整注意力计算的工作分配,提高 GPU 并行执行效率。

研究论文推理与部署
资料来源

AWQ

麻省理工学院

参考激活分布保护关键权重,支持低比特模型部署。

研究论文推理与部署
资料来源

DPO

斯坦福大学里程碑

直接利用偏好数据优化语言模型,简化偏好对齐流程。

研究论文算法与方法
资料来源

QLoRA

华盛顿大学里程碑

将低比特量化与低秩适配结合,降低大模型微调的显存需求。

研究论文算法与方法
资料来源

PyTorch 2.0

PyTorch里程碑

引入 torch.compile,在保留现有开发方式的同时增加编译加速。

软件发布框架与计算
资料来源

llama.cpp

ggml里程碑

用 C/C++ 在本地设备运行 LLaMA,并支持量化推理。

软件发布推理与部署
资料来源

2022

8 个节点

Speculative Decoding

Google里程碑

由小模型起草、目标模型验证,在保持目标分布的同时加速生成。

研究论文推理与部署
资料来源

GPTQ

奥地利科学技术研究所

利用近似二阶信息进行训练后权重量化,降低大模型推理内存需求。

研究论文推理与部署
资料来源

Flow Matching

Meta里程碑

通过学习条件概率路径的向量场,训练连续流生成模型。

研究论文算法与方法
资料来源

ReAct

Google里程碑

交替生成推理步骤和工具动作,让语言模型根据环境反馈调整任务计划。

研究论文算法与方法
资料来源

FlashAttention

FlashAttention里程碑

减少高带宽显存与片上存储之间的数据搬运,加速精确注意力计算。

研究论文推理与部署
资料来源

采样多条推理路径,再聚合答案以提高推理稳定性。

研究论文算法与方法
资料来源

2021

5 个节点

Latent Diffusion

CompVis里程碑

在压缩后的潜在空间执行扩散,降低高分辨率图像生成的成本。

研究论文算法与方法
资料来源

Triton 1.0

OpenAI里程碑

用接近 Python 的语言编写 GPU 内核,并由编译器处理底层优化。

软件发布框架与计算
资料来源

LoRA

Microsoft里程碑

冻结基础权重,只训练低秩适配矩阵,降低模型微调成本。

研究论文算法与方法
资料来源

RoPE · RoFormer

追一科技里程碑

通过旋转变换将位置信息编码到注意力计算中。

研究论文算法与方法
资料来源

CLIP

OpenAI里程碑

通过图文对比预训练学习视觉概念,利用文字描述进行零样本图像分类。

项目公开算法与方法
资料来源

2020

6 个节点

Vision Transformer

Google里程碑

把图像切分为 patch 序列,直接使用 Transformer 进行视觉学习。

研究论文算法与方法
资料来源

CANN 3.0

华为

升级昇腾计算的软件栈,覆盖算子开发、模型编译与运行。

软件发布框架与计算
资料来源

DDPM

加州大学伯克利分校里程碑

通过逐步去噪训练生成模型,推动扩散模型的图像生成研究。

研究论文算法与方法
资料来源

RAG

Meta里程碑

把外部文档检索与文本生成结合,用检索结果补充模型知识。

研究论文算法与方法
资料来源

DeepSpeed · ZeRO

Microsoft里程碑

通过分片优化器状态等方式,降低分布式训练的显存占用。

软件发布框架与计算
资料来源

Neural Scaling Laws

OpenAI里程碑

系统研究语言模型性能与参数量、数据量及计算预算的关系。

研究论文算法与方法
资料来源

2019

3 个节点

Hugging Face Transformers

Hugging Face里程碑

用统一接口提供 Transformer 架构和预训练模型,支持研究与应用开发。

研究论文框架与计算
资料来源

Megatron-LM

NVIDIA里程碑

通过层内模型并行,将大型 Transformer 的训练分布到多块 GPU。

研究论文框架与计算
资料来源

2018

6 个节点

JAX

Google

结合 NumPy 风格接口、自动微分和面向加速器的编译。

软件发布框架与计算
资料来源

ONNX Runtime

Microsoft

跨平台推理运行时将模型格式与底层执行后端衔接起来。

软件发布推理与部署
资料来源

AWS 公开轻量 microVM 技术,以独立内核隔离短时、多租户工作负载。

项目公开容器与沙箱
资料来源

直接从原始文本训练子词模型,减少对语言专用分词的依赖。

研究论文框架与计算
资料来源

Kata Containers 1.0

Kata Containers

将轻量虚拟机隔离接入容器工作流,为容器或 Pod 提供独立的客户机内核。

软件发布容器与沙箱
资料来源

gVisor

Google

Google 公开用户态内核沙箱,为容器中的不受信任代码提供额外隔离。

项目公开容器与沙箱
资料来源

2017

6 个节点

ONNX

Microsoft

Microsoft 与 Facebook 提出通用模型表示,促进框架之间的互操作。

项目公开推理与部署
资料来源

PPO

OpenAI

通过约束策略更新,提高强化学习训练的稳定性与实现便利性。

研究论文算法与方法
资料来源

Transformer

Google里程碑

Google 团队在《Attention Is All You Need》中提出 Transformer,以注意力机制构建序列模型。

研究论文算法与方法
资料来源

Sparsely-Gated MoE

Google里程碑

用稀疏路由选择少数专家,扩大模型容量并控制每次计算量。

研究论文算法与方法
资料来源

PyTorch

PyTorch里程碑

以动态图和 Python 工作流支持深度学习研究。

软件发布框架与计算
资料来源

2016

1 个节点

Layer Normalization

多伦多大学里程碑

在单个样本的层内计算归一化统计量,减少对批次大小的依赖。

研究论文算法与方法
资料来源

2015

4 个节点

ResNet

Microsoft里程碑

通过残差连接改善深层网络的优化与训练。

研究论文算法与方法
资料来源

TensorFlow

Google里程碑

Google 开源机器学习框架,将内部研究工具开放给开发者。

软件发布框架与计算
资料来源

2014

5 个节点

Adam

阿姆斯特丹大学里程碑

结合梯度的一阶与二阶矩估计,自适应调整优化步长。

研究论文算法与方法
资料来源

Sequence to Sequence

Google里程碑

用编码器与解码器把变长输入序列映射为变长输出序列。

研究论文算法与方法
资料来源

cuDNN

NVIDIA里程碑

GPU 深度学习基础算子库,为框架提供优化后的计算实现。

项目公开框架与计算
资料来源

加性注意力

蒙特利尔大学里程碑

让翻译模型在生成每个词时动态关注不同的输入位置。

研究论文算法与方法
资料来源

GAN

蒙特利尔大学里程碑

通过生成器与判别器的对抗训练学习数据分布。

研究论文算法与方法
资料来源

2013

3 个节点

Docker

Docker

以镜像封装应用及依赖,推动可复现运行环境在开发和部署中的普及。

项目公开容器与沙箱
资料来源

word2vec

Google里程碑

高效学习词向量,以连续空间表示词语关系。

研究论文算法与方法
资料来源

2012

1 个节点

AlexNet

多伦多大学里程碑

利用 GPU 训练深层卷积网络,在 ImageNet 图像分类中取得显著进展。

研究论文算法与方法
资料来源

2007

1 个节点

CUDA SDK

NVIDIA里程碑

CUDA 工具包与 SDK 公开测试,让开发者用 C 语言编写 GPU 计算程序。

公开预览框架与计算
资料来源

已显示全部 69 个节点

搜索全部时间线中的名称、机构或关键词。