十四年,几次转折。从图像识别,走到推理与工作流。
深度卷积网络在 ImageNet 比赛中取得突破。图像识别,成为深度学习的重要转折点。
以注意力机制构建序列模型。后来许多语言模型,由此发展。
从左右两侧的语境学习语言表示。预训练,再微调:让模型适应不同任务。
1750 亿参数,探索少样本任务学习。同一个语言模型,通过文本接收不同任务。
文生图模型公开发布。一句描述,成为视觉创作的新入口。
基于 GPT-3.5 系列的对话产品登场。追问、修改、再来一次:交互方式变了。
LLaMA 向研究社区提供模型。GPT-4 推进能力与图像输入,生态继续展开。
将多种模态纳入同一模型。更自然的实时交互,成为新的方向。
通过训练,把更多计算用于作答前的推理。数学、代码、复杂问题,成为重点。
公开推理模型权重与技术报告。同时提供蒸馏模型,扩展研究与应用的入口。
Gemini 2.5、Claude 4 与 GPT-5 相继登场。工具调用和长任务,进入主流模型的设计。
V4 预览版公开,提供 Pro 与 Flash 两条线。百万 token 上下文,支持更长的任务材料。
3.5 Flash 聚焦工具与编码工作流。7 月,3.6 Flash 继续更新推理与速度。
继 7 月 Opus 5 后,Fable 5.1 于 9 月登场。聚焦编码、知识工作和长时间的问题求解。
8 月,V4-Pro 正式发布。9 月 10 日,V4.1-Flash 发布,继续版本迭代。
Astra、Sol、Luna,组成 GPT-6 模型家族。9 月 29 日,6.1 Sol 继续更新编码与专业能力。
面向复杂专业工作与网络安全防御。目前向可信网络安全防御者分阶段开放。
从识别与生成,到推理、工具和交付。今天的代表模型,仍在不断更新。
从看见,到行动。你会用这些能力,创造什么?