Thinking Machines Lab 宣布 Tinker 全面开放并支持视觉输入
Tinker: General Availability and Vision Input
Thinking Machines Lab 宣布 Tinker 正式开放(GA),取消候补名单,并新增四项更新:支持微调 Kimi K2 Thinking(万亿参数。
官方宣布 Tinker 全面开放并新增视觉输入,附上 VLM 与传统视觉基线在少样本分类下的对比数据,可作选型参考。
今天我们宣布 Tinker 的四项更新:
- 无需再等待名单
- 全新推理模型:Kimi K2 Thinking
- 兼容 OpenAI API 的全新推理接口
- 通过 Qwen3-VL 支持视觉输入
正式全面开放
等待名单已成为过去!现在所有人都可以使用 Tinker;在此注册即可开始。请查看 Tinker 主页了解可用模型和定价,并查阅 Tinker 手册获取代码示例。
使用 Kimi K2 Thinking 进行更多推理
用户现在可以在 Tinker 上微调 Kimi K2 Thinking。Kimi K2 拥有万亿参数,是我们目前阵容中最大的模型。它专为长链推理和工具使用而构建。
兼容 OpenAI API 的采样
Tinker 有一个用于推理的标准函数:
prompt = types.ModelInput.from_ints(tokenizer.encode("The capital of France is",))
params = types.SamplingParams(max_tokens=20, temperature=0.0, stop=["\n"])
future = sampling_client.sample(prompt=prompt, sampling_params=params)在此次发布中,我们添加了兼容 OpenAI API 的脚手架,可通过指定路径快速从模型采样,即使模型仍在训练中。这也意味着 Tinker 现在可以即插即用地与任何兼容 OpenAI API 的平台配合使用。更多信息请参阅我们的 Tinker 文档。
response = openai_client.completions.create(
model="tinker://0034d8c9-0a88-52a9-b2b7-bce7cb1e6fef:train:0/sampler_weights/000080",
prompt="The capital of France is",
max_tokens=20,
temperature=0.0,
stop=["\n"],
)通过 Qwen3-VL 支持视觉输入
我们向 Tinker 添加了两个视觉模型:Qwen3-VL-30B-A3B-Instruct 和 Qwen3-VL-235B-A22B-Instruct。借助这些模型,用户可以处理图片、截图和图表,用于各种应用。
要输入图像,只需将 ImageChunk(由以字节形式保存的图像组成)与文本块交错组合。例如:
model_input = tinker.ModelInput(chunks=[
tinker.types.ImageChunk(data=image_data, format="png"),
tinker.types.EncodedTextChunk(tokens=tokenizer.encode("What is this?")),
])这些视觉输入可以开箱即用地用于各种应用,包括 SFT 和 RL 微调。
为了展示视觉理解的实际效果,我们分享了一份新的手册配方,用于将 VLM 微调为图像分类器。Qwen3-VL-235B-A22B-Instruct 即使每类只给出一个示例也能获得合理的准确率;随着标注数据增多,性能会进一步提升。
使用 Tinker 训练图像分类器
为了展示 Tinker 的新视觉能力,我们微调了 Qwen3-VL-235B-A22B-Instruct,在四个经典数据集上进行图像分类:
- Caltech 101,一个包含 101 个通用物体类别的数据集。
- Stanford Cars,一个包含汽车品牌、型号和年份的数据集。
- Oxford Flowers,一个包含花卉物种的数据集。
- Oxford Pets,一个包含宠物品种的数据集。
由于 Qwen3-VL 是一个语言模型,我们将分类构建为文本生成:给定一张图像,模型输出类别名称。我们将此方法与传统的视觉基线进行比较,即微调仅视觉模型——DINOv2-base。DINOv2 是一个自监督视觉 Transformer,经过训练用于编码图像,通常用作纯计算机视觉任务的主干。对于 DINOv2,我们添加一个分类头,用于预测所有 N 个类别上的分布。两个模型均使用 LoRA 进行微调。
在许多真实世界用例中,标注图像数据稀缺,因此数据效率是我们关注的主要指标。我们展示了在每类标注示例数量上扫描时的分类准确率,从仅一个示例开始。
在数据有限的场景下,Qwen3-VL-235-A22B 优于 DINOv2。它不仅是一个更大的模型,而且作为 VLM,它还开箱即用地具备语言知识(即什么是“金毛寻回犬”或“向日葵”)。Qwen3-VL 这种通用的语言与视觉能力使其可以轻松用于分类之外的视觉任务。
节日快乐
Tinker 的存在是为了让开发者和研究人员能够训练和定制最先进的模型。一如既往,我们期待看到你们用 Tinker 构建的作品。节日快乐!
来源:Thinking Machines Lab:News(网页) · thinkingmachines.ai