跳到正文
原文
Thinking Machines Lab:News(网页)·· 2025-12-12精选AI 评分67

Thinking Machines Lab 宣布 Tinker 全面开放并支持视觉输入

Tinker: General Availability and Vision Input

AI 导读

Thinking Machines Lab 宣布 Tinker 正式开放(GA),取消候补名单,并新增四项更新:支持微调 Kimi K2 Thinking(万亿参数。

推荐理由

官方宣布 Tinker 全面开放并新增视觉输入,附上 VLM 与传统视觉基线在少样本分类下的对比数据,可作选型参考。

正文 · AI 翻译

今天我们宣布 Tinker 的四项更新:

  • 无需再等待名单
  • 全新推理模型:Kimi K2 Thinking
  • 兼容 OpenAI API 的全新推理接口
  • 通过 Qwen3-VL 支持视觉输入

正式全面开放

等待名单已成为过去!现在所有人都可以使用 Tinker;在此注册即可开始。请查看 Tinker 主页了解可用模型和定价,并查阅 Tinker 手册获取代码示例。

使用 Kimi K2 Thinking 进行更多推理

用户现在可以在 Tinker 上微调 Kimi K2 Thinking。Kimi K2 拥有万亿参数,是我们目前阵容中最大的模型。它专为长链推理和工具使用而构建。

兼容 OpenAI API 的采样

Tinker 有一个用于推理的标准函数:

prompt = types.ModelInput.from_ints(tokenizer.encode("The capital of France is",))
params = types.SamplingParams(max_tokens=20, temperature=0.0, stop=["\n"])
future = sampling_client.sample(prompt=prompt, sampling_params=params)

在此次发布中,我们添加了兼容 OpenAI API 的脚手架,可通过指定路径快速从模型采样,即使模型仍在训练中。这也意味着 Tinker 现在可以即插即用地与任何兼容 OpenAI API 的平台配合使用。更多信息请参阅我们的 Tinker 文档。

response = openai_client.completions.create(
    model="tinker://0034d8c9-0a88-52a9-b2b7-bce7cb1e6fef:train:0/sampler_weights/000080",
    prompt="The capital of France is",
    max_tokens=20,
    temperature=0.0,
    stop=["\n"],
)

通过 Qwen3-VL 支持视觉输入

我们向 Tinker 添加了两个视觉模型:Qwen3-VL-30B-A3B-Instruct 和 Qwen3-VL-235B-A22B-Instruct。借助这些模型,用户可以处理图片、截图和图表,用于各种应用。

要输入图像,只需将 ImageChunk(由以字节形式保存的图像组成)与文本块交错组合。例如:

model_input = tinker.ModelInput(chunks=[
  tinker.types.ImageChunk(data=image_data, format="png"),
  tinker.types.EncodedTextChunk(tokens=tokenizer.encode("What is this?")),
])

这些视觉输入可以开箱即用地用于各种应用,包括 SFT 和 RL 微调。

为了展示视觉理解的实际效果,我们分享了一份新的手册配方,用于将 VLM 微调为图像分类器。Qwen3-VL-235B-A22B-Instruct 即使每类只给出一个示例也能获得合理的准确率;随着标注数据增多,性能会进一步提升。

使用 Tinker 训练图像分类器

为了展示 Tinker 的新视觉能力,我们微调了 Qwen3-VL-235B-A22B-Instruct,在四个经典数据集上进行图像分类:

  • Caltech 101,一个包含 101 个通用物体类别的数据集。
  • Stanford Cars,一个包含汽车品牌、型号和年份的数据集。
  • Oxford Flowers,一个包含花卉物种的数据集。
  • Oxford Pets,一个包含宠物品种的数据集。

由于 Qwen3-VL 是一个语言模型,我们将分类构建为文本生成:给定一张图像,模型输出类别名称。我们将此方法与传统的视觉基线进行比较,即微调仅视觉模型——DINOv2-base。DINOv2 是一个自监督视觉 Transformer,经过训练用于编码图像,通常用作纯计算机视觉任务的主干。对于 DINOv2,我们添加一个分类头,用于预测所有 N 个类别上的分布。两个模型均使用 LoRA 进行微调。

在许多真实世界用例中,标注图像数据稀缺,因此数据效率是我们关注的主要指标。我们展示了在每类标注示例数量上扫描时的分类准确率,从仅一个示例开始。

微调后的 Qwen3-VL-235-A22B 与 DINOv2 在简单图像分类任务上的性能比较。

在数据有限的场景下,Qwen3-VL-235-A22B 优于 DINOv2。它不仅是一个更大的模型,而且作为 VLM,它还开箱即用地具备语言知识(即什么是“金毛寻回犬”或“向日葵”)。Qwen3-VL 这种通用的语言与视觉能力使其可以轻松用于分类之外的视觉任务。

节日快乐

Tinker 的存在是为了让开发者和研究人员能够训练和定制最先进的模型。一如既往,我们期待看到你们用 Tinker 构建的作品。节日快乐!

来源:Thinking Machines Lab:News(网页) · thinkingmachines.ai