Ailin¹ 将于2026年9月15日上线,现在申请早期访问。

申请早期访问
ailin¹

集体智能:AI的下一个前沿

107,175 个AI模型,在一个集体智能模型中协调运作。

从个体AI到集体智能

过去的时代,AI一直在让单个模型变得更强大。下一个前沿是集体。

不同的模型贡献不同的视角,这不是一句口号:孔多塞陪审团定理与 Hong 与 Page 的多样性预测定理表明,结构化的多样性可以胜过单一专家的判断。结构化的集体策略让这项研究落地:模型独立推理、相互交叉核查,并收敛为一个可审计的答案。

目标不是用更多模型,而是让不同的智能更好地协同。

这就是集体智能。Ailin¹已经在运行它。

Ailin¹ Collective:宣称背后的机制

Ailin¹是为集体智能而生的。路由、发现、编排与验证,都是服务于它的机制。基于 107,175 个可发现的模型标识符,每一次请求都会被路由到 32 种已注册编排策略之一:追求速度时用单一模型,追求正确性时则协调多个模型去推理、辩论、相互交叉核查。

集体的响应附带决策溯源。协调路径始终可查。

  • 哪些模型运行过
  • 由哪种集体策略协调
  • 集体的成本是多少

与前沿模型的公开较量

我们把集体拿来与 GPT-5.5-pro、Claude Opus 4.8、Gemini 3.1 Pro 和 Grok 4.3 对比测试,评判依据是客观的、机器判定的答案,而不是主观口味。在一场可审计、可复现的实验中,集体全面胜过了这四者。查看代码仓库

Ailin¹ 将于2026年9月15日上线。

在正式开放前抢先加入,帮助塑造首个版本。

申请早期访问

Ailin¹ 集体

每一个请求,在调用任何单个模型之前,都会先经过同一条路由级联,它可以调用扎根于群体决策同行评审研究成果的集体策略,其中包括孔多塞陪审团定理与 Hong 与 Page 的多样性预测定理。你明确说出想要什么,就立即被尊重;你什么都不说,级联自己来决定。

最先进的能力,不是黑箱。是你能掌控的两个杠杆。

五个别名覆盖完整区间,从即时响应的单一模型,到五模型共识。两个独立字段划定边界:max_cost 是上限,quality_target 是下限。可以只设其中一个,也可以两个都设。无论你设定了哪条边界,Ailin¹ Collective 都绝不会越界。

大多数平台丢给你一份模型清单,就称之为选择权。Ailin¹ 交给你的是两个独立的杠杆,而不是一个滑块:答案需要达到多好,以及你愿意为此花多少钱。

  • 封顶支出,让质量自行找到合适的水平。

  • 保证一条下限,让成本随需求浮动。

  • 在两者之间锁定一条精确的区间。

Ailin¹ Collective 路由别名,各自的优化目标、典型成本以及适用场景
别名 优化目标 典型成本 适用场景
ailin-auto 均衡匹配,逐次请求决定 常规 默认选项。除成本与质量的均衡之外没有其他约束。
ailin-best 质量优先,成本不设限 最高 对正确性要求严格的任务,且成本不构成主要约束。
ailin-fast 延迟优先,单一模型 有严格延迟预算的交互式路径。
ailin-economy 成本优先,强制硬性上限 最低 大批量的后台任务
ailin-consensus 通过独立交叉核查确保正确性 更高,且是有意为之 需要消除“悄无声息地答错”这一失效模式,并为此接受更高成本。

每一次响应都会在 ailin_metadata 中返回决策溯源:strategy_usedmodels_usedcost_usd,因此路由决策可以被验证,而不必依赖信任。

请求:沿用你现有的 OpenAI 客户端,只需改动一行代码

from openai import OpenAI

client = OpenAI(
    base_url="https://api.ailin.one/v1",
    api_key="YOUR_KEY",
)

response = client.chat.completions.create(
    model="ailin-consensus",
    messages=[{"role": "user", "content": "..."}],
    extra_body={"max_cost": 0.15}
)

响应

{
  "ailin_metadata": {
    "strategy_used": "ailin-consensus",
    "models_used": [
      "gpt-5.5-pro",
      "claude-opus-4.8",
      "gemini-3.1-pro"
    ],
    "final_decider_model_id": "claude-opus-4.8",
    "final_decider_role": "synthesizer",
    "cost_usd": 0.0842,
    "subcalls": [
      { "model_id": "gpt-5.5-pro", "role": "voter", "cost_usd": 0.0301, "latency_ms": 1840, "success": true },
      { "model_id": "claude-opus-4.8", "role": "synthesizer", "cost_usd": 0.0288, "latency_ms": 2010, "success": true },
      { "model_id": "gemini-3.1-pro", "role": "voter", "cost_usd": 0.0253, "latency_ms": 1650, "success": true }
    ]
  }
}

Ailin¹ Collective 如何决策:路由级联

一套分层级联,按从快到慢的顺序依次评估。每次请求都会在安全的前提下尽早得出结果,因此简单请求迅速定案,复杂请求则继续调用更深的层级。

级联之前:语义缓存 近期一次请求的近似重复会立即返回缓存的响应,分诊以及以下全部六层都会被完全跳过,不是走捷径,而是彻底跳过。

  1. 显式路由

    你已经指定了别名、模型或策略,因此这一层会立即解析该请求,并始终优先于下面所有层;如果你指定的目标实际无法满足,请求会直接失败,而不会悄悄回落到其他方案。

  2. 分诊

    在集体中的任何模型运行之前,一个专门的模型会读取任务的意图与复杂度,并据此推荐策略。这是真正的分析,而不是查表,因此它本身也会产生一次真实的(较小的)调用成本。

  3. 配置档案库

    积累 5 条已记录结果后解锁

    当某个任务细分领域已记录至少 5 条结果后,Ailin¹ Collective 会复用已经验证过的方案,而不是重新推导。

    不是单一的黑箱之选,而是一个跨 6 个优化维度(质量、成本效率、速度、均衡性、可靠性、单位 token 质量)追踪的精英配置库,因此被复用的策略与模型组合,正是在你这次请求真正在意的维度上胜出的那一个。

  4. 成本 / 质量 / 延迟前沿

    积累 3 条已记录结果后解锁

    一旦有足够的历史数据积累(哪怕尚未证明存在精确匹配的细分领域配置),就直接对质量、成本、速度、成功率这些多目标之间的取舍进行优化。

  5. 习得策略偏好

    积累 5 条已记录结果后解锁

    一个汤普森采样(Thompson Sampling)多臂老虎机模型,根据长期实测结果为各项策略加权,持续修正级联自身的默认选择,并且会自我审计:如果它的整体实测奖励率跌破有史以来最佳快照的 95%,该模型会自动把整套习得状态回滚到那个最佳已知快照。

  6. 后备启发式规则

    如果以上各层都未能解决该请求,一套确定性的评分启发式规则会根据任务类型、复杂度和可用模型池选出策略。策略解析始终以一个决策终止,并记录在 strategy_used 中。

级联之后:成本治理关卡 无论第 1 至第 6 层选中了什么,只要不是显式路由,最后都会经过一次检查:当预估收益达不到门槛时,它仍可以把一个成本高昂的集体方案降级为单一模型。也只有显式指定的请求,才能跳过这道检查。

第 3 至第 5 层会随着某个任务细分领域使用历史的积累而独立解锁:成本 / 质量 / 延迟前沿只需 3 条已记录结果,配置档案库与习得策略偏好老虎机则需要 5 条;在此之前,只要第 1、2 层未能率先解决该请求,就由第 6 层那套确定性、可审计的启发式规则来决策。

32 种策略,扎根于研究

模型共同思考的方式有数十种,每一种都可审计。不同的问题,适合不同形式的集体推理。

这些都不是临时拼凑。目录中的每一种策略,都对应协调理论或集体决策研究中一项具体且有名有据的成果,而不是包装成科学的内部猜测。

  • consensus

    孔多塞陪审团定理(1785):在 3 至 5 个模型之间进行多数投票,并设有多样性下限,确保一致意见不会来自同质化的推理。

  • diversity-ensemble

    Hong 与 Page 的多样性预测定理(PNAS,2004):从构造上组建一支跨维度多样性最大化的团队。

  • debate

    模型在主持人引导下,通过结构化的多轮论辩相互质证。

  • swarm-explore

    并行探索,由分诊自动选用于开放式设计与架构工作。

  • stigmergic-refinement

    通过共享产物而非投票达成收敛,由分诊自动选用于高复杂度写作任务。

  • expert-panel

    在答案交付之前进行独立的多角色评审,可针对重验证类请求直接指定。

  • tri-role-collective

    Planner、Solver、Auditor:一套确定性状态机,而非训练出来的协调者,从结构上杜绝 Auditor 与刚刚以 Solver 身份给出答案的同一个模型或同一次推理过程重合。

  • 另有 25 种策略

选模型的不是你。是 Ailin¹ 集体。

简单的任务给以简洁,不简单的给以深度。你设定边界,Ailin¹ 集体在其中做决定,而总有一个字段可以覆盖它。

你从来不必判断一次请求需要一个模型还是五个。在任何一个模型被调用之前,每一次请求都会先经过 Ailin¹ Collective,也就是 ailin-auto 背后的同一套路由级联。很清楚自己要什么?直接指定:像 ailin-fast 这样的别名、某个具体模型,或者 strategy: "single",Ailin¹ Collective 会立即照办,不讨价还价,也不增加延迟。什么都不指定,级联就会自行读懂任务,选出契合它的处理形态。通过 Ailin¹ 运行单一模型,既不是退路,也不是降级,而是 Ailin¹ Collective 经常有意选择的一等路径。

单模型

从头到尾一致的单一声音。成本更低、延迟更低,和另一种选择一样触手可及。

ailin-fast

多模型集体

并行工作的独立提议者,在你看到一个答案之前就被交叉校验与整合,让分歧在到达你之前被捕获,而不是之后。

ailin-consensus

创作和重构呢?

在客观可验证的任务上(答案由机器判定,而非主观评判),胜出的正是集体;在开放式创意工作上,一个选得当的单一模型同样明确胜出。这正是分诊存在的原因:级联不会将所有任务类型一概平均处理,而是区别对待。创意工作默认走单一模型,可验证工作默认走集体。

你不需要靠死记硬背来决定何时用简单、何时用彻底。你说出你已经知道的,Ailin¹ Collective 补上你没说的,而推翻它的开关,始终只差一个字段。

成千上万的模型。只有合适的那些被激活。

优势在于集体

能访问更多模型本身并不是突破。真正重要的是:当不同的智能能够协同工作时,会发生什么。Ailin¹把持续发现的、由107,175个模型标识符构成的生态系统组织成一个集体,再只激活每个策略所需的那一部分。

107,175 个可发现的模型标识符。真正运行的模型因多样性而被选中,而不是被计入规模。
  • 始终最新

    新发布的模型会在其出现的同一个发现周期内被索引,无需等待任何发布排期。

  • 全光谱

    文本、视觉、音频与嵌入都在同一个目录里,在同一个端点背后。

智能一旦成为集体,就更强大

AI是围绕个体模型构建起来的。它的下一个前沿是集体。单个模型可以极为出色,但每一个仍反映其自身的架构、训练历史、盲点与失效模式。集体智能让独立的模型贡献不同视角、挑战假设、各自专业化、比较替代方案,并在任务允许之处验证结果。接下来的内容不是一份愿景清单,而是五种已经在生产环境中运行的机制,不是路线图。

关键处成本接近单一模型

在机器可以校验的任务上,确定性校验器会立即接受正确答案,并让集体中其余部分短路,因此这类任务的成本会更接近单一模型,而不是完整集体,恰恰是在集体准确率优势最强的地方。

韧性

一家供应商的故障,不必然成为你的故障。集体会自行绕开性能下降或失效的模型来路由,每一次响应仍然附带决策溯源:运行了哪种策略、调用了哪些模型、花费是多少。

结构性多样性

供应商、架构与训练目标通过轮询选择被强制拉开差异,因此同一次运行中连续调用的模型绝不会来自同一家供应商。这是把 Hong 与 Page 的多样性预测定理内建到路由层,而不是寄望于不同训练数据恰好产生有用的分歧。它能暴露盲点,但不保证消除盲点。

降低对单一供应商的依赖

一个集体横跨多个供应商,因此没有任何单一供应商的路线图、定价或政策能独自定义你的产品。

动态专业化

为合适的任务选合适的专家:推理、代码、视觉、长上下文,还是低延迟,在每次请求时实时选出。

常见问题

直截了当的回答,每一条都附上背后的字段、文件或数字。

接入与基础

兼容。核心接口(chat/completionsresponsesembeddingsmodels)可直接替换使用,并额外附加一个承载决策溯源信息的 ailin_metadata 区块。把你现有的客户端指向 Ailin¹ 端点,替换认证请求头,同样的请求结构即可正常工作。

是为集体智能而生的,这是一项具体的工程主张,而不是一句宣传语。路由决定一个请求去往何处;编排执行的是你自己写好的固定流程;集体智能定义的是多个模型如何协同推理、交叉核查并综合,路由、编排与验证都是服务于它的机制。这些机制可以追溯到具名的研究成果:Hong 与 Page 的多样性预测定理(PNAS,2004)、孔多塞陪审团定理(1785),以及 Woolley et al. 提出的集体智能因子“c”(Science,2010)。甚至有一种策略直接以此命名:diversity-ensemble 在源码中的名字就是“Diversity Ensemble (Page Theorem)”。一次请求会在这些策略之一下激活若干模型,然后返回一个答案,并附带它如何得出该答案的决策溯源。

实时目录中收录了 107,175 个可发现的模型标识符,跨数十家供应商持续发现并打上能力标签,绝不是由人手工编辑的静态列表。单次请求永远不会触及全部模型:每一种集体策略只激活自己所需的模型子集,而不是整个目录。

Ailin¹ 集体与策略

ailin-auto(均衡默认,交给级联决定)、ailin-best(质量优先,成本不设限)、ailin-fast(延迟优先,单一模型)、ailin-economy(成本优先,强制硬性上限)、ailin-consensus(通过独立交叉核查确保正确性)。先从 ailin-auto 开始。只有当你掌握了路由器不知道的信息时,才去选别的。

默认由 Ailin¹ 决定,通过 Ailin¹ Collective 的路由级联:如果你指定了什么,先走显式路由;如果没有,则进入分诊。你可以直接锁定某个模型、别名或策略来覆盖任意一层,而且你的选择始终优先。大多数集成场景从来都不需要这么做。

一套分层级联,按从快到慢的顺序依次评估:你若指定了,就走显式路由;分诊会对任务分类并映射到匹配的策略;配置档案库复用该任务细分领域中历来有效的配置;成本 / 质量 / 延迟前沿直接对这一取舍进行优化;而习得策略偏好(一个汤普森采样多臂老虎机模型)则根据长期实测结果为各项策略加权。中间这三层需要某个细分领域至少积累 5 条已记录结果才会启用;在此之前,由一套确定性、可审计的后备启发式规则来决策,也就是当以上各层都未能解决该请求时,为它们兜底的那套规则。

编排引擎中注册了 32 种,覆盖从单一路由模型,到九智能体集群并行探索同一个问题的全部范围。目前约有 11 种可被自动选用;其余仅支持显式调用,只要你指名,它们立刻完整可用。你也可以用 <strategy>:<tier> 的形式,直接指定这 32 种中的任意一种,例如 consensus:large,从而固定具体机制和价格档位。

在开放式创意写作和代码重构上,我们自己的(小样本)策略对比显示,一个强力的单一模型能彻底胜过完整的集体。而在客观可验证的任务上,这个对比会反转:经校验的共识策略答对了 38 次中的 37 次(97%),而与之同场测试的单一前沿模型为 68% 至 82%。Ailin¹ 默认不会给这类请求强加共识,也绝不会在任何方向上把你锁死在它自己的判断里:一个字段就能让你获得一以贯之的单一声音(ailin-faststrategy: "single"),而如果你真正想要的是别的,同样一个字段,也能给你独立的多模型验证(expert-paneltri-role-collective)。

成本与问责

可以,而且是逐次请求控制。max_cost 会在任何模型被调用之前,就对支出设定硬性上限;如果即将运行的策略预估成本超过它,请求会以 400 strategy_budget_exceeded 失败,而不是悄悄超支。quality_target 是与之配套的下限。每一次响应都会把真实数字回报给你:ailin_metadata.cost_usd,并附逐项明细。多模型策略的成本明显高于单一模型。而对于机器可以核验的任务(结构化抽取、数学、带测试的代码、事实类问答),这份溢价大多会消失:当经校验策略的确定性短路机制触发时,我们最新的前沿基准测得集体成本约为 $2.98/Mtok,比未经校验的集体路径便宜约 100x,与单一模型的定价处于同一数量级。

每一次响应都带有 ailin_metadata.final_decider_model_id,即生成你这个答案的确切模型,另有 final_decider_role(primary、synthesizer、fallback 或 cache)以及完整的 subcalls[] 数组,逐一列出每个参与者及其各自的成本、延迟和结果。如果你要就质量问题向服务商升级反馈,真正有用的是这个标识符,而不是“Ailin¹ API”。如果你需要还原一次多模型决策为什么会得出这个结果,可以启用持久化的协调追踪:GET /v1/collective/runs/:id/trace 会返回精确到毫秒级的完整阶段时间线,而且它的设计确保一个租户永远无法确认另一个租户的运行是否存在:查询别人的运行 ID,得到的会是与查询一个从未存在过的运行相同的 404。

证据与信任

在一套由 10 项客观可验证任务(答案由机器判定,而非主观评判)组成的基准测试中,共运行 38 次,一种共识策略搭配确定性校验器,在我们自己的评估中答对了 38 次中的 37 次,而与之同场测试的各个单一前沿模型(GPT-5.5-pro、Claude Opus 4.8、Gemini 3.1 Pro、Grok 4.3)为 68% 至 82%。在全部三轮测试中,该校验器没有一次选中过客观上错误的答案。没有它,其他集体策略会退回到与单一旗舰模型相同的区间,因此这一优势来自校验器,而不是额外的模型。这个分数可以凭已公开的原始输出和评估校验器复算。别只听我们说,你可以自己跑一遍。

不会,你的原始提示词不会被导出。训练数据导出管道完全不接触提示词内容:它只导出匿名化的运营元数据(使用的策略、成本、延迟、质量评分),追踪 ID 会用 SHA-256 加上一个保密的 pepper 值进行哈希,并截断至 16 个字符,你的组织和用户标识符也会在任何数据被暂存之前被剥离。如果这个 pepper 未配置,导出任务会拒绝运行,而不会导出未受保护的数据。

每一次调用都会经过身份认证、租户隔离、配额强制、按能力过滤的路由以及请求追踪。这些今天已经在生效,供应链与许可合规同样如此:AGPL 第 13 条合规端点(/source/license)、SLSA/Sigstore 发布溯源,以及每次发布都会附带的 SPDX 格式 SBOM。尚未完成的是:正式认证。SOC 2 与 ISO 27001 仍在推进中,尚未取得认证;如果你的采购流程需要某项特定的合规证明,请咨询你的客户团队,而不要仅凭营销文案(包括我们的)作出判断。这一切也不必只听我们说:支撑本页数据的协调引擎已在 github.com/ailinone/collective-intelligence 公开(AGPL-3.0-or-later),基准测试脚本和原始数据也都包含在内。

一起构建 AI 的集体时代

AI的下一个前沿是集体,它应该在开放中构建。在我们自己的基准测试中,经校验的共识策略在 38 项客观可验证任务中答对了 37 项,而孤立的单一前沿模型为 68% 至 82%,并且从未选中过一次错误答案。文档涵盖完整的 API 表面。仓库里放着协调引擎本身、基准测试脚本,以及这一结果背后的原始数据。