Ailin¹ 將於 2026 年 9 月 15 日推出。即刻申請搶先體驗。

申請搶先體驗
ailin¹

集體智慧:AI的下一個前沿

107,175 個AI模型,在一個集體智慧模型中協調運作。

從個體AI到集體智慧

過去的時代,AI一直在讓單一模型變得更強。下一個前沿,是集體。

不同的模型貢獻不同的視角,這不是一句口號:Condorcet 的陪審團定理以及 Hong 與 Page 的多樣性預測定理,都證明了結構化的多樣性能勝過單打獨鬥的專業能力。結構化的集體策略讓這些研究真正發揮作用:模型各自獨立推理、相互交叉核實,並收斂為單一且可稽核的答案。

目標不是更多模型。是不同的智慧更好地協同。

這就是集體智慧。Ailin¹ 已經在運行它。

Ailin¹ Collective:宣稱背後的機制

Ailin¹ 是為集體智慧而生的。路由、發現、編排與驗證,都是服務於它的機制。基於 107,175 個可發現的模型識別碼,每個請求都會被導向 32 種已註冊編排策略之一:講求速度時用單一模型,講求正確性時則協調多個模型一起推理、辯論、相互核實。

集體的回應附帶決策溯源。協調路徑始終可查。

  • 運行了哪些模型
  • 由哪種策略協調
  • 集體成本是多少

與前沿模型的公開較量

我們將集體與 GPT-5.5-pro、Claude Opus 4.8、Gemini 3.1 Pro 和 Grok 4.3 進行對比測試,評判依據是客觀的、機器判定的答案,而不是主觀口味。在一場可稽核、可重現的實驗中,集體全面勝過這四個模型。查看儲存庫

Ailin¹ 將於 2026 年 9 月 15 日推出。

搶在正式發布前加入,協助形塑第一個版本。

申請搶先體驗

Ailin¹ 集體

每一個請求,在呼叫任何單一模型之前,都會先經過同一套路由級聯,這套級聯能夠動用以群體決策同儕審查研究為根基的集體策略,其中包括 Condorcet 的陪審團定理與 Hong 與 Page 的多樣性預測定理。你明確說出想要什麼,就立即被尊重;你什麼都不說,級聯自己來決定。

最先進的技術不是黑箱。是你能掌控的兩個槓桿。

五個別名涵蓋完整範圍,從即時回應的單一模型,到五模型共識。兩個獨立欄位劃定邊界:max_cost 是上限,quality_target 是下限。你可以只設定其中一個、只設定另一個,或兩者都設定。Ailin¹ Collective 絕不會跨越你所設定的任何一條邊界。

多數平台丟給你一份模型清單,就稱之為選擇權。Ailin¹ 給你的是兩個獨立的槓桿,而不是一個滑桿:答案需要多好,以及你願意為此付出多少。

  • 封頂花費,讓品質自行找到落點。

  • 保證一個下限,讓成本隨需求變動。

  • 鎖定兩者之間一條精確的區間。

Ailin¹ Collective 路由別名,各自的最佳化目標、典型成本,以及適用時機
別名 最佳化目標 典型成本 適用時機
ailin-auto 均衡取捨,逐請求決定 一般 預設值。除了成本與品質的均衡之外,沒有其他限制。
ailin-best 品質優先,成本不設限 最高 正確性至關重要、且成本並非主要限制的工作。
ailin-fast 低延遲,單一模型 偏低 有嚴格延遲預算的互動路徑。
ailin-economy 成本優先,強制硬性上限 最低 大量的背景批次工作
ailin-consensus 透過獨立交叉核實確保正確性 刻意偏高 無聲的錯誤正是你付費要消除的失效模式。

每個回應都會在 ailin_metadata 中回傳決策溯源:strategy_usedmodels_usedcost_usd,因此路由決策可以直接驗證,而不必仰賴信任。

請求:沿用你既有的 OpenAI 用戶端,只需改動一行程式碼

from openai import OpenAI

client = OpenAI(
    base_url="https://api.ailin.one/v1",
    api_key="YOUR_KEY",
)

response = client.chat.completions.create(
    model="ailin-consensus",
    messages=[{"role": "user", "content": "..."}],
    extra_body={"max_cost": 0.15}
)

回應

{
  "ailin_metadata": {
    "strategy_used": "ailin-consensus",
    "models_used": [
      "gpt-5.5-pro",
      "claude-opus-4.8",
      "gemini-3.1-pro"
    ],
    "final_decider_model_id": "claude-opus-4.8",
    "final_decider_role": "synthesizer",
    "cost_usd": 0.0842,
    "subcalls": [
      { "model_id": "gpt-5.5-pro", "role": "voter", "cost_usd": 0.0301, "latency_ms": 1840, "success": true },
      { "model_id": "claude-opus-4.8", "role": "synthesizer", "cost_usd": 0.0288, "latency_ms": 2010, "success": true },
      { "model_id": "gemini-3.1-pro", "role": "voter", "cost_usd": 0.0253, "latency_ms": 1650, "success": true }
    ]
  }
}

Ailin¹ Collective 如何決策:路由級聯

這是一套分層級聯,依由快到慢的順序評估。每個請求都會在能安全定案的最早階段解析完成,因此簡單的請求很快就有結果,較困難的請求則會動用更深層的判斷。

級聯之前:語意快取 與近期某個請求幾乎重複的請求,會立即得到快取的回應。分流與下方全部六層都會被完全跳過,不是走捷徑,而是徹底略過。

  1. 明確路由

    你已指定別名、模型或策略,因此這一層會立即解析請求。它永遠優先於下方所有層級;而如果你指定的目標實際上無法被滿足,請求會直接失敗,而不會靜默地退回到其他選項。

  2. 分流

    在任何集體模型執行之前,一個專責模型會判讀任務的意圖與複雜度,並提出建議策略。這是真正的分析,不是查表對應,因此它本身就會產生一次真實(但小額)的呼叫成本。

  3. 組態檔案庫

    累積 5 筆結果紀錄後解鎖

    一旦某一類任務累積至少 5 筆結果紀錄,Ailin¹ Collective 就會重複採用已證實有效的做法,而不是重新推導。

    不是單一的黑箱選擇,而是依 6 個最佳化軸線(品質、成本效益、速度、平衡度、可靠性、每 token 品質)持續追蹤、屬於該任務類別的一整套精選組態庫,因此被重複採用的策略與模型組合,正是在你這次請求所在意的那個維度上真正勝出的組合。

  4. 成本 / 品質 / 延遲前緣

    累積 3 筆結果紀錄後解鎖

    一旦累積了足夠的歷史紀錄,即使還沒有證實吻合的精確任務類別,也會直接最佳化這項多目標取捨(品質、成本、速度、成功率)。

  5. 學習式策略偏好

    累積 5 筆結果紀錄後解鎖

    一套 Thompson Sampling 拉霸演算法會依據長期實測結果為各項策略加權,持續修正級聯本身的預設判斷,而且它會自我稽核:如果整體實測的回報率低於它有史以來記錄過的最佳快照的 95%,這套演算法就會自動將整個學習狀態回滾到那個最佳已知快照。

  6. 後備啟發式

    若以上各層都未能解析請求,一套確定性的計分啟發式規則會依任務類型、複雜度與可用的模型池選出策略。策略解析必定以一個決策告終,並記錄於 strategy_used

級聯之後:成本治理閘門 不論第 1 至第 6 層選出了什麼,只要你不是明確路由,最後還有一道檢查:當預估的效益不足以跨過門檻時,它仍可以把一個昂貴的集體選擇降級回單一模型。同樣地,只有明確指定的請求才能跳過這道檢查。

第 3 至第 5 層會隨著某一類任務的使用紀錄累積而各自獨立解鎖:成本 / 品質 / 延遲前緣只需 3 筆結果紀錄,組態檔案庫與學習式策略偏好拉霸演算法則需要 5 筆。在解鎖之前,只要第 1、2 層未能率先解析請求,就由第 6 層那套確定性、可稽核的啟發式規則做出判斷。

32 種策略,根植於研究

模型共同思考的方式有數十種,每一種都可稽核。不同的問題,適合不同形式的集體推理。

這些都不是臨時拼湊的。目錄中的每一種策略,都對應到協調或集體決策研究中具體且有名稱的成果,而不是包裝成科學的內部猜測。

  • consensus

    孔多塞陪審團定理(1785):在 3 至 5 個模型之間進行多數決,並設有多樣性下限,避免共識只是同質推理的複製。

  • diversity-ensemble

    Hong 與 Page 的多樣性預測定理(PNAS,2004):從組建方式上就讓團隊的跨維度多樣性最大化。

  • debate

    多個模型在主持人的引導下,經過結構化的多輪辯論。

  • swarm-explore

    並行探索,分流機制會在開放式設計與架構工作中自動選用。

  • stigmergic-refinement

    透過共享產出物而非投票達成收斂,分流機制會在高複雜度寫作任務中自動選用。

  • expert-panel

    答案交付前先經過多角色獨立審查,可在重視驗證的請求中直接指定。

  • tri-role-collective

    Planner、Solver、Auditor:一套確定性的狀態機,而不是訓練出來的協調者,並且在結構上禁止 Auditor 使用與剛才以 Solver 身分產生答案的同一個模型或同一次推理過程。

  • 另有 25 種策略

選模型的不是你。是 Ailin¹ 集體。

簡單的任務給以簡潔,不簡單的給以深度。你設定邊界,Ailin¹ 集體在其中做決定,而總有一個欄位可以覆寫它。

你永遠不必決定一個請求該用一個模型還是五個。在呼叫任何模型之前,每個請求都會先經過 Ailin¹ Collective,也就是 ailin-auto 背後的同一套路由級聯。已經很清楚自己要什麼?直接指定就好:像 ailin-fast 這樣的別名、某個特定模型,或 strategy: "single",Ailin¹ Collective 會立即照辦,不討價還價,也不增加延遲。什麼都不說,級聯就會自行解讀任務,挑出合適的執行形式。透過 Ailin¹ 執行單一模型並不是退路,也不是降級,而是 Ailin¹ Collective 經常且刻意選擇的一級路徑。

單一模型

從頭到尾一致的單一聲音。成本更低、延遲更低,和另一種選擇一樣觸手可及。

ailin-fast

多模型集體

並行工作的獨立提案者,在你看到一個答案之前就被交叉校驗與整合,讓分歧在到達你之前被捕捉,而不是之後。

ailin-consensus

創作與重構呢?

在客觀可驗證的任務上,也就是由機器核實而非主觀評判,勝出的正是集體。在開放式創意工作上,一個選對的單一模型同樣明顯勝出。這正是分流存在的原因:級聯不會把所有任務類型一視同仁地平均處理,而是清楚區分它們。創意工作預設走單一模型,可驗證工作則走集體。

你不需要靠記憶去判斷什麼時候該用簡單、什麼時候該用徹底。你說出你知道的部分,Ailin¹ Collective 補上你沒說的部分,而要推翻它,永遠只差一個欄位。

成千上萬的模型,只啟用真正合適的那些。

優勢在於集體

能存取更多模型本身並不是突破。真正重要的是:當不同的智慧能夠協同工作時,會發生什麼。Ailin¹把持續發現的、由107,175個模型識別碼構成的生態系統組織成一個集體,再只啟用每個策略所需的那一部分。

107,175 個可發現的模型識別碼。實際運行的模型是為了多樣性而挑選,不是為了衝數量。
  • 始終最新

    新發布的模型會在它出現的那一輪發現週期中就被索引,不需要等待任何發版排程。

  • 全頻譜

    文字、視覺、音訊與嵌入都在同一個目錄裡,在同一個端點背後。

智慧一旦成為集體,就更強大

AI是圍繞個體模型構建起來的。它的下一個前沿是集體。單一模型可以極為出色,但每一個仍反映其自身的架構、訓練歷史、盲點與失效模式。集體智慧讓獨立的模型貢獻不同視角、挑戰假設、各自專業化、比較替代方案,並在任務允許之處驗證結果。以下並不是一份願望清單,而是五項已經在生產環境中運行的機制,不是路線圖。

關鍵時刻,成本近乎單一模型

在機器可以核對的任務上,確定性驗證器會立即接受正確答案,並讓集體其餘部分短路跳過,因此這類任務的成本會遠比集體其餘部分更接近單一模型,而這正是集體準確度優勢最強的地方。

韌性

一家供應商的故障,不會變成你的故障。集體會自動繞開效能下降或失效的模型,每一次回應仍然附帶決策溯源:使用了哪種策略、動用了哪些模型,以及花費是多少。

結構性多樣性

供應商、架構與訓練目標會透過輪詢式選擇被強制拉開差距,因此同一次執行中連續出現的模型絕不會來自同一家供應商。這是把 Hong 與 Page 的多樣性預測定理內建進路由層,而不是寄望不同訓練資料剛好產生有用的分歧。它能揭露盲點,但不保證能消除盲點。

降低對單一供應商的依賴

一個集體橫跨多個供應商,因此沒有任何單一供應商的路線圖、定價或政策能獨自定義你的產品。

動態專業化

為合適的任務選合適的專家:推理、程式碼、視覺、長語境,還是低延遲,在每次請求時即時選出。

常見問題

直截了當的回答,每一條都附上背後的欄位、檔案或數字。

接入與基礎

是的。核心介面(chat/completionsresponsesembeddingsmodels)可直接替換沿用,並額外附加一個 ailin_metadata 區塊,用來承載決策溯源資訊。把現有用戶端指向 Ailin¹ 端點,換掉認證標頭,同樣的請求格式就能運作。

為集體智慧而生,而且這是一項具體的工程主張,不是一句宣傳語。路由決定一個請求去向何處;編排執行的是你自己寫下的固定流程;集體智慧則是定義多個模型如何一起推理、交叉核實與整合的那一層,路由、編排與驗證都只是服務於它的機制。這些機制都能追溯到具名的研究:Hong 與 Page 的多樣性預測定理(PNAS,2004)、Condorcet 的陪審團定理(1785),以及 Woolley et al. 的集體智慧因子「c」(Science,2010)。甚至有一種策略直接以此命名:diversity-ensemble 在原始碼中就叫做「Diversity Ensemble (Page Theorem)」。一個請求會在其中一種策略下啟用數個模型,再回傳一個答案,並附上該答案如何產生的決策溯源。

即時目錄收錄 107,175 個可發現的模型識別碼,橫跨數十家供應商持續被發現並標註能力,絕不是靠人工編輯的靜態清單。單一請求永遠不會動用全部模型:每一種集體策略都只啟用它所需的那一部分,絕不會啟用整個目錄。

Ailin¹ 集體與策略

ailin-auto(均衡預設值,交由級聯決定)、ailin-best(品質優先,成本不設限)、ailin-fast(延遲優先,單一模型)、ailin-economy(成本優先,強制硬性上限)、ailin-consensus(透過獨立交叉核實確保正確性)。先從 ailin-auto 開始。只有當你掌握了路由器不知道的資訊時,才改用其他別名。

預設由 Ailin¹ 決定,透過 Ailin¹ Collective 的路由級聯:若你有指定,先走明確路由;若沒有指定,則進入分流。你可以直接鎖定模型、別名或策略來覆寫任何一層,而且你的選擇永遠優先。多數整合情境從來不需要這麼做。

這是一套分層級聯,依由快到慢的順序評估:若你有指定就走明確路由;接著是分流,負責分類任務並對應到策略;再來是組態檔案庫,重複採用該類任務歷來有效的設定;然後是成本 / 品質 / 延遲前緣,直接最佳化三者之間的取捨;最後是學習式策略偏好(一套 Thompson Sampling 拉霸演算法),依長期實際結果為策略加權。中間這三層必須在某一類任務累積至少 5 筆結果紀錄後才會啟用;在此之前,由一套確定性、可稽核的後備啟發式規則做出判斷;若以上所有層級都未能解析請求,兜底的也是同一套啟發式規則。

編排引擎中註冊了 32 種,從單一路由模型,到九個代理組成的群體並行探索同一個問題。目前約有 11 種可被自動選用;其餘僅限明確指定,只要你點名,它們立刻完整可用。你也可以用 <strategy>:<tier> 直接指定這 32 種中的任何一種,例如 consensus:large,藉此鎖定確切的機制與價格層級。

在開放式創意寫作與程式碼重構上,我們自己的(小樣本)策略對比顯示,一個強力的單一模型會直接完勝完整的集體。而在客觀可驗證的任務上,這個結果會反轉:經驗證的共識策略拿下 38 題中的 37 題(97%),而同場受測的單一前沿模型則落在 68 至 82% 之間。Ailin¹ 預設不會對這類請求強制套用共識,也不會用自己的猜測把你鎖死在任何一邊:同一個欄位,可以讓你得到單一且一致的聲音(ailin-faststrategy: "single"),也可以讓你取得獨立的多模型驗證(expert-paneltri-role-collective),只要那才是你真正想要的。

成本與問責

可以,而且是逐請求控制。max_cost 會在任何模型被呼叫之前就硬性封頂;若即將執行的策略預估成本超過上限,請求會直接以 400 strategy_budget_exceeded 失敗,而不是默默超支。quality_target 則是與之配對的下限。每個回應都會回報真實數字:ailin_metadata.cost_usd,並附上逐項明細。多模型策略的成本確實明顯高於單一模型。但在機器可以核對的任務上(結構化擷取、數學、附測試的程式碼、事實問答),這個溢價幾乎會消失:當經驗證策略的確定性短路機制觸發時,我們最新的前沿基準測試量到的集體成本約為 $2.98/Mtok,比未經驗證的集體路徑便宜約 100 倍,與單一模型的定價落在同一個數量級之內。

每個回應都帶有 ailin_metadata.final_decider_model_id,也就是產生你這個答案的確切模型,另外還有 final_decider_role(primary、synthesizer、fallback 或 cache),以及完整的 subcalls[] 陣列,列出每一個參與者各自的成本、延遲與結果。當你要就品質問題向供應商申訴時,關鍵在於那個識別碼,而不是「Ailin¹ API」這個籠統的說法。如果你需要還原一個多模型決策為什麼會是那個結果,可以啟用持久化的協調追蹤紀錄:GET /v1/collective/runs/:id/trace 會回傳每個階段精確到毫秒的時間軸,而且它的設計方式讓任何一個租戶都無法確認另一個租戶的執行紀錄是否存在,查詢別人的執行識別碼,得到的 404 回應和查詢一筆從未建立過的紀錄完全相同。

證據與信任

在一項包含 10 個客觀可驗證任務(答案可由機器核對,而非主觀評判)的基準測試中,我們總共執行 38 次;在我們自己的評估裡,共識策略搭配確定性驗證器答對 38 次中的 37 次,而同場受測的個別前沿模型(GPT-5.5-pro、Claude Opus 4.8、Gemini 3.1 Pro、Grok 4.3)則落在 68 至 82% 之間。在全部三輪測試中,驗證器沒有一次選出客觀錯誤的答案。少了驗證器,其他集體策略的表現就會退回到與單一旗艦模型相同的區間,所以優勢來自驗證器,而不是額外的模型。這個分數可由已公開的原始輸出與評估檢查器重新算出。與其相信我們的說法,不如自己跑一次。

不會,你的原始提示詞不會被使用。訓練資料匯出流程完全不會碰觸提示詞內容:它只匯出匿名化的營運中繼資料(使用了哪種策略、成本、延遲、品質分數),追蹤識別碼會透過 SHA-256 加上一個秘密 pepper 值進行雜湊,並截斷為 16 個字元,你的組織與使用者識別碼則會在任何資料進入暫存之前就被移除。如果那個 pepper 值沒有設定好,匯出工作會直接拒絕執行,而不是匯出未受保護的資料。

身分驗證、租戶隔離、配額控管、依能力過濾的路由,以及請求追蹤,目前每一次呼叫都會執行。這在今天已經是正式上線的狀態,供應鏈與授權合規的部分也一樣:AGPL 第 13 條合規端點(/source/license)、SLSA/Sigstore 發布來源證明,以及 SPDX 格式的 SBOM,每一次發版都會附帶。尚未完成的是:正式認證。SOC 2 與 ISO 27001 仍在進行中,尚未取得認證;若你的採購流程需要特定的稽核證明,請詢問你的客戶團隊,而不要僅憑行銷文案推測,包括我們自己的文案在內。你也不必只憑我們的說法:上述數字背後的協調引擎已公開於 github.com/ailinone/collective-intelligence(AGPL-3.0-or-later),基準測試腳本與原始數據都在該儲存庫中。

一起構建 AI 的集體時代

AI的下一個前沿是集體,它應該在開放中構建。在我們自己的基準測試中,經驗證的共識策略在 38 個客觀可驗證任務中答對 37 個,而孤立的前沿模型則落在 68 至 82% 之間,而且沒有一次選出錯誤答案。文件涵蓋完整的 API 表面。倉庫裡放著協調引擎、基準測試指令碼,以及那個結果背後的原始資料。