大模型是怎麼回事
不用任何數學,靠實驗弄明白大模型的幾個基本事實:詞元、下一個詞元預測、溫度、上下文和成本、向量嵌入,以及怎麼選模型。
各課
- 01詞元:模型眼裡的文字
用 DeepSeek 和 OpenAI 的分詞器實際切一段中文、英文、文言文和程式碼,看模型到底把文字切成了什麼,以及這為什麼決定了價格,也解釋了模型為什麼數不清字數。
35 分鐘 · 入門 - 02模型只做一件事:預測下一個詞元
讓模型亮出每一步的候選詞元和機率,看一段回答是怎麼一個詞元一個詞元生成的;再講它從續寫機器變成助手的過程,以及幻覺從哪裡來。
35 分鐘 · 入門 - 03溫度和取樣:同一個問題為什麼每次回答不一樣
拿到模型真實的候選詞元機率,用 numpy 親手實現溫度和 top_p 取樣,再用 API 實測溫度對回答多樣性的影響,並解釋溫度為 0 為什麼也不能保證結果一樣。
40 分鐘 · 入門 - 04上下文視窗和成本
把整份 httpx 文件塞進一次請求,看它花多少錢、找不找得到藏在中間的一句話,再看快取怎麼讓第二次呼叫便宜 30 多倍,最後寫一個按 usage 計費的函式。
40 分鐘 · 入門 - 05向量嵌入:把意思變成數字
用一個開源中文嵌入模型在本地把句子變成向量,用餘弦相似度比較它們的意思,看看它擅長什麼、分不清什麼。這是後面做語義搜尋和 RAG 的基礎。
35 分鐘 · 入門 - 06怎麼選模型
排行榜告訴你模型的平均水平,卻不能告訴你它在你的任務上怎麼樣。用 20 道題比較四種模型配置的準確率、速度和花費,學會用自己的小測試集做選擇。
40 分鐘 · 入門
這個模組不講神經網路內部怎麼計算,那是第二部分的事。這裡只講一個使用者必須知道的事實:模型看到的是什麼,輸出是怎麼產生的,錢花在哪裡。
每一課都靠實驗說話。你會用 DeepSeek 的分詞器親手切開一句中文,用 logprobs 參數看模型每一步在哪幾個詞之間猶豫,把一個真實的機率分佈拿到本地用 numpy 模擬溫度,再把整份 httpx 文件塞進一次請求,看快取能省下多少錢。有些實驗結果和網上流傳的說法不一樣,我都照實寫了。
為什麼是這個順序
先講詞元,因為後面所有東西都以它為單位:價格、上下文長度、輸出上限。然後講模型怎麼一個詞元一個詞元地生成回答,這能解釋幻覺和隨機性。溫度建立在"按機率抽籤"的基礎上,所以放在第 3 課。第 4 課把前面的知識落到錢和上下文上。第 5 課的向量嵌入是另一種模型,它不生成文字,而是把文字變成向量,04 模組的 RAG 要用到它。最後一課講怎麼給自己的任務選模型,要用到前面所有的知識。
學完的標準
- 拿到一段文字,能用分詞器數出它的詞元數,並估算出發給模型要花多少錢。
- 能解釋為什麼同一個問題問兩次,回答會不一樣,以及溫度 0 為什麼也不能保證完全一樣。
- 看到模型給出一個具體的版本號或者 API 參數,知道要去核實,並且知道去哪核實。
- 能寫一個函式,根據
usage算出一次呼叫的費用,包括快取命中的部分。 - 能用自己準備的 20 道題,比較兩個模型在你的任務上誰更合適。
本模組的程式碼
程式碼和執行結果保留原樣(簡體中文),與實際執行時完全一致。