佢唔係精簡,係多路打爆ssd讀取速度.當然寫入會慢,但llm本來就少寫入.

via HKEPC IR 5.1.14 - Android(5. ...
ki_cat 發表於 2026-7-23 10:54


我覺得最後發展會變成兩極化。
HBM就變咗做伺服高級貨色
nand dram 就變左民用貨色

諗住做得冧內存價格應該冇可能發生,因為而家嘅內存都未做到民用。好似個BB仔啱啱出世咁。只係嘗鮮。有好多公用設備。民用設備連個AI輔助都冇。

我諗韓國佬估計的需求應該係行得通。

TOP

我覺得最後發展會變成兩極化。
HBM就變咗做伺服高級貨色
nand dram 就變左民用貨色

諗住做得冧內存價格 ...
hkmand001 發表於 2026-7-23 11:07



    就快出DDR6喇, 傻仔先至宜依買貴RAM

TOP

蒸餾真的可以令模型越來越進步嗎?

  • 成本效益高:蒸餾能讓小模型以極低的算力與成本,迅速掌握大模型的優秀邏輯與輸出表現。
  • 無法無限超越原版:蒸餾的核心是「模仿與壓縮」,它能幫助學生模型快速追趕並達到接近老師模型的水平,但很難單靠蒸餾讓模型無中生有、超越世界頂尖的原生創新極限。
  • 持續進步的關鍵:模型要真正實現質的飛躍,依然需要依賴基礎架構創新、更高質量的原始訓練數據、大規模算力(預訓練)以及強化的後訓練(Post-training)。

TOP

蒸餾真的可以令模型越來越進步嗎?

  • 成本效益高:蒸餾能讓小模型以極低的算力與成本,迅速掌握大模型的 ...
    javacomhk 發表於 2026-7-29 09:19

  • 只能蒸餾到開源, 唔開源你係蒸餾唔到, 只係睇到有咩字輸出(同普通文件訓練無別分, 要一樣的算力和成本)。 睇唔到輸出token嘅機率分布,

    開源嘅會睇到輸出token嘅機率分布, 可以全面更新權重值。咁快好多。

    TOP

    佢唔係精簡,係多路打爆ssd讀取速度.當然寫入會慢,但llm本來就少寫入.

    via HKEPC IR 5.1.14 - Android(5. ...
    ki_cat 發表於 2026-7-23 10:54



         你砌個多路SSD? Deepseek R1 跑4bit權重, 每個token要讀19GB資料,如果要毎秒出一個TOKEN, 你要砌19條多路PCI 5.0 SSD, 仲要係順住讀先至有咁快。RANDOM讀會慢到媽媽聲。

    TOP

    「蒸餾」只是抄的其中一個方法,實際上會混合其他方法嘅!
    混合嘅其他核心方法

    • 強化學習 (Reinforcement Learning):利用獎勵機制(如 RLHF / PPO)引導模型輸出更符合人類意圖同邏輯嘅答案。
    • 微調 (Supervised Fine-Tuning, SFT):使用高品質嘅高質素人工或域內數據對模型進行針對性訓練。
    • 合成數據生成與重構 (Synthetic Data & On-Policy 混合):結合自身推理軌跡同額外反饋動態修正,唔單止係被動「抄答案」。

    TOP

    kimi 有冇人試過自己本地安裝?

    TOP

    又引用下其他人的睇法:

    「中國模型全靠蒸餾(Distillation)美國模型」的迷思 :

    ​數學與邏輯上的不可能:有些專家宣稱中國模型強大只是因為「蒸餾/複製」美國模型的 API 輸出,這是荒謬且不專業的說法 。
    ​蒸餾的極限:雖然微調(SFT)或硬蒸餾能激發模型既有的潛在能力(如 DeepSeek 引導小型模型產生 Chain of Thought 思考鏈),但僅憑 API 的數據輸出,絕不可能重建一個複雜度極高的前沿(Frontier)模型 。

    ​中國的自主創新:DeepSeek和各其他大形AI公司發表了詳細的論文(如 DeepSeek-V3、R1)與技術細節(如最先進的 Kimi, Deepseek 機構),開源了從零訓練前沿模型所需的一切知識,證明其技術完全來自於自主研發與創新 。

    TOP

    kimi 有冇人試過自己本地安裝?
    ueaf 發表於 2026-7-29 17:21


    試過K2.6, K3都太大了

    TOP

    就快出DDR6喇, 傻仔先至宜依買貴RAM
    godofcomputer 發表於 2026-7-28 22:18



       可以見得好快會出DDR6?你只係睇電腦新聞話就快出/研發中…
    實際上2028年中都未有可能買到家用級DDR6,server grade DDR6有可能明年先有roadmap出,仲有ddr5都仲未去到理論上極限,點會出ddr6,小朋友你太天真了,你知唔知一粒CPU有幾多工程師做緊研發,你要改動一個設計同要求,要幾多個工程師幾多個千上萬個小時先可以完成一個修改

    TOP