‌
‌
‌
‌
‌
快訊

萬億參數也救不了髒數據,國內大模型開始返工預訓練

BlockBeats 律動財經

動察 Beating AI 快訊,雷峰網稱,過去大半年,多家國內大模型廠商開始重做預訓練,問題都指向數據。


一家廠商曾花近一年訓練萬億參數模型,實際效果卻被參數量只有約 1% 的小模型反超。團隊最後發現,問題出在訓練數據。網頁垃圾、重複語料、低質量標註混進訓練集,再大的模型也吃不消。該案例來自匿名消息,具體公司尚未公開。

‌


騰訊混元已經公開重做了一輪。今年 2 月起,團隊重建預訓練和強化學習基礎設施。此前媒體曾披露,老混元存在打榜數據混入訓練集、標註規則混亂等問題。新團隊重新定數據標準,清洗原有語料,Hy3 也把數據質量和多樣性列為主要改進項。


阿里和百度也在加碼數據治理。Qwen3 用 Qwen2.5 系列模型清洗文檔,還大量補充數學和代碼合成數據。文心 4.5 則加入去重、低質量過濾、數據地圖和人工複核。兩家公司沒有公開說自己曾因髒數據返工,但新一代模型都把更多功夫花在了數據處理上。

‌

原文連結

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

▶ 前往鉅亨買幣找交易所優惠

‌
section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌