CORE METHODOLOGIES
01.1
噪聲過濾與脫敏
清除 HTML 雜訊代碼、排版亂碼、無意義符號,並進行 PII(個人隱私資料)脫敏 與有害內容(Toxicity)安全性篩檢。
01.2
語意去重 (Deduplication)
採用 MinHash 或 SimHash 進行大量網頁語料的模糊去重,防止模型過度擬合特定樣板,顯著降低記憶冗餘。
01.3
格式標準化與過濾
統一字元編碼(UTF-8),剔除過短、過長或重複率異常段落,過濾低質量或語意不連貫的機器生成廢料。
01.4
分詞器 (Tokenization)
利用 Byte-Pair Encoding (BPE) 或 SentencePiece 將自然語言轉為整數 Token ID,建立高效詞表(Vocabulary)。