AI Developer · Taiwan

Huang Liang Hsun黃亮勳

AI developer working on Traditional Chinese language models, evaluation, and applied ML for law and science.

打造繁體中文語言模型、評測基準,以及把機器學習用在法律與科學領域。

Writing

All posts →
meta

為什麼我開了這個站

模型卡和論文是整理過的版本。這裡放的是剩下的那些——失敗的訓練、看起來太漂亮的分數,還有沒人問但我想講的 ablation。

tokenizerzh-twtwinkle-ai

TwinkleTokenizer:為什麼繁體中文需要一個從零訓練的詞表

201K 的詞表打贏 248K,不是因為演算法比較好,是因為對方有 11% 的名額在訓練前就浪費掉了。這篇講設計決策、三層驗證,以及一個差點讓結論反過來的評測錯誤。

Selected work

Everything →