Aivora

#transformer

Transformer

4 articles

Telescopic Language Models: One Training Run for Endless Compute Budgets
arXivLLM

Telescopic Language Models: One Training Run for Endless Compute Budgets

伸縮自如的語言模型:單次訓練即可適應多種運算資源預算的 Telescopic LM

This research introduces Telescopic Language Models (TLM), which use stochastic prefix supervision to enable a single Transformer to act as a valid language model at any layer depth, serving diverse compute budgets from a single training run.

2 min read
New LoRA Skills Should Read but Never Write: READ Solves Adapter Fusion Interference
arXivAI Research

New LoRA Skills Should Read but Never Write: READ Solves Adapter Fusion Interference

新增 LoRA 技能唯讀不寫:READ 解決多配接器融合干擾

This paper introduces READ, a method that resolves interference when merging multiple LoRA adapters by enforcing "read-only" one-way coupling and canonical factorization, preserving old skills while adding new ones with zero extra inference cost.

2 min read
Weight Pair Encoding (WeightPE): Inducing a Smaller Grammar in Neural Network Weights
arXivAI Research

Weight Pair Encoding (WeightPE): Inducing a Smaller Grammar in Neural Network Weights

權重配對編碼(WeightPE):將類神經網路權重壓縮為更小、更具彈性的語法結構

This study introduces WeightPE, the first method to use grammar size as an explicit training objective, optimizing neural network weights into highly compressible, hierarchical, and variable-length structures.

2 min read