Better way to steer how Transformers generalize
Directly initializing attention masks embeds structural biases that persist through training, fixing systematic generalization failures in Transformers.
Directly initializing attention masks embeds structural biases that persist through training, fixing systematic generalization failures in Transformers.