“Pretrained dense visual features from Vision Transformers (ViTs) have been underutilized in robot learning.”