Should just be something like critic_loss = ((reward+(gamma*critic_new.detach())) - critic_old)**2
critic_loss = ((reward+(gamma*critic_new.detach())) - critic_old)**2