|
scholar.google.com
|
[Google Scholar]
|
Анализировать url
|
|
twitter.com
|
[Twitter]
|
|
|
linkedin.com
|
[LinkedIn]
|
Анализировать url
|
|
openai.com
|
OpenAI
|
Анализировать url
|
|
cse.engin.umich.edu
|
Computer Science and Engineering
|
Анализировать url
|
|
umich.edu
|
University of Michigan
|
Анализировать url
|
|
fodsi.us
|
FODSI
|
Анализировать url
|
|
berkeley.edu
|
UC Berkeley
|
Анализировать url
|
|
cs.princeton.edu
|
Computer Science
|
Анализировать url
|
|
princeton.edu
|
Princeton University
|
Анализировать url
|
|
cs.princeton.edu
|
Sanjeev Arora
|
Анализировать url
|
|
tsinghua.edu.cn
|
Tsinghua University
|
Анализировать url
|
|
iiis.tsinghua.edu.cn
|
Yao Class
|
Анализировать url
|
|
pulkitgopalani.github.io
|
Pulkit Gopalani
|
Анализировать url
|
|
gpoesia.com
|
Gabriel Poesia
|
Анализировать url
|
|
zhiweixx.github.io
|
Zhiwei Xu
|
Анализировать url
|
|
yixinwang.github.io
|
Yixin Wang
|
Анализировать url
|
|
fftyyy.github.io
|
Yongyi Yang
|
Анализировать url
|
|
yutongwang.me
|
Yutong Wang
|
Анализировать url
|
|
qingqu.engin.umich.edu
|
Qing Qu
|
Анализировать url
|
|
arxiv.org
|
Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws
|
Анализировать url
|
|
arxiv.org
|
Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
|
Анализировать url
|
|
arxiv.org
|
Robust Sparse Mean Estimation via Incremental Learning
|
Анализировать url
|
|
arxiv.org
|
What Happens During the Loss Plateau? Understanding Abrupt Learning in Transformers
|
Анализировать url
|
|
arxiv.org
|
Benign Overfitting in Single-Head Attention
|
Анализировать url
|
|
arxiv.org
|
Provable Low-Frequency Bias of In-Context Learning of Representations
|
Анализировать url
|
|
arxiv.org
|
RaanA: A Fast, Flexible, and Data-Efficient Post-Training Quantization Algorithm
|
Анализировать url
|
|
arxiv.org
|
Understanding Deep Representation Learning via Layerwise Feature Compression and Discrimination
|
Анализировать url
|
|
arxiv.org
|
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model
|
Анализировать url
|
|
arxiv.org
|
Swing-by Dynamics in Concept Learning and Compositional Generalization
|
Анализировать url
|
|
arxiv.org
|
Abrupt Learning in Transformers: A Case Study on Matrix Completion
|
Анализировать url
|
|
arxiv.org
|
Near-Interpolators: Rapid Norm Growth and the Trade-Off between Interpolation and Generalization
|
Анализировать url
|
|
arxiv.org
|
Dichotomy of Early and Late Phase Implicit Biases Can Provably Induce Grokking
|
Анализировать url
|
|
arxiv.org
|
How Do Transformers Learn In-Context Beyond Simple Functions? A Case Study on Learning with Representations
|
Анализировать url
|
|
arxiv.org
|
Benign Overfitting and Grokking in ReLU Networks for XOR Cluster Data
|
Анализировать url
|
|
arxiv.org
|
Bias Amplification Enhances Minority Group Performance
|
Анализировать url
|
|
arxiv.org
|
Going Beyond Linear Mode Connectivity: The Layerwise Linear Feature Connectivity
|
Анализировать url
|
|
arxiv.org
|
Are Neurons Actually Collapsed? On the Fine-Grained Structure in Neural Representations
|
Анализировать url
|
|
arxiv.org
|
Implicit Bias in Leaky ReLU Networks Trained on High-Dimensional Data
|
Анализировать url
|
|
arxiv.org
|
Representation Alignment in Neural Networks
|
Анализировать url
|
|
arxiv.org
|
More Than a Toy: Random Matrix Models Predict How Real-World Neural Representations Generalize
|
Анализировать url
|
|
arxiv.org
|
A Representation Learning Perspective on the Importance of Train-Validation Splitting in Meta-Learning
|
Анализировать url
|
|
arxiv.org
|
Near-Optimal Linear Regression under Distribution Shift
|
Анализировать url
|
|
arxiv.org
|
When is Particle Filtering Efficient for Planning in Partially Observed Linear Dynamical Systems?
|
Анализировать url
|
|
arxiv.org
|
Few-Shot Learning via Learning the Representation, Provably
|
Анализировать url
|
|
arxiv.org
|
Impact of Representation Learning in Linear Bandits
|
Анализировать url
|
|
arxiv.org
|
The Surprising Simplicity of the Early-Time Learning Dynamics of Neural Networks
|
Анализировать url
|
|
arxiv.org
|
Provable Benefit of Orthogonal Initialization in Optimizing Deep Linear Networks
|
Анализировать url
|
|
arxiv.org
|
Simple and Effective Regularization Methods for Training on Noisily Labeled Data with Generalization Guarantee
|
Анализировать url
|
|
arxiv.org
|
Enhanced Convolutional Neural Tangent Kernels
|
Анализировать url
|
|
arxiv.org
|
On Exact Computation with an Infinitely Wide Neural Net
|
Анализировать url
|
|
arxiv.org
|
Implicit Regularization in Deep Matrix Factorization
|
Анализировать url
|
|
arxiv.org
|
Explaining Landscape Connectivity of Low-cost Solutions for Multilayer Nets
|
Анализировать url
|
|
arxiv.org
|
Nearly Optimal Dynamic k-Means Clustering for High-Dimensional Data
|
Анализировать url
|
|
arxiv.org
|
Fine-Grained Analysis of Optimization and Generalization for Overparameterized Two-Layer Neural Networks
|
Анализировать url
|
|
arxiv.org
|
Width Provably Matters in Optimization for Deep Linear Neural Networks
|
Анализировать url
|
|
arxiv.org
|
A Convergence Analysis of Gradient Descent for Deep Linear Neural Networks
|
Анализировать url
|
|
arxiv.org
|
Linear Convergence of the Primal-Dual Gradient Method for Convex-Concave Saddle Point Problems without Strong Convexity
|
Анализировать url
|
|
arxiv.org
|
Algorithmic Regularization in Learning Deep Homogeneous Models: Layers are Automatically Balanced
|
Анализировать url
|
|
sites.google.com
|
ICML 2018 Workshop on Nonconvex Optimization
|
Анализировать url
|
|
arxiv.org
|
Online Improper Learning with an Approximation Oracle
|
Анализировать url
|
|
arxiv.org
|
An Analysis of the t-SNE Algorithm for Data Visualization
|
Анализировать url
|
|
arxiv.org
|
Linear Convergence of a Frank-Wolfe Type Algorithm over Trace-Norm Balls
|
Анализировать url
|
|
arxiv.org
|
Combinatorial Multi-Armed Bandit with General Reward Functions
|
Анализировать url
|
|
drops.dagstuhl.de
|
New Characterizations in Turnstile Streams with Applications
|
Анализировать url
|
|
offconvex.org
|
Ultra-Wide Deep Nets and Neural Tangent Kernel (NTK)
|
Анализировать url
|
|
offconvex.org
|
Understanding Implicit Regularization in Deep Learning by Analyzing Trajectories of Gradient Descent
|
Анализировать url
|
|
offconvex.org
|
Landscape Connectivity of Low Cost Solutions for Multilayer Nets
|
Анализировать url
|
|
offconvex.org
|
Is Optimization a Sufficient Language for Understanding Deep Learning?
|
Анализировать url
|
|
offconvex.org
|
Understanding Optimization in Deep Learning by Analyzing Trajectories of Gradient Descent
|
Анализировать url
|
|
docs.google.com
|
CSE 598 – Science of Large Language Models
|
Анализировать url
|
|
docs.google.com
|
EECS 598 – Machine Learning Theory
|
Анализировать url
|
|
docs.google.com
|
EECS 598 – Machine Learning Theory
|
Анализировать url
|
|
docs.google.com
|
EECS 598 – Science of Deep Learning
|
Анализировать url
|
|
cs.princeton.edu
|
COS 445 – Economics and Computation
|
Анализировать url
|
|
cs.princeton.edu
|
COS 324 – Introduction to Machine Learning
|
Анализировать url
|
|
jemdoc.jaboc.net
|
jemdoc
|
Анализировать url
|
|
statcounter.com
|
<img class="statcounter" src="https://c.statcounter.com/12453921/0/3e5d2bb2/1/" alt="real time web analytics" referrerpolicy="no-referrer-when-downgrade">
|
Анализировать url
|