-
deepseek-ai/DeepSeek-R1
Text Generation • 685B • Updated • 1.88M • • 13.6k -
Qwen/Qwen2.5-Coder-32B-Instruct
Text Generation • 33B • Updated • 1.73M • • 2.12k -
google/gemma-2-27b-it
Text Generation • 27B • Updated • 42.4k • • 573 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15
Collections
Discover the best community collections!
Collections including paper arxiv:2310.06117
-
Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models
Paper • 2402.14848 • Published • 19 -
Teaching Large Language Models to Reason with Reinforcement Learning
Paper • 2403.04642 • Published • 48 -
How Far Are We from Intelligent Visual Deductive Reasoning?
Paper • 2403.04732 • Published • 21 -
Learning to Reason and Memorize with Self-Notes
Paper • 2305.00833 • Published • 4
-
Measuring the Effects of Data Parallelism on Neural Network Training
Paper • 1811.03600 • Published • 2 -
Adafactor: Adaptive Learning Rates with Sublinear Memory Cost
Paper • 1804.04235 • Published • 2 -
EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks
Paper • 1905.11946 • Published • 4 -
Yi: Open Foundation Models by 01.AI
Paper • 2403.04652 • Published • 66
-
RA-DIT: Retrieval-Augmented Dual Instruction Tuning
Paper • 2310.01352 • Published • 7 -
Self-Consistency Improves Chain of Thought Reasoning in Language Models
Paper • 2203.11171 • Published • 6 -
MemGPT: Towards LLMs as Operating Systems
Paper • 2310.08560 • Published • 9 -
Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models
Paper • 2310.06117 • Published • 2
-
deepseek-ai/DeepSeek-R1
Text Generation • 685B • Updated • 1.88M • • 13.6k -
Qwen/Qwen2.5-Coder-32B-Instruct
Text Generation • 33B • Updated • 1.73M • • 2.12k -
google/gemma-2-27b-it
Text Generation • 27B • Updated • 42.4k • • 573 -
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Paper • 2201.11903 • Published • 15
-
Measuring the Effects of Data Parallelism on Neural Network Training
Paper • 1811.03600 • Published • 2 -
Adafactor: Adaptive Learning Rates with Sublinear Memory Cost
Paper • 1804.04235 • Published • 2 -
EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks
Paper • 1905.11946 • Published • 4 -
Yi: Open Foundation Models by 01.AI
Paper • 2403.04652 • Published • 66
-
Same Task, More Tokens: the Impact of Input Length on the Reasoning Performance of Large Language Models
Paper • 2402.14848 • Published • 19 -
Teaching Large Language Models to Reason with Reinforcement Learning
Paper • 2403.04642 • Published • 48 -
How Far Are We from Intelligent Visual Deductive Reasoning?
Paper • 2403.04732 • Published • 21 -
Learning to Reason and Memorize with Self-Notes
Paper • 2305.00833 • Published • 4
-
RA-DIT: Retrieval-Augmented Dual Instruction Tuning
Paper • 2310.01352 • Published • 7 -
Self-Consistency Improves Chain of Thought Reasoning in Language Models
Paper • 2203.11171 • Published • 6 -
MemGPT: Towards LLMs as Operating Systems
Paper • 2310.08560 • Published • 9 -
Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models
Paper • 2310.06117 • Published • 2