HNHacker News
TopNewBestAskShowJobs

ModelForge

713 karma · joined December 18, 2024

submissionscomments

Xiaomi MiMo v2.6 Pro: New best open-weight LLM with simple design

sebastianraschka.com·3 pts·ModelForge·
1

It's Easy to Dismiss Jev as Just a Classifier

sebastianraschka.com·4 pts·ModelForge·
0

Pacing != Pacing Development

sebastianraschka.com·3 pts·ModelForge·
0

GPT-6 Astra, looped transformers, and hidden reasoning

magazine.sebastianraschka.com·521 pts·ModelForge·
162

Claude Watermarks Text: Token sampling, watermark detection, and removal

magazine.sebastianraschka.com·3 pts·ModelForge·
0

How Claude's Text Watermarking Works [video]

youtube.com·2 pts·ModelForge·
0

How Claude's Text Watermarking Works

sebastianraschka.com·5 pts·ModelForge·
0

Kimi K3 Architecture Overview and Notes

sebastianraschka.com·507 pts·ModelForge·
111

Inkling: A New Open-Weight 975B Moe with a Few Surprises

sebastianraschka.com·3 pts·ModelForge·
0

Claude Code's Real Secret Sauce Isn't the Model

sebastianraschka.com·6 pts·ModelForge·
0

The State of LLMs 2025: Progress, Problems, and Predictions

magazine.sebastianraschka.com·3 pts·ModelForge·
0

A Researcher's Field Guide to Non-Standard LLM Architectures

magazine.sebastianraschka.com·2 pts·ModelForge·
0

Explanation of Gated DeltaNet (Qwen3-Next and Kimi Linear)

github.com·3 pts·ModelForge·
0

The Core Components of Modern LLMs and the Models Beyond Transformers [video]

youtube.com·3 pts·ModelForge·
0

Popular Attention Alternatives: GQA, MLA, SWA

sebastianraschka.com·4 pts·ModelForge·
0

Multi-Head Latent Attention

sebastianraschka.com·4 pts·ModelForge·
0

Thinking Machines Lab Co-Founder Departs for Meta

wsj.com·7 pts·ModelForge·
0

OpenAI's internal Slack messages could cost it billions in copyright suit

sherwood.news·8 pts·ModelForge·
1

LLM Evaluation from Scratch: Multiple Choice, Verifiers, Leaderboards, LLM Judge

magazine.sebastianraschka.com·4 pts·ModelForge·
0

Gemma 3 270M re-implemented in pure PyTorch for local tinkering

github.com·417 pts·ModelForge·
57

GPT-OSS vs. Qwen3 and a detailed look how things evolved since GPT-2

magazine.sebastianraschka.com·490 pts·ModelForge·
97

LLM Research Papers: The 2024 List

magazine.sebastianraschka.com·5 pts·ModelForge·
0

Scaling Test-Time Compute with Open LLM Models

huggingface.co·3 pts·ModelForge·
0