Technical field notes from Fanout Token choice vs expert choice routing in MoEAI researchWhat is a good cross entropy loss valueML mathematicsAI inference engineering, explained with numbersInference engineeringFlashAttention vs PagedAttention: what each fixesInference engineeringW8A8 vs W4A16 quantization: how to chooseInference engineeringExpert parallelism vs tensor parallelism for MoEInference engineeringWhen KV cache quantization slows inferenceInference engineeringDisaggregated prefill and decode with numbersInference engineeringWrite-ahead log explained through one crashSystem designConsistent hashing explained simply with 10 keysSystem designSoftmax temperature explained with numbersML mathematicsFP8 vs INT8 vs AWQ vs GPTQInference engineeringMixture of experts routing explainedAI researchKV cache quantization: memory savings by bitsInference engineeringWhy is FlashAttention faster?Inference engineeringHow Grok 4.6 happened: Cursor's data flywheelAI researchTensor parallelism vs pipeline parallelismInference engineeringWhat is chunked prefill?Inference engineeringArgmax vs max: choice and value explainedML mathematicsHow to read equations in AI research papersML mathematicsKV-cache memory formula for LLM inferenceInference engineeringSoftmax and cross-entropy from logitsML mathematicsThe Roofline model for AI inferenceInference engineeringThe scaled dot-product attention equationML mathematicsWhat the vertical bar means in mathematicsML mathematicsA robotics roadmap for software engineersSystem designHow to estimate LLM API costsInference engineeringHow to use AI to study for examsAI researchHow to use AI to study without losing the workAI researchLLM inference interview questions that matterInference engineeringOpenAI vs Anthropic API pricingInference engineeringSpeculative decoding for faster LLM inferenceInference engineeringThe LLM inference engineer roadmapInference engineeringThe open-source robotics stack, explainedSystem designVision-language-action models for roboticsAI research100 papers to understand software and computingSystem designBuild an AI homelab that works like one computerSystem designContinuous batching for LLM inferenceInference engineeringPagedAttention: how vLLM manages the KV cacheInference engineeringPrefill vs decode in LLM inferenceInference engineeringHow AI memory works: five systems, not oneAI researchKimi K3 architecture: KDA, MLA and MoEInference engineeringKV cache formula for LLM inference memoryInference engineeringDaily paper summaries for AI engineersAI researchDeep learning for computer vision engineersAI researchMachine learning roadmap for backend engineersInference engineeringML interview prep for software engineersAI researchSystem design prep for senior engineersSystem designAI papers for system design engineersSystem designML engineer roadmap for career switchersAI researchML math roadmap without a math degreeML mathematicsPaper-reading habit for staff engineersAI researchSystem design labs for distributed systemsSystem designDeep learning roadmap for self-taught engineersAI researchML interview prep for data scientistsAI researchML math for software engineersML mathematicsSystem design prep for backend engineersSystem designSystem design prep for new gradsSystem designSLMs are more powerful than you thinkAI research