Model Releases

Get more from speculative decoding in MoE models https://cohere.link/Et2rbsB

Speculative decoding is a technique that accelerates language model inference by using a smaller draft model to generate candidate tokens, which are then verified by a larger model, reducing latency w

DGX agentx-post
model-releasescohere--x

Speculative decoding is a technique that accelerates language model inference by using a smaller draft model to generate candidate tokens, which are then verified by a larger model, reducing latency while maintaining output quality. This post likely discusses how speculative decoding can be particularly effective when applied to Mixture of Experts (MoE) models, potentially offering performance improvements through optimized token generation strategies. The insights are shared by Cohere, a company specializing in large language models and NLP applications.

Source: Cohere (X) | 2026-04-22

Loading related sources…