d1bc743c10080fed1253686ce01749b42611ded4 2f201160b1960fd7be18b70d5770599d7082dd2f 2026-05-28T14:23:06+08:00 wangbomeng set u_batch = max_seq_len f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE 1921024604db640f09ade83c8a437ebf15bde360 d028722a12c5a463cc97207787cfd03d7a2590b0 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 2026-05-21T14:08:14+08:00 Bomeng Wang refs/stash WIP on dev: d028722a replace cparam.n_ubatch with n_ubatch() 5af229fe518ee2d761ab8ae2a69f7a9aaa9057f4 d028722a12c5a463cc97207787cfd03d7a2590b0 2026-05-21T14:08:14+08:00 Bomeng Wang index on dev: d028722a replace cparam.n_ubatch with n_ubatch() d028722a12c5a463cc97207787cfd03d7a2590b0 63442fde8dc285817f725bd6c5fae80f478a3813 2026-05-20T14:41:05+08:00 wangbomeng replace cparam.n_ubatch with n_ubatch() 63442fde8dc285817f725bd6c5fae80f478a3813 fc3f4a9fab88e98eff8eeca8cbc6617333edba2c 2026-05-20T11:47:42+08:00 wangbomeng fix ubatch and cmakelist 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features. 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 6787a53ab9b4897c5a7b51a4062d7b90e6697d35 2026-04-24T09:31:32+08:00 wangbomeng calrt: recover base = batch_index * dict_len d8b2aaa00049978cebac15041f960d75b552f97b b6f29ec8140028619efaa50aa6e73146cecf631d 2026-04-13T11:23:44+08:00 wangbomeng server: fix context-shift b6f29ec8140028619efaa50aa6e73146cecf631d 6d55eae7e76b768acfcec045b8e84cded8ae3b55 2026-04-13T11:23:31+08:00 wangbomeng server: fix context-shift 42a181674565411efa5c8b318bc77d6fd084df8a bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 2026-04-10T09:06:55+08:00 Yunzhe Jia fix prompt_cache issue 99d2078e89305035d87d966cee7987c7d50b3925 9626239f5a9e568c9975d67dd6745fef90279a87 2026-04-08T19:01:16+08:00 Yunzhe Jia fix buffer resize problem 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa 16cbf81a731f5839a2f6b0eb9d8539826353748b 2026-03-24T01:59:03+08:00 wangbomeng calrt: fix ubatch.embd cpy 07817cefc14fa359dcecad0630defd3610f8f5c8 b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 2026-03-10T16:32:07+08:00 Yunzhe Jia fix kv issue 7ddafbdcb9426ae3af016925b8b596f11e8742d0 059009eeaf20a569abfbac5eb37dad3bb9376428 2026-03-10T07:13:04+08:00 wangbomeng calrt: commented out cal_ctx->encode(batch) b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 c6ea3f0d2468e3b8eab5de80bacee7fe4c9dd3d7 2026-03-09T15:03:26+08:00 Bomeng Wang clart: past_kv_len = n_tokens 7a3a9a0e76bb5f530beafcfe52e87e388e93117a 583c387efaf7bc030574e554088de79d09a27fbd 2026-03-05T07:24:59+08:00 wangbomeng calrt_infer: fix past_kv_len 583c387efaf7bc030574e554088de79d09a27fbd 0edc14a60a2d5596f71d728c655e3523da924d89 2026-02-27T02:24:56+08:00 wangbomeng caserver: lim generated tokens to n_ctx_per_seq 0edc14a60a2d5596f71d728c655e3523da924d89 aa0a17d719326a63e0d6fea60aa0ced44e7abc33 2026-02-27T01:57:39+08:00 wangbomeng caserver: limit generated tokens to n_ctx_per_seq 365eb0b719e30b0f9e348d854f11c9c3f954a96e 886cd1fb3b217efcf51c46209fcb694022346797 2026-02-07T09:05:17+08:00 Yunzhe Jia comment out pos buffer file 6b1ecdbbe3cc72ed8888be38f9e934cfd79b9fbb 240d9bb75241c91896afe125f2fc74698a7395f3 2025-11-25T17:06:14+08:00 Yunzhe Jia add kv_tensor for pld test d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736) 2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784) 8da3c0e200a586f768ada6f38745acb01380174c c22473b580807929fd9e3a3344a48e8cfbe6c88f 2025-10-31T13:50:33+02:00 Georgi Gerganov batch : fix consistency checks for the input positions (#16890) 6eb208d17ea29bb60295d9a2b5e7122dfb8f4b55 9984cbb61d12491d604484fb38b678fa15064061 2025-10-31T00:34:27+01:00 Sigbjørn Skjæret ci : enable free-disk-space on cuda docker build (#16877) b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818) d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780) bacddc049a00786df44e682262f6e298742bfbc3 229bf686287d18f82c44e89888cc662145ecfdb4 2025-10-30T07:18:50-04:00 Tianyue-Zhao model: Add support for CogVLM model (#15002) 8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847) b9ce94017729465895402cbcfffb51fa926c15e3 3464bdac37027c5e9661621fc75ffcef3c19c6ef 2025-10-29T15:13:10-05:00 Jeff Bolz vulkan: Fuse rope+set_rows (#16769) e3af5563bd049141e036b50f843196db33d23e97 10fcc41290e233788f5a4215314156e8e023eb92 2025-10-29T18:09:18+01:00 Xuan-Son Nguyen llama: store mrope data in KV cell (#16825) bcf5bda6f5df559565d11d7c8e8295c1159a85ec 3eb2be1ca5f37480aeb16102970d9e65f43347fe 2025-10-29T14:39:03+01:00 Ruben Ortlam Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536) 3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820) f549b0007dbdd683215820f7229ce180a12b191d 9a3ea685b937c0f0cbfda2e50004ea54bf187512 2025-10-29T03:53:04-05:00 Jeff Bolz vulkan: Call ggml_vk_buffer_write_2d from ggml_vk_buffer_copy (#16793) 85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812) 8284efc35c909217ee1b9a06903245d808ac2283 1c1409e13169d0ced4b1b4d39fb5b268b7525091 2025-10-28T23:16:20+08:00 l3utterfly initialise buffer.device in ggml_hexagon_session (#16816) 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 280d97be9660e7a5feaa28a6e7a299bc73dd83fc 2025-10-28T11:23:54+01:00 Johannes Gäßler llama: consistent ctx <-> buf order for KV cache (#16746) ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800) 5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748) 945501f5ea4b8ca56b181ecb035e9ee3fb31f432 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa 2025-10-27T09:17:31+01:00 Johannes Gäßler llama: fix leaked buffers for mmap + split files (#16765) 3470a5c891dcc94363e492a3760af92b6b07241c bd562fe4f7bd55625511d5f9d639c4fb1db1d440 2025-10-26T23:19:03+01:00 Acly ggml-alloc : make gallocr prefer chunks that allow memory reuse (#16788) bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b 73a48c9790d320476b3e5ef75bda09f2f8269e6e 2025-10-27T02:13:31+08:00 leejet ggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744) f90b4a8efe4466215c51155a5c22c1ae6207da23 8423d019318b446640bb620e4ce80066d8530f05 2025-10-25T10:59:54+02:00 Giuseppe Scrivano vulkan: delete dead code (#16732) 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 dd62dcfab97e420949519fd0eac9fca7bf97e635 2025-10-23T21:30:17+02:00 Johannes Gäßler server: add memory breakdown print (#16740) d0660f237a5c31771a3d6d1030ebe3e0c409ba92 fe6a9882acf5c02f96624ed8f80144100d7006cb 2025-10-23T15:00:49+02:00 Xuan-Son Nguyen mtmd-cli : allow using --jinja (#16718) 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 63d2fc46e17a06be5b4b5823a5ada088317f1f0a 2025-10-22T20:05:15-05:00 Matthew Michel sycl: use async memory allocation to fix crashes during graph recording (#16644) 63d2fc46e17a06be5b4b5823a5ada088317f1f0a a2e0088d9242bd9e57f8b852b05a6e47843b5a45 2025-10-22T13:47:09-07:00 Max Krasnyansky Add experimental ggml-hexagon backend for the Hexagon NPU (#16547) 9b9201f65a22c02cee8e300f58f480a588591227 19a5a3edfd306516cc419679d69d6435943b6816 2025-10-22T16:58:23+02:00 Pascal webui: introduce OpenAI-compatible model selector in JSON payload (#16562) c9c1972e2c2cc6a771fcc145bfa138700179f961 b617cfd2896edd592a36ebbc041817eb030a1005 2025-10-20T19:49:02+02:00 Aleksander Grygier Handle legacy 'context' attachments (#16687) b617cfd2896edd592a36ebbc041817eb030a1005 79068501fac9a74cca7129a8e5a8281b410a853e 2025-10-20T05:53:50-07:00 Diego Devesa ggml-alloc : fix leak when reusing a tensor with a larger size (#16679) 06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614) 7062dd8460685d6700ed7621e50a22c6f3400ca3 0398752dd450dfabdd1b9e289f6364c2600f6ab5 2025-10-20T15:44:21+08:00 takuya kodama llama-context: only warn on pooling_type when user specified (#16674) c20c0a5c0c44179f5267a262546624854b1203d1 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 2025-10-20T14:41:08+08:00 Yunzhe Jia kv: turn on common-prefix mtmd: fix output size bug e56abd2098dd2e2b0804691b93c13b48ae421627 38355c6c8e43204e11a22daa7483082c0ff01e71 2025-10-18T05:22:57-05:00 Jeff Bolz vulkan: Implement topk_moe fused shader, ported from CUDA (#16641) 41386cf365d894134ee0813d15e2f5d76f6a4d8e 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 2025-10-17T18:02:52+03:00 Radoslav Gerganov rpc : report actual free memory (#16616) 342c728d031d50673feded797520a44127d73379 ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 2025-10-17T18:01:23+08:00 muggle-stack ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629) 9ad4f1931ee0f3b41d9355245ef744786aaae0aa 79967ec596c0dacfd2251b085a57e79df292b1cc 2025-10-17T02:33:58-04:00 Ilia Ilmer metal : add `CONV_TRANSPOSE_2D` (#16542) 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c 76a63a2998286c1649de2496bccb7d8a46549895 2025-10-16T17:34:39+08:00 Yunzhe Jia kv: let seq_rm free whole seq since current hw-op cannot support common-prefix 76a63a2998286c1649de2496bccb7d8a46549895 b67217078aa748b06e1b2269d88dd18c0aca2c26 2025-10-16T16:31:15+08:00 Yunzhe Jia kv: fix common-prefix bug by implementing llama_memory_seq_rm adc9b60f190c1016a09f439862fa1cbb302262ac ee50ee1eadff58777ae746827b04de7ba0befc55 2025-10-16T13:10:32+08:00 takuya kodama ggml-cpu: replace putenv with setenv for const-correctness (#16573) fa882fd2b1bcb663de23af06fdc391489d05b007 ffa059034c1e41f3e58363ef3c46d2fcf854bc4d 2025-10-14T20:33:05+03:00 Georgi Gerganov metal : avoid using Metal's gpuAddress property (#16576) 9c7185dd28416cf67f5e3b268381f311b5e3da56 1ee9d0b415cdf5240418c110a18b419f4002b154 2025-10-14T14:22:47+02:00 Johannes Gäßler CUDA: enable FA for FP32 KV cache (#16546) 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 5b6913c47b6bc71a6f927805a45387d5657d8b89 2025-10-14T19:15:15+08:00 Aman Gupta CUDA: add fp kernel for larger batch size MoE (#16512) bc07349a7f87ba6eb31ed4b0ea9d9a7352185213 e60f241eacec42d3bd7c9edd37d236ebf35132a8 2025-10-14T08:48:50+03:00 Georgi Gerganov server : dynamic token limit for prompt cache (#16560) e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 5016b7286240d29f8f640039989b84ea3a854344 2025-10-13T22:42:37+03:00 Georgi Gerganov graph : support cacheless embeddings with FA and iSWA (#16528) 56fc38b9655fbe1869d8bd6cfb269418196cea69 1fb9504eb744969a990bfe4cfcf1d3d7a479541c 2025-10-13T17:01:24+08:00 Chenguang Li CANN: fix CPU memory leak in CANN backend (#16549) a31cf36ad946a13b3a646bf0dadf2a481e89f944 81d54bbfd599811b354c39f04550888168be7780 2025-10-13T02:43:14+08:00 Sam/Samuel metal : add opt_step_adamw and op_sum (#16529) 81d54bbfd599811b354c39f04550888168be7780 c7be9febcbafa9af7d1b9443f86475c59c9c5f87 2025-10-12T18:06:41+02:00 Pascal webui: remove client-side context pre-check and rely on backend for limits (#16506) 4b2dae383df708e2afc49c4859a81cd074f5ac10 41aac5c69b5fb281bc1f486afb053f78101bb39e 2025-10-12T09:29:13+03:00 Georgi Gerganov common : update presets (#16504) 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b 97870e64975b26c5e06a3540a8dc0ff601351e86 2025-10-11T21:39:04+08:00 Yann Follet server / ranking : add sorting and management of top_n (#16403) 68ee98ae181a5c83a5cc6261daeee69a1f588c15 cdb6da468cc33323955a523738d2e1675aeb5e9a 2025-10-10T17:11:07+03:00 Radoslav Gerganov server : return HTTP 400 if prompt exceeds context length (#16486) d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391) e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367) 9d0882840e6c3fb62965d03af0e22880ea90e012 d2ee056e1df0fdf646270fb5621e9f92084b59a7 2025-10-08T20:21:46+02:00 ai-fonsi Disable CUDA host buffers on integrated GPUs (#16308) 7fdd16b432d247121fe5fe7b21f8805f85266c85 74b8fc17f92ada295a648e3c5eb28f46bca7d892 2025-10-08T10:57:29+03:00 Georgi Gerganov server : improve context checkpoint logic (#16440) 0123ff38f53d34752f29239a29d0e40a6dc4110f 0a319bb75ed29d968e2a9b544011b09ccb932915 2025-10-07T08:24:17+03:00 Georgi Gerganov memory : use sequential equal splits for recurrent modules (#16442) 0a319bb75ed29d968e2a9b544011b09ccb932915 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 2025-10-07T08:23:30+03:00 Georgi Gerganov metal : add support for non-padded FA KV (#16148) 3df2244df40c67dfd6ad548b40ccc507a066af2b c08002a1988348403a5fd59b1fa3de3a10a6f92f 2025-10-06T12:55:53-05:00 Gadflyii llama : add --no-host to disable host buffers (#16310) ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) f39283960b58a92ecc0c72567711318b20e22b55 898acba6816ad23b6a9491347d30e7570bffadfd 2025-10-04T16:22:45+03:00 Radoslav Gerganov rpc : check src buffer when copying tensor (#16421) f6dcda390004b627ef30af378d0c01ad2519289e 606a73f53175077429484b23dcf799f69a31d0bd 2025-10-03T13:34:51-05:00 ddh0 server : context checkpointing for hybrid and recurrent models (#16382) 638d330246954e88dffc22ce01fec15e6894e544 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 2025-10-03T13:49:08+02:00 Acly ggml : fix graph reallocation with multiple chunks (#16396) 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 2025-10-03T12:51:40+02:00 Aleksander Grygier Fix missing messages on sibling navigation (#16408) 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 0e1f83855609d73beaf05d818640b6cfd39d287b 2025-10-03T05:50:46-05:00 Jeff Bolz vulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354) 72ee736c447be4ededb51ab97904b4d33c90c261 f09aefaa84d7f4d5df3f400f67944b94fef5b795 2025-10-02T13:51:36+02:00 Sigbjørn Skjæret ci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388) 1104ca1a1c926b832274694a2773a17066982ad0 4f1575921cac9b489fe8f8bbf20aff985e7da45e 2025-10-01T14:09:52+02:00 Sigbjørn Skjæret ci : use registry cache for docker builds (#16366) b2ba81dbe07b6dbea9c96b13346c66973dede32c bf6f3b3a1965d70e07ca94aab7b01268fe483e96 2025-09-30T21:41:42+02:00 Sigbjørn Skjæret ci : fix ccache key for ubuntu-cpu-cmake (#16355) 2df5bcf357dba0c49b4df1d684b2ffc9e88b7054 075c01567bb7e93965ae60b7e119182c3e68f3e9 2025-09-30T15:38:01+02:00 Sigbjørn Skjæret ci : disable ccache for android (#16348) b77e6c18e1a6fac5705ed95f03af5436d67484c1 2ddd3f2356c313385fafc19a9f0ce678c8fe03ee 2025-09-29T22:50:44+08:00 alex-spacemit ggml: riscv: add riscv spacemit backend (#15288) d8359f5fde480da030bf75c7711573c7c4d993ba 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f 2025-09-28T01:38:37-05:00 Jeff Bolz vulkan: 64-bit im2col (#16135) e6d65fb02d553bd79cad94e517cdca18b687788d 8656f5de688cddcaea1d6174535eb60ee23ef6a0 2025-09-27T16:43:39-04:00 Jeff Bolz vulkan: support arbitrary KV dimension in flash attention (#16160) 624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925) 1a189278944d030211f336e103e96b65f976c361 e0539eb6aed346d4b25a6ea019044e88771e7690 2025-09-26T18:35:42+02:00 Aleksander Grygier Allow viewing conversations even when llama server is down (#16255) 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 00217cd41388328c93e9e9644921c4319bb03bcc 2025-09-26T18:27:25+08:00 Aaron Teo ggml-cpu: implement MXFP4 SIMD for s390x (#16193) 835b2b915c52bcabcd688d025eacff9a07b65f52 b05a9d650f4da1e70e7e2cbe8fe44e61b39656db 2025-09-25T19:50:28+02:00 Sigbjørn Skjæret model : add GroveMoE support (#15510) 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 2025-09-25T22:35:05+08:00 Aman Gupta CUDA: add a fused top-K MoE kernel (#16130) e789095502b337690c7616db32d7c679a5bd2533 f2a789e33490deb483a2694b066b37e45524bb79 2025-09-24T16:53:48+02:00 Johannes Gäßler llama: print memory breakdown on exit (#15860) f2a789e33490deb483a2694b066b37e45524bb79 3a599719673c850647e3bb911ed6d91109bb91d2 2025-09-24T16:17:49+02:00 Acly ggml : split graph allocations according to backend max buffer size (#15815) 4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915) 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd 138c87ce8bd558b2cc134ada7316a3dad8eb67ac 2025-09-22T14:13:51+02:00 Adrien Gallouët common : enable `--offline` mode without curl support (#16137) 9073a73d82a916cea0809de225ef5175c3a86e91 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a 2025-09-22T07:22:43+02:00 Ruben Ortlam vulkan: vec dot matrix multiplication fix (#16151) 28baac9c9f491c872e2c37762d3bd90446b005e9 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 2025-09-21T16:50:45+03:00 Georgi Gerganov ci : migrate ggml ci to self-hosted runners (#16116) 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059) 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 459c0c2c1a400f960d7b8e8d94d31a8426f80986 2025-09-20T10:42:56+02:00 Ruben Ortlam vulkan: use vec dot for matrix matrix multiplications (#16056) 69ffd891631befa9e6b485fd646a16dab4f2c007 246c0d9c795fb25da8268625d597580155a3672f 2025-09-18T23:07:26+02:00 Adrien Gallouët ggml-amx : fix ggml_amx_init() on generic Linux (#16049) 246c0d9c795fb25da8268625d597580155a3672f 3edd87cd055a45d885fa914d879d36d33ecfc3e1 2025-09-18T23:07:18+02:00 Adrien Gallouët cmake : fix static linking for OpenMP on Unix-like systems (#16031) e00f3fd8fff2cf5a8c8c9f475034bd089c8bcce4 f2f28380ea68939c0481df3e4216b698824a59df 2025-09-18T15:06:48+08:00 Jhen-Jie Hong metal : avoid call free for non-owned buffer (#16067) d304f459d8619399eb232b1e3689379306f439d3 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 2025-09-17T13:09:40-07:00 Reese Levine GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018) 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 a7a98e0fffed794396b3fbad4dcdbbc184963645 2025-09-17T20:38:12+03:00 Georgi Gerganov metal : refactor + optimize v2 (#15995) cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038) d5fabe3682de515fd09d6c981f7a0d1b75614455 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 2025-09-17T14:33:08+08:00 Chenguang Li CANN: Optimize ggml_cann_set_device (#15935) 3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932) 9dcd200d57bc6f05a59a6a8df361d5d183af4124 0fa154e3502e940df914f03b41475a2b80b985b0 2025-09-14T22:02:32+03:00 Georgi Gerganov metal : remove memory pools (#15966) a0e13dcbe5bae7025660349ef3e4ead060e507f2 a14bd350141fb42b8bf2dd2342cebc27bfdce399 2025-09-14T22:20:35+08:00 lcy build: fix the build failures of Windows HIP release job (#15984) 6380d6a3e709cb02a8695afdd96b40e674477332 aa0c461efe3603639af1a1defed2438d9c16ca0f 2025-09-14T13:37:03+08:00 Aaron Teo ggml-zdnn: rm user mapped buffers (#15965) 55758b00cae1451a0d789c50a5eb8c9bee42b9a0 f161463a54d9f93d41246286aa4a9569a91d804d 2025-09-13T16:24:22+03:00 Georgi Gerganov metal : refactor kernel loading (#15964) f161463a54d9f93d41246286aa4a9569a91d804d 84d7b2fca11d1be118ce776f6d72a486c4883b74 2025-09-13T13:54:28+03:00 Georgi Gerganov metal : allow ops to run concurrently (#15929) 84d7b2fca11d1be118ce776f6d72a486c4883b74 40be51152d4dc2d47444a4ed378285139859895b 2025-09-13T12:45:04+03:00 Georgi Gerganov metal : fix memory leaks (#15962) 40be51152d4dc2d47444a4ed378285139859895b 4bf5549269d99bac936a65892da2312cc71b2421 2025-09-13T02:39:52+08:00 Aaron Teo ggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839) f4e664f838cc65d89fa845c48c372e43852112e4 f088b6a84f6aed0abb619dbb9d375e726fc888a6 2025-09-12T23:16:32+08:00 Haiyue Wang context : remove redundant explicit casting to the same type (#15948) 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 704d90c987cdf00751567b2088c4e54742aa2d3f 2025-09-12T09:06:20+02:00 Mathieu Baudier vulkan: Make device memory check more portable (#15939) 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 33daece86b65607451d0d4378d2d04ba6a20ad55 2025-09-10T17:52:35+03:00 Georgi Gerganov metal : make the backend async (#15906) 33daece86b65607451d0d4378d2d04ba6a20ad55 e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2025-09-10T15:39:57+02:00 Daniel Bevenius ci : add caching for ROCm installation in release workflow (#15924) e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900) 10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 2025-09-10T18:42:00+08:00 Chenguang Li CANN: Add ROPE sin/cos cache for reuse (#15912) 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 2025-09-10T15:29:12+08:00 Chenguang Li CANN: implement LRU cache for ACL graphs (#15814) ff02caf9eed261423289d1531a56536fbf57bfc2 ae355f6f7108540297d8b7f7ae71d20fe610a0b7 2025-09-10T05:23:19+02:00 Daniel Bevenius ci : cache ROCm installation in windows-latest-cmake-hip (#15887) ae355f6f7108540297d8b7f7ae71d20fe610a0b7 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b 2025-09-09T22:26:03+02:00 Ruben Ortlam vulkan: throw the oom error instead of no memory type found (#15905) a885dcff11a7b73f9377812d6151f6b15d307de0 663027fd5490438ce9c27ea866a560e1e268d11f 2025-09-08T10:27:07+03:00 Georgi Gerganov batched-bench : fix llama_synchronize usage during prompt processing (#15835) 663027fd5490438ce9c27ea866a560e1e268d11f cf0e3ba1500bd23635b444f64ba23cbdb56c92ef 2025-09-08T10:26:36+03:00 Georgi Gerganov context : fix n_outputs during reserve (#15858) cf0e3ba1500bd23635b444f64ba23cbdb56c92ef d413dca00360a7e4cb71441dacecfa32556fcc31 2025-09-08T10:25:33+03:00 Georgi Gerganov model : avoid ggml_cont_3d for fused QKV weights (#15662) 3b15924d71237a43bb5ad71f5b885ee66a821342 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a 2025-09-07T10:19:45+02:00 Daniel Bevenius ggml WebGPU: remove userdata from request adapter callback (#15527) c4df49a42d396bdf7344501813e7de53bc9e7bb3 3c3635d2f20424d557b5b0605a2a356214ffe048 2025-09-06T16:08:43+02:00 Charles Xu kleidiai: generalize compute_forward_kv_cache to compute_forward_fp16 (#15817) 61bdfd5298a78593be649a1035ee2a120b13c4f0 01806e77714ae8a78130d432945b959a0956c56f 2025-09-06T18:35:04+07:00 Xuan-Son Nguyen server : implement prompt processing progress report in stream mode (#15827) 01806e77714ae8a78130d432945b959a0956c56f 186415d59552bd5c90549cd8e9be3cc287621fd9 2025-09-06T13:28:44+02:00 Johannes Gäßler ggml-cpu: document use of "free" memory [no ci] (#15834) fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327) a81283820a466f2ace06ce4d4bc9512761f9365f c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 2025-09-05T11:34:28+02:00 Erik Scholz gguf: gguf_writer refactor (#15691) c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 5d6688de08e73acc2532d668380801ed79d704eb 2025-09-05T10:39:22+03:00 Georgi Gerganov kv-cache : fix SWA checks + disable cacheless iSWA (#15811) fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798) d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791) c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763) a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c badb80cadbc40e047b30c43611aba575fc8d6845 2025-09-04T11:50:23+02:00 Xuan-Son Nguyen server: add exceed_context_size_error type (#15780) 239b60e8986bbcb944f57311a02ac994431bf652 dff7551bfdbdd6e57c13e523d7dcca317640e907 2025-09-04T11:03:02+08:00 Chenguang Li CANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760) d4d8dbe383e8b9600cbe8b42016e3a4529b51219 35a42edac84690990a75726898d975cd08d220c0 2025-09-01T22:17:42+03:00 Gilad S. vulkan: use memory budget extension to read memory usage (#15545) 02c1813517412f3e00aa6ca7c0273fea64edb492 77dee9de97be75b7143a213bc48893e0c0b29af7 2025-09-01T16:19:07+02:00 Ruben Ortlam Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903) 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 2025-09-01T08:57:00+08:00 hipudding CANN: fix RoPE cache issue on multi-device (#15629) e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa 0d161f021aa33ec0e90cce96f5d1a88925557327 2025-08-31T20:41:02+03:00 Georgi Gerganov sampling : optimize samplers by reusing bucket sort (#15665) 9777032dccd67bdc7785aeab7497014a8be8dacc 7d3c9f2b217acf0ce5db81ae83d3f375f49ab2c7 2025-08-31T06:49:03-07:00 Diego Devesa llama : separate compute buffer reserve from fattn check (#15696) b97c9edc59d4a1b4069991aa670411190f4f3a3e 94e82c7eadeb8fff0db4bfd1ab6d8cf65fa6f2e0 2025-08-31T01:30:54-05:00 Jeff Bolz vulkan: Allow fallback to sysmem memory when vidmem is full (#15649) 696fccf354e9dbdfbce135bc40b44c9dcc64dda9 ef476916bba4b44f44be0c98babc1cb025968e75 2025-08-30T04:11:22-05:00 Jeff Bolz vulkan: Skip syncing for prealloc_y when it is reused (#15544) e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507) c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638) 8a4280ce431da6b33e5a95ae1fd61472c8c3f8cc 64387f6e95434b393ac3df285864692b7fd9c4d2 2025-08-28T12:27:02+03:00 Georgi Gerganov kv-cache : remove LLAMA_SET_ROWS checks (#15505) 47373271f971aa5a0a6462b286f4a7b5bd4ba644 1bded5a3b3376b2aa3ba2f11ade5910c550f354b 2025-08-27T13:58:54+02:00 uvos HIP: Enable support for ggml_backend_cuda_register_host_buffer (#15615) 1bded5a3b3376b2aa3ba2f11ade5910c550f354b 1e7489745a74996fc36e8fd05b73aa16bc184e0c 2025-08-27T13:55:12+03:00 Georgi Gerganov kv-cache : better estimate of n_kv for multi-sequence batches (#15610) a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558) 0373486dbc0dccbdcb3b5fdd65759d88cec06196 62cef26ac5b6b7acb635d3dc963813b43952dc2b 2025-08-26T17:45:17+03:00 Georgi Gerganov graph : fix assert in memory-less build_attn (#15590) b3964c1e890ef8c947afb36a5124ce6fcb2136d4 79a546220c719e6a70627b243a478ab8d84dc9e1 2025-08-26T14:22:14+03:00 Georgi Gerganov metal : optimize FA vec for large sequences and BS <= 8 (#15566) 85cc1ae998e4898d9fa992cb9b8620338cee97bf 1d8d83deaa48d4a5491820d58ff1c0d8cf9d196c 2025-08-26T12:47:00+03:00 Georgi Gerganov context : print graph stats for memory-less contexts (#15586) 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev 6b64f74b55628e4193f4fb00313f07dbd8556528 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-25T13:56:43+03:00 Georgi Gerganov batched-bench : fix unified KV cache handling + pp timing (#15562) c247d06f38fc09059c9607a28aa44f5ff6be208d 043fb27d3808766d8ea8195bbd12359727264402 2025-08-25T10:32:21+08:00 Chenguang Li CANN: ROPE cache sin/cos repeat (#15501) b730706a49e576fb882dc34d9966345778b3ab0b c9a24fb93208fbbd3da6d903eb75431bfa97e59e 2025-08-24T13:07:07+03:00 Georgi Gerganov kv-cache : support layer reuse (#15504) c9a24fb93208fbbd3da6d903eb75431bfa97e59e a9c6ffcbfacee092bfaaa400306fceda18199737 2025-08-24T04:24:25-05:00 Jeff Bolz vulkan: Support FA with any multiple of 8 head sizes (#15537) 611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) 289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d9 b55f06e1aa67fb10e89f53e31bbccf37eb2678ea 2025-08-23T02:33:36-05:00 Jeff Bolz vulkan: Rewrite synchronization to allow some overlap between nodes (#15489) 0a9b43e507a359ca392c037cf341f55137ad0b69 330c3d2d21b55bca5517db7d2eea2ea8f131df4a 2025-08-23T08:35:21+02:00 Acly vulkan : support ggml_mean (#15393) 330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427) 45363632cbd593537d541e81b600242e0b3d47fc 32732f2459a598606055f0403f0e4ec148d06d68 2025-08-22T11:28:03-07:00 Reese Levine ggml WebGPU: add support for quantization types (#15440) 9ebebef62fd0adf8685874f154e227ea87b7c6f4 ad5c975c2d0297124fad210776ef8eed6b90d578 2025-08-22T12:22:13+03:00 Georgi Gerganov llama : remove KV cache defragmentation logic (#15473) a0f98dd604d34826eb5ea2560d1e23fe726921df 54a241f505d515d625767b993bfd573ecee306b9 2025-08-22T14:12:07+08:00 Chenguang Li CANN: Optimize RMS_NORM using cache (#15419) cd36b5e5c7fed2a3ac671dd542d579ca40b48b54 3f196be84b1376945737163e35a91e29e3e24d2f 2025-08-21T19:13:45+03:00 Georgi Gerganov llama : remove deprecated llama_kv_self API (#15472) 96452a3fa426de83494fb0268a636aa1bfe557fe 9ad5e60dba38a6718366b7ac43e7d8e8abdc36c9 2025-08-21T09:55:00-05:00 Jeff Bolz vulkan: Reuse conversion results in prealloc_y (#15410) 715a6db02ccb16284837885f2c6fab05d8f7a6ee ad294df03ff2dccd227c3fee653166f3d78b23a4 2025-08-21T17:00:33+03:00 Georgi Gerganov kv-cache : drop the "unified" prefix (#15467) 029bb39eb1e7ae0e5df817ce97931abcd5fa52a9 30649cab657d87ac46692332a76e1b75d5d22e00 2025-08-21T17:52:16+05:00 Ali Tariq ci : enable RVV1.0 native build (#15386) ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3 1a99c2d948209d9ea5eac8b6dc0a297107244540 2025-08-20T18:33:30+08:00 Jie Fu (傅杰) common : fix context shift help message (#15448) d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 2025-08-19T16:46:37+03:00 Georgi Gerganov server : disable context shift by default (#15416) f0d3c7405c323784a60f14ddddfbac3f7404d417 f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 2025-08-19T08:45:12+03:00 Georgi Gerganov batched-bench : use rand tokens (#15398) e5155e698645242d4f019267ecc40ea9bad81b09 21c17b5befc5f6be5992bc87fc1ba99d388561df 2025-08-17T18:28:58-04:00 Oleksandr Kuvshynov server : export max observed n_past value (#15361) de5627910df74298c998e6bb36ee3217375a5719 65349f26f2299e06477ec8e85e46243046801358 2025-08-17T03:41:45-05:00 Jeff Bolz vulkan: Optimize argsort (#15354) ff27f80a74bbe5303acd511a6781a1de6d619b3c d3248d9b6557c75d59954c594bb53cf517591e91 2025-08-15T21:11:22+08:00 Aaron Teo ggml: initial IBM zDNN backend (#14975) 7aeee88cfe9c0434eac722b0f7c21404f48758a5 b07791aa1d4831a08ad54ca19aa206c0c5c0f34a 2025-08-15T03:27:02-07:00 Diego Devesa ci : move ccache action to ggml-org fork (#15328) 4227c9be4268ac844921b90f31595f81236bd317 df36bce667bf14f8e538645547754386f9516326 2025-08-14T23:21:24+02:00 Johannes Gäßler CUDA: fix negative KV_max values in FA (#15321) 863d341eeb81db104902b14b6f9413daa515e957 d32e03f4495d3efa1c5126f53b449f1d429c5664 2025-08-14T08:38:10-05:00 Jeff Bolz vulkan: perf_logger improvements (#15246) 810b9fc8b99dd55517a3e94c6dee29748d482559 4ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c4 2025-08-14T20:03:30+09:00 kallewoof perplexity : provide a helpful hint for has_cpl case in split_equal error. (#15304) 5cdb27e0917479d2d742cea7beee089574bb09fa 3ea913f1ce9567289aedd866a569dbab8fb8e419 2025-08-14T03:03:57-07:00 Jonathan Graehl finetune: SGD optimizer, more CLI args (#13873) 3ea913f1ce9567289aedd866a569dbab8fb8e419 29c8fbe4e05fd23c44950d0958299e25fbeabc5c 2025-08-14T15:16:32+09:00 kallewoof perplexity: give more information about constraints on failure (#15303) 1adc9812bd33dc85489bf093528d61c22917d54f b3e16665e14032d1276f9d0263acef8321b6f518 2025-08-13T11:21:31-07:00 Bas Nijholt fix(nix): remove non-functional llama-cpp cachix cache from flake.nix (#15295) d8914fc47e8a69b28c670325cb1c8ce33e3a2960 e885445bc1719d2e289a9b2e11714e0f994e68be 2025-08-13T12:44:40+02:00 Copilot common : add --override-tensor-draft, --cpu-moe-draft and --n-cpu-moe-draft parameters (#15191) 6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) 228f724d9ce6c56e8cec75bfdabab4dd013def7f cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 2025-08-11T13:58:24+03:00 Georgi Gerganov kv-cache : fix seq_rm with seq_id == -1 (#15226) cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 50e81bdf5db563ab57a9a722b08f96fa8a76c927 2025-08-11T11:21:19+02:00 Daniel Bevenius kv-cache : log (debug) all streams in find_slot (#15176) 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 756cfea82608911bbfcbf45164b8fdaddbafaa31 2025-08-06T15:14:40-07:00 Reese Levine ggml: Add basic SET_ROWS support in WebGPU (#15137) 1cbf442f50a154aac0bf35d7b8b3436a2cdfd6f5 ba67d6c03fed3193987a4ef13050e6e2a4451df4 2025-07-24T15:50:19+08:00 Yunzhe Jia 1.sync with calrt prefill,decode,kv_update op 2.add hw pattern untile function 9515c6131aecaccc955fdedcfe16c3e030aaefcb fd1234cb468935ea087d6929b2487926c3afff4b 2025-08-05T16:26:38-07:00 Reese Levine ggml: WebGPU disable SET_ROWS for now (#15078) fd1234cb468935ea087d6929b2487926c3afff4b f324a3b715d5c1081c110ce459f8a8486fb1ee89 2025-08-05T22:10:36+03:00 Georgi Gerganov llama : add gpt-oss (#15091) ee3a9fcf88fe5b5e1213711e05861b83cd4fdfe6 ec428b02c347767f24c78111309e3f30d2ada289 2025-08-05T05:27:45-04:00 compilade context : fix index overflow on huge outputs (#15080) ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939) 587d0118f50b7e8f4bafbcdd218aefd9da0272e1 5aa1105da24a8dd1661cea3db0582c9b2c2f54d3 2025-08-04T08:52:43-07:00 Reese Levine ggml: WebGPU backend host improvements and style fixing (#14978) 11a3811164ef2d75393c6b0a632f4c608e3e3dd2 97366dc6abdd0bdc74260bd3c42bd06f0feb7428 2025-08-03T15:43:07-04:00 compilade memory : handle kv_unified for hybrid models (#15050) 4fdea540bda4648f98b85e8ee9dc66db4bfb5945 a4569c41fd2253c89ef52fc2378687bdbf42f61a 2025-08-02T16:14:57+02:00 Daniel Bevenius kv-cache : skip alignment of n_stream in kv-cache log msg [no ci] (#15040) 15e92fd33791e60a4ddb5970b47242a855c27117 2bf3fbf0b54f97aef2b388b76d222789e1c170f1 2025-08-02T17:13:05+03:00 Georgi Gerganov cuda, sycl : fix batched gemm when ne02 == 1 && ne03 > 1 (#15038) 94933c8c2eeaa9a7983e3f6c08af76bd86724094 c1dacaa99b4ead6edbac928cd2da59436573f6b0 2025-07-31T05:25:23-07:00 g2mt server : implement universal assisted decoding (#12635) 92b8810ec7aa6d778bc287cc918443cf67b962e2 00131d6eaf4df029e1ec84de868c2c5957503007 2025-07-30T15:46:13+02:00 Johannes Gäßler CUDA: skip masked KV slices for all FA kernels (#14924) 00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961) ca0ef2dddb022cb1337d775cd05cd27d7808aff4 89d1029559bd2968f76db854f9f113d73e34527c 2025-07-27T12:10:51+02:00 Daniel Bevenius llama : clarify comment about pp and tg graphs [no ci] (#14895) 1dc9614e0673e794d2e2bf88ba04f7d57b63a57b 446595b9b3a113d9ba10506922c3a156cca9d477 2025-07-27T16:38:44+09:00 Shunta Saito llama : fix kq_scale for the attention layers of PLaMo2 (#14892) 793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743) c1dbea752a630169c104118fd0c82f3ffcb19c91 749e0d27f0247337869f4698f59dd7fafba94326 2025-07-25T14:28:06+03:00 Georgi Gerganov context : restore preemptive sched reset when LLAMA_SET_ROWS=0 (#14870) 64bf1c3744053cf7def10aeed21ff48883ee755b c12bbde37258c6d053322d1cedd4a9672109ae58 2025-07-25T06:17:02-04:00 Chris Rohlf rpc : check for null buffers in get/set/copy tensor endpoints (#14868) e4868d16d24dec55e61bcaadaca28feed8f98b13 820de57d4faa427a3d0bfb14e48057247fae036e 2025-07-24T16:31:48+03:00 Georgi Gerganov context : perform output reorder lazily upon access after sync (#14853) 07a19e27a26f76d34be62da53807f93131fb3cab 18f3b5ff9e5eda4e7d04bceff8ffdccb0a696ed8 2025-07-23T12:35:53+02:00 Johannes Gäßler CUDA: fix quantized KV cache + multiple sequences (#14822) 7233358d29df3dfbf80693f2de7e5865401ad724 6c88b3bb2509d980e6a64c50fdf8dd304929f770 2025-07-23T16:16:41+08:00 l3utterfly memory : handle saving/loading null layers in recurrent memory (#14675) d4d1522b20809a350ffb094db20f40f17d3ab80f d1aa0cc5d13ec3fa553de5d298f9166679e58479 2025-07-22T23:01:29+08:00 Molly Sophia llama : add model type detection for rwkv7 7B&14B (#14816) a979ca22db0d737af1e548a73291193655c6be99 90083283ec254fa8d33897746dea229aee401b37 2025-07-19T21:59:08+02:00 Ervin Áron Tasnádi ggml: adds CONV_2D op and direct GEMM Vulkan implementation (#14316) 90083283ec254fa8d33897746dea229aee401b37 d4b91ea7b2da253e1355b503f0fcb7b428ce005d 2025-07-19T12:51:22-04:00 compilade imatrix : use GGUF to store importance matrices (#9400) 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 d498af3d5a00f96bdd37b534860f03a6d9e98d39 2025-07-18T13:35:32+02:00 Oliver Simons cuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741) 8f974bc1e980c06833504276021072e7a4088c81 09651d09ffc1e941bd1be23163abf5495c416547 2025-07-18T08:29:28+03:00 Georgi Gerganov graph : refactor context to not pass gf explicitly (#14629) 09651d09ffc1e941bd1be23163abf5495c416547 349ea79fcebc75b0c55bf61594a47736966d4f95 2025-07-18T06:25:54+02:00 Nexes the Elder graph : Pass the graph placeholder message in debug mode (#14748) d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af 01612b74090df592663cfa01f661c9628f403b59 2025-07-17T20:52:33+03:00 Georgi Gerganov kv-cache : fix k-shift for multiple streams (#14742) 01612b74090df592663cfa01f661c9628f403b59 086cf81e88fb75287b71ff19c08a206b7bc2e02f 2025-07-17T19:08:33+03:00 Georgi Gerganov llama : reuse compute graphs (#14482) d9b691081c04ec5fb0daa9d2b979f915c142963d ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0 2025-07-17T09:49:15+03:00 Georgi Gerganov kv-cache : opt mask set input (#14600) ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0 1ba45d49822c39ca9a552c7b75efe0495ff400c3 2025-07-17T09:45:54+03:00 Georgi Gerganov batch : fix uninitialized has_cpl flag (#14733) 496957e1cbcb522abc63aa18521036e40efce985 21c021745d781edf9c44b4972ef6cbbf53b0ecff 2025-07-16T15:17:25-04:00 Diner Burger llama : fix parameter order for hybrid memory initialization (#14725) 21c021745d781edf9c44b4972ef6cbbf53b0ecff b0f0ecc3dce806c68609d375a2b3edc430d8db18 2025-07-16T08:18:51-07:00 Reese Levine ggml: Add initial WebGPU backend (#14521) 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363) ab140198211385b85eeeb0abd549a4bbe259e10d 64978340b0b4a0a6e2fb74270c1509383d2eff32 2025-07-16T20:03:51+08:00 Aman Gupta Support diffusion models: Add Dream 7B (#14644) 79e0b68c178656bb0632cb8602d2940b755077f8 c81f4192f91a1e209c1eec7a84fe5371ef9175da 2025-07-16T12:00:42+08:00 Min-Hua llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708) ba1ceb34566c889a1fc500efa79799ffed25d9b0 10a0351a97c25471aea0bbde9cca54d32d163eec 2025-07-15T14:51:09-05:00 Jeff Bolz vulkan: fix noncontig check for mat_mul_id splitting (#14683) 68e37a61a7b24863f67541db65b4f6195962a268 cbc68be51d88b1d5531643b926a4b359c3cff131 2025-07-16T01:11:42+09:00 Shunta Saito model : add PLaMo-2 support (#14560) 9c9e4fc6354fc811efa06a8eb7a86d3315cec9c8 494c5899cb76859f32ddd913534f2685fd684a3d 2025-07-14T21:01:41+08:00 Aman Gupta llama-context: add ability to get logits (#14672) 65a3ebb0aa56d6c501466e0f950ad15105fd32d8 0d9226763c82562186122f3b827fa3862864a19c 2025-07-14T10:37:35+01:00 Anton Mitkov sycl: Batched mulmat rework for oneDNN dispatch (#14617) 0d9226763c82562186122f3b827fa3862864a19c 982e347255723fe6d02e60ee30cfdd0559c884c5 2025-07-14T07:43:43+08:00 Molly Sophia llama : add jinja template for rwkv-world (#14665) b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 98197e5c98388470030d908f355ec5937dcccaaa 2025-07-12T05:12:26-05:00 Jeff Bolz vulkan: support SET_ROWS (#14587) 98197e5c98388470030d908f355ec5937dcccaaa f5e96b368f1acc7f53c390001b936517c4d18999 2025-07-12T04:51:58-05:00 Jeff Bolz vulkan: optimizations for deepseek prompt processing (#14555) 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550) 4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531) 6efcd65945a98cf6883cdd9de4c8ccd8c79d219a 699f4392a33f57c3352cf8d60bdc53db7ca235e7 2025-07-08T13:11:42-05:00 Jeff Bolz vulkan: optimize flash attention split_k_reduce (#14554) bb4f7a9e4eec171fecf0f640b1337a1c24485560 b8eeb8741d4483daf576498cf90537b4de71633c 2025-07-08T11:37:47-04:00 compilade memory : fix broken batch splits for recurrent cache (#14575) 67d1ef23c68e1e09dc6d7423d1ef5fc0ea56ed5e 7b50f7c0257695d0f6918bffce4e68d5c13b0c9e 2025-07-04T09:08:59+03:00 Georgi Gerganov batch : add optional for sequential equal split (#14511) c79184d2d192489e3c918bab8ed717d22f8c02bd 499a8f5a787f5fdc7f3fdfb9d1ff01b6cb5e994e 2025-07-04T09:04:59+03:00 Georgi Gerganov batch : add n_used count (#14512) a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 9067487c4411efb20400103fcccfdd389c80d428 2025-07-03T10:53:35+03:00 Georgi Gerganov kv-cache : use ggml_set_rows (#14285) 9067487c4411efb20400103fcccfdd389c80d428 d4cdd9c1c3cebdafca735958597de4ff7b7c0f54 2025-07-03T10:46:57+03:00 Georgi Gerganov ggml : fix FA mask dim 2 and 3 (#14505) 5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126) 8875523eb311cac832bfda0c581e852292185ae9 ec68e84c32325a3417fbcd2e60d4bda6adb4e4bc 2025-07-01T03:32:56-05:00 Jeff Bolz vulkan: support softmax/FA batch and broadcast (#14449) 307e79d33d4cdd9f1d6c42fc861724e6ba12b98f d7f5f4e578d1f60b0835d1734a50438c309b3e5c 2025-07-02T20:38:10+08:00 zhouwg opencl : fix possible buffer overflow in dump_tensor (#14490) d7f5f4e578d1f60b0835d1734a50438c309b3e5c c8a4e470f65c3a932e18eddc5fba1844876d7463 2025-07-02T14:12:07+03:00 Georgi Gerganov simple-chat : fix context-exceeded condition (#14494) 6a746cf9c40f8d93d13eb8a6c2b989a15e7fa61a eff5e45443a248f89cc61e64786f38b68b4da489 2025-07-01T03:43:08-05:00 Jeff Bolz vulkan: Split large mul_mat_id to fit in shared memory (#14451) 745f11fed09ba2303f3f494efb12286d382608e5 5dd942de5922a22ec8446a4ad2203738dbcb9389 2025-06-30T18:03:03+03:00 Georgi Gerganov memory : correctly handle failure in apply() (#14438) caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 83790b0e7e09ab17238b16452a33053a71dbdfad 2025-06-29T20:02:53+02:00 matteo server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196) 83790b0e7e09ab17238b16452a33053a71dbdfad f47c1d7106e49062279bcc57fc1077c0db61e278 2025-06-29T19:29:57+02:00 Renat server : fix appearance of the chats list context menu for Safari (#14322) 27208bf657cfe7262791df473927225e48efe482 63a7bb3c7e1c6b0a92d03b0a594d3cd501d6ed3e 2025-06-29T01:30:53+08:00 Aman Gupta CUDA: add bf16 and f32 support to cublas_mul_mat_batched (#14361) 00d5282c7f2a0bb05bb315fb81ca3b0f42cf9f07 566c16fcce44876a167c37f159085afe6f84b28c 2025-06-28T10:17:09-05:00 Jeff Bolz vulkan: lock accesses of pinned_memory vector (#14333) 72babea5dea56c8a8e8420ccf731b12a5cf37854 43678060c1f4cfab2f899466fd615e358677f807 2025-06-27T21:42:02+03:00 Georgi Gerganov graph : make llm_graph_context destructor virtual (#14410) 43678060c1f4cfab2f899466fd615e358677f807 8d94219a4a7f2da72ee542019ca01f36af93d1d6 2025-06-27T17:55:45+03:00 Georgi Gerganov recurrent : call balloc split_reset() in init_batch() (#14414) 5783ae43599400b723b5da0569c1f848419ff3c7 bf5bcd0b857db420235e03639f0a5f218a7f8cf8 2025-06-26T15:50:15+03:00 Georgi Gerganov metal : batch rows copy in a single threadgroup (#14384) ba67d6c03fed3193987a4ef13050e6e2a4451df4 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 2025-06-26T17:42:32+08:00 Yunzhe Jia llama-calrt: infer-op: copy data from output buffer to dst-tensor.data 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following: 73e53dc834c0a2336cd104473af6897197b96277 62af464227dafa1c55e0535bcb24346326748f46 2025-06-24T11:46:25-07:00 lhez opencl: ref count `ggml_backend_opencl_context` and refactor profiling (#14254) 62af464227dafa1c55e0535bcb24346326748f46 c148cf1946275952a79ad50b6199725f12a70411 2025-06-24T18:26:30+03:00 Georgi Gerganov batch : fix check for empty sequences in memory (#14364) 72c6bc3f3d0cf3bf160dddf1b803fed52bcbb0a3 defe2158dd5e250b4ef53994057a4ec03131a263 2025-06-23T19:56:19+08:00 Molly Sophia llama : better rwkv chat template and add missing `inputs.use_jinja` setting (#14336) defe2158dd5e250b4ef53994057a4ec03131a263 7b50d589a863c7631135c1226f6eab65cb406212 2025-06-23T13:11:31+02:00 Johannes Gäßler CUDA: mul_mat_v support for batch sizes > 1 (#14262) 7b50d589a863c7631135c1226f6eab65cb406212 3a9457df962b5883f2773f1c295e8c19df60d89f 2025-06-23T12:27:35+03:00 Georgi Gerganov kv-cells : fix tracking of seq_pos (#14339) 5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3 40bfa04c95c19fb42bafd4e21b5c2a7771846801 2025-06-22T21:44:57+09:00 yuiseki mtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326) 692e3cdd0a069ab56411b64506a67537d767683e b23fa0b3f40165ca3aae8ad4ee756e72f9a130dd 2025-06-21T08:03:46+03:00 Georgi Gerganov memory : rename interface to llama_memory_context_i (#14296) 4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd 9eaa51e7f08593f123f00136591179a8f5956ecd 2025-06-20T10:14:14+03:00 Georgi Gerganov ubatch : new splitting logic (#14217) d2f325130c4ed77a3dcff2c23a926587fb08e2cc 6391ee7ffd97e723dfbdcc32f001e1b95a63cba6 2025-06-17T11:53:33+08:00 Yunzhe Jia calrt: add input_token in graph; input_token will be copy to calrt_in_buffer d67341dc18fc5cc63362880ab2f8f9ecfc7932e7 456af35eb70177b8dd5779b6d4c21bb020f9cebd 2025-06-19T16:01:03+03:00 aa956 server : add server parameters for draft model cache type (#13782) 10bb545c5b54175ed9874ad8d187effa2bcb4b5f edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 2025-06-19T09:15:42+02:00 0cc4m Vulkan: Set device max size for host memory to avoid OOM warning and fallback to CPU buffer (#14249) edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979) bbe98d27840453c8787d18470963530fdc27d89f c2056ed6d461e6d5432f04f221e221ab795dc652 2025-06-13T09:05:44+02:00 Daniel Bevenius ggml : remove unused ggml_context_container (ggml/1272) 30e5b01de2a0bcddc7c063c8ef0802703a958417 e54b394082de242be4ee2e692b11fcc8d4eba371 2025-06-15T17:53:45+01:00 Ed Addario quantize : change int to unsigned int for KV overrides (#14197) 5fce5f948df8f189a5401a8ecaa9753106e75abb 9ae4143bc6ecb4c2f0f0301578f619f6c201b857 2025-06-15T10:52:11+03:00 Georgi Gerganov kv-cache : fix use-after-move of defrag info (#14189) b9912ac570de8945ae9383c9ca8291027bf287dd 00ba7726100d7e1941d9f5a06f56a7559945b33c 2025-06-15T09:18:37+03:00 Georgi Gerganov batch : auto-gen positions + verify multi-sequence input (#14177) 80709b70a2f87c13ccaf1480b799393109996789 26ff3685bfbaa4c8838d7afd988b17dd5eb99f92 2025-06-13T18:35:00+03:00 Georgi Gerganov batch : add LLAMA_BATCH_DEBUG environment variable (#14172) 60c666347becacff81cd4bc9a52038ba71038e41 b7cc7745e38141060845145af0a1fd489d8e3e33 2025-06-13T13:47:55+03:00 Georgi Gerganov batch : rework llama_batch_allocr (#14153) ffad04397399ea1650fda6560c7c753059804876 0889eba570126f8a2f5a0e88fde776bbc91cca66 2025-06-13T11:18:25+03:00 Georgi Gerganov server : fix SWA condition for full context reprocess (#14163) c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152) f6e1a7aa8787b5c00acba6370cb70a0beff48b1e c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c 2025-06-12T11:50:01+03:00 Georgi Gerganov context : simplify output counting logic during decode (#14142) c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c e2c0b6e46a5596665569ae765f0993cea2619af6 2025-06-12T11:49:26+03:00 Georgi Gerganov batch : remove logits_all flag (#14141) 9596506965f65be5d802ecef6a315fe43d2391a8 a20b2b05bce6622c585459ebf46f142f113d021c 2025-06-12T10:02:15+03:00 Georgi Gerganov kv-cache : fix split_equal handling in unified implementation (#14130) a20b2b05bce6622c585459ebf46f142f113d021c 2e89f76b7af2c0b827be785e445f2e2b3e52e1ca 2025-06-12T02:56:04-04:00 compilade context : round n_tokens to next multiple of n_seqs when reserving (#14140) bd248d4dc7265437e1918dc53ae3f49a0c592e5f 7781e5fe99f2a4fc1c8af0a8488eedac4644cb72 2025-06-11T09:48:52-05:00 Jeff Bolz vulkan: Better thread-safety for command pools/buffers (#14116) 89a184fa7125b7c3e2fb567337cc2bd7bc2d376c 2baf07727f921d9a4a1b63a2eff941e95d0488ed 2025-06-11T16:48:45+03:00 Georgi Gerganov kv-cache : relax SWA masking condition (#14119) 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 1f7d50b2936023b26eb218e944e62834b80a2ce0 2025-06-11T12:52:45+03:00 Georgi Gerganov kv-cache : add LLAMA_KV_CACHE_DEBUG environment variable (#14121) 1f7d50b2936023b26eb218e944e62834b80a2ce0 4c763c8d1b4d4de20bf364ec1837430783cba984 2025-06-11T00:19:25-05:00 Jeff Bolz vulkan: Track descriptor pools/sets per-context (#14109) dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834) 1f63e75f3b5dc7f44dbe63c8a41d23958fe95bc0 40cbf571c9210031340f022d104317e89a1a6bb2 2025-06-09T23:05:02+03:00 Georgi Gerganov metal : use less stack memory in FA kernel (#14088) 40cbf571c9210031340f022d104317e89a1a6bb2 7f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb7 2025-06-09T23:04:35+03:00 Georgi Gerganov kv-cache : fix shift and defrag logic (#14081) 8f47e25f56e9792093b7497c68e9f80bab82ed19 201b31dc2e6fef3de598280b53fd3b69420a4e49 2025-06-09T07:36:26-07:00 Diego Devesa cuda : fix device sync on buffer clear (#14033) e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57 dc0623fddb661926e0998538895155e4f081ff09 2025-06-09T19:47:39+08:00 Xinpeng Dou CANN: Simplify the environment variable setting(#13104) 247e5c6e447707bb4539bdf1913d206088a8fc69 5787b5da57e54dba760c2deeac1edf892e8fc450 2025-06-08T11:39:56-07:00 Diego Devesa cuda : fix buffer type check with integrated GPUs (#14069) 0974ad7a7cd4bca846b15c484ff3be890135a52c 745aa5319b9930068aff5e87cf5e9eef7227339b 2025-06-07T14:13:12+02:00 Sigbjørn Skjæret llama : fix llama_model_chat_template with template name (LLM_KV with suffix) (#14050) 745aa5319b9930068aff5e87cf5e9eef7227339b 487a5e0401423bba02cd6e97e4d45131bb20b22b 2025-06-06T14:11:15+03:00 Georgi Gerganov llama : deprecate llama_kv_self_ API (#14030) 487a5e0401423bba02cd6e97e4d45131bb20b22b d17a809ef0af09b16625e991a76f6fe80d9c332e 2025-06-06T13:29:18+03:00 Georgi Gerganov context : fix SWA-related warning for multiple sequences (#14045) 7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 3a077146a4761fdbd24bdd8eb098f46b8adc4dda 2025-06-05T15:29:22+03:00 Georgi Gerganov memory : migrate from llama_kv_cache to more generic llama_memory (#14006) 3a077146a4761fdbd24bdd8eb098f46b8adc4dda d01d112abb055549d33bb8aac1755eb0c40918ad 2025-06-05T02:57:42-07:00 Diego Devesa llama : allow using mmap without PrefetchVirtualMemory, apply GGML_WIN_VER to llama.cpp sources (#14013) 9e31bec4fd53634c9e5b04650488a09a055f5dab 5a8ae3053ced350ed300ba91600519fcad1c6ba7 2025-06-05T09:06:29+03:00 Georgi Gerganov context : fix pos_min initialization upon error decode (#14008) 3e63a58ef7addec35408e2eb67850d7cdc935dc3 2589ad3704559f4dd860f5f303b19349c688a28a 2025-06-04T18:58:20+03:00 Georgi Gerganov kv-cache : refactor the update/defrag mechanism (#13988) e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a 7e00e60ef86645a01fda738fef85b74afa016a34 2025-06-04T09:50:32+03:00 Georgi Gerganov kv-cache : fix unified::seq_rm to work with seq_id < 0 (#13985) 363757628848a27a435bbf22ff9476e9aeda5f40 ea394d7ab1f8101716d48ce9421c94c71b93a00f 2025-06-02T21:34:40+03:00 Georgi Gerganov server : disable speculative decoding for SWA models (#13970) bfd322796cd838f906535ff3352624fc46338894 093e3f1feb16e25e58f7d61e01266c830dd424b8 2025-06-02T16:29:28+02:00 Xuan-Son Nguyen mtmd : fix memory leak in mtmd_helper_eval_chunk_single (#13961) 0fc16b42e8793364918e830c234c1f3caec29dae 053b1539c02617eff744f89525ee57497c3c1fbe 2025-06-01T11:39:27+03:00 Georgi Gerganov kv-cache : split implementation in separate sources (#13920) 803f8baf4f741d2f0465c46c33f285886b97a071 3600cc2886956fc0a07ef6ad2f4128ccfdbc8c6f 2025-05-31T15:58:33+03:00 Georgi Gerganov llama : deprecate explicit kv_self defrag/update calls (#13921) 3600cc2886956fc0a07ef6ad2f4128ccfdbc8c6f c7e0a2054b908c28bf93bb18d4b63ccbff2c4127 2025-05-31T15:57:44+03:00 Georgi Gerganov llama : use n_swa + n_ubatch cells for SWA cache (#13833) 3f55f781f1da9241f209648636fa0426fe62a495 51fa76f172957c9916e43aeb581f82c533e12394 2025-05-31T12:55:57+03:00 Georgi Gerganov llama : auto-batch preparation (#13845) 12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746) b47ab7b8e9c4f6154eb6abb6234866ab117d64c7 dd665cc9d4b378626cde11ea0c4c91f514fdc994 2025-05-30T09:56:19-07:00 Diego Devesa sched : avoid changing cur_copy when a graph is already allocated (#13922) df0c0c7d02f951dc639d48fd536f79200460ac83 b49a8ff96b769b8a4c36d89fb783ec0135be582b 2025-05-30T07:37:18-07:00 Diego Devesa cuda : prevent using split buffers with 3d/4d matrices (#13919) b49a8ff96b769b8a4c36d89fb783ec0135be582b 53f925074de02c5304b00c14b4d6d8910c58667d 2025-05-30T19:40:57+05:30 Akarshan Biswas SYCL: Add mrope kernel (#13755) db38704f0133be7832123495fa8fc2601ea999d4 07e4351ce663a7802b31f92fd7bc0e555c2044b6 2025-05-30T14:50:43+02:00 Sigbjørn Skjæret convert : fix rwkv bos/eos token (#13844) 54a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c 21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d7 2025-05-29T19:39:20+08:00 Yibo Cai arm64: optimize q4_k_q8_k kernel with i8mm (#13886) 763d06edb7dd5094ea58bad1d81e2e8d35033e34 10961339b26bd2eff01d5479e8879f435da261b7 2025-05-28T22:35:31+02:00 Xuan-Son Nguyen llama : fix KV shift for qwen2vl (#13870) a68247439bd6fb756cc93ad2817e55a02aa0b100 26b79b6cb3e7840ff15729350e95907e19f9f480 2025-05-28T13:33:37+02:00 Johannes Gäßler CUDA: fix FA tg at long context for CC >= 8.9 (#13852) 81713121ee56755ba4a147d1a1e3fa248ec31a66 f9cd68398baf2ba8af4725ca9ed00bef205e6706 2025-05-27T13:49:41+03:00 Georgi Gerganov kv-cells : track min/max used cells and per-sequence positions (#13808) 4f81b33e324b1669b282eb81104e4a1131be7dce cdf94a18023c92f41808ec874ba577d914674717 2025-05-27T09:40:59+03:00 Georgi Gerganov llama : validate seq id batch input (#13809) 79c137f77677b3c8ee3c60a7da033721b938399a 22229314fc46b2f741bb21b12cde71f6c6a60b52 2025-05-26T14:03:54+03:00 Georgi Gerganov examples : allow extracting embeddings from decoder contexts (#13797) de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac c508256db2de2b032e19c8ed833f4683c827c9a1 2025-05-25T16:34:36+03:00 Georgi Gerganov kv-cache : rework kv_cell (#13706) 8a1d206f1d2b4e45918b589f3165b4be232f7ba8 797990c4bca0dca5be295c63e3fb2800dc0a69c2 2025-05-22T22:21:07+03:00 Georgi Gerganov tts : fix n_ubatch + make WavTokenizer cache-less (#13713) 797990c4bca0dca5be295c63e3fb2800dc0a69c2 ab86335760ebb441574eb47f886fa1ee302e2131 2025-05-22T20:42:48+02:00 Xuan-Son Nguyen mtmd : add ultravox audio input (#13623) cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692) 6b56a64690a318fcabcd7739ac7e314d44785ea8 a4e8912dfd4604be1e39bc86ba4c0b02969967ef 2025-05-22T09:24:09+01:00 Ewan Crawford SYCL: Avoid using with SYCL-Graph for unsupported nodes (#13587) edbf42edfdabb9cea72ae12137570cf48f5d8076 d643bb2c798df9c2cd61067d2692b1cd417df402 2025-05-21T23:21:17+03:00 Henry Linjamäki opencl: fix couple crashes (#12795) 797f2ac0625b22edeff03cc30e0f988da6b6b068 b44890df2e4fad0ece1d5366dcbc8bedae23b658 2025-05-21T15:11:13+03:00 Georgi Gerganov kv-cache : simplify the interface (#13660) 33983057d0f578aca74ba15eccc3de9c267a5ff6 fb1cab201c6c4cd36731f100df74eece2f4706fa 2025-05-21T09:58:49+08:00 R0CKSTAR musa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647) b7a17463ec190aeee7b9077c606c910fb4688b84 be0239693c1530a18496086331fc18d8a9adbad1 2025-05-21T00:55:30+08:00 l3utterfly mtmd-helper : bug fix to token batching in mtmd (#13650) a4090d1174aed22dde5cacce2a4c27656b987a2f b69f1647f9953cb3773266d2c83a92fd0e7e6d66 2025-05-20T16:13:16+03:00 Georgi Gerganov llama : remove llama_kv_cache_view API + remove deprecated (#13653) b69f1647f9953cb3773266d2c83a92fd0e7e6d66 759e37b0d89bc4bd1bce860dc5f3c3052e08575c 2025-05-20T14:45:07+02:00 Johannes Gäßler CUDA: skip fully masked-out KV in FA vec kernel (#13584) e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194) f7c9429c85748cde9599499601ba48d0057722e6 1dfbf2cf3a9f15193dd893396d07762bbd2c4785 2025-05-20T02:54:43+02:00 Nicolò Scipione sycl : Overcoming workaround for mmap() allocation on Windows (#13482) 6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 aea9f8b4e73876739bf88fb705502f291294e469 2025-05-16T21:50:00+02:00 Xuan-Son Nguyen server : do not return error out of context (with ctx shift disabled) (#13577) e3a9421b78da5c810d812e6348a405f5acc39f34 5ab5d5fb256aa23f8ab4de8463515ea627f43006 2025-05-14T23:15:15+03:00 Georgi Gerganov kv-cache : fix out-of-bounds view during reserve graph (#13547) 5ab5d5fb256aa23f8ab4de8463515ea627f43006 3198405e98530c683d12fd123e3920f2bd2aafa5 2025-05-15T03:53:52+08:00 Yibo Cai arm64: optimize q6_k_q8_k kernel with i8mm (#13519) 017f10b5fa630a013ec4f9936e410a60d4f460d5 4696d5674999dc10a7fb8c27b33406a929f7463a 2025-05-14T19:18:18+03:00 Gilad S. fix: crash when calling `llama_state_get_size` on a context without a KV cache (#13542) 4696d5674999dc10a7fb8c27b33406a929f7463a b7d26720821823e23e2273a99e38398d511242e9 2025-05-14T16:41:02+02:00 Johannes Gäßler CUDA: fix crash on large batch size for quant. MoE (#13537) 360a9c98e13d35f322b4c5b1309aab0cc90ed82b 09d13d94fb169093095416ac6323551c37b75339 2025-05-14T13:35:07+02:00 Xuan-Son Nguyen server : fix cache_tokens bug with no cache_prompt (#13533) 24e86cae7219b0f3ede1d5abdf5bf3ad515cccb8 bb1681fbd532eba26ae4c14cd8be884c8afeb31c 2025-05-14T18:55:26+09:00 Jeff Bolz vulkan: KHR_coopmat flash attention (#13506) f0995d28ce3d15095b6845d94ce4465e46575873 c252e0c4097b34666e5a81db9d0450d71fa3098f 2025-05-13T18:04:39+03:00 Georgi Gerganov metal : use FA-vec kernel up to batch size 20 (#13496) c252e0c4097b34666e5a81db9d0450d71fa3098f 4f711afed5e7ef4304b567c8888ee1aa60e868eb 2025-05-13T18:04:00+03:00 Georgi Gerganov metal : optimize multi-sequence FA vec kernel (#13493) b89d605a91dee0a518ecd582f8991a07d523e2fa b4726345aca49e2ad62d615e6e370b3dbad6434f 2025-05-13T18:01:53+03:00 Georgi Gerganov batched-bench : fix pp batch contents (#13492) 064cc596ac44308dc326a17c9e3163c34a6f29d1 91159ee9df84edb72ccf874e353d2414f3a8c60d 2025-05-12T15:12:27+03:00 Georgi Gerganov context : fix state io for memory-less contexts (#13470) 9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1 09232370fc6426aa5dd9be01a8271b9c28f5af3a 2025-05-11T11:08:26-04:00 Anthony Umfer tools : fix uninitialized llama_batch in server (#13436) b064a51a4e7246fa43a3307f58e59f65e6be170a 053367d149f778cdabc356ee3024494e0dd53223 2025-05-10T21:34:48+07:00 Thammachart Chinvarapon ci: free_disk_space flag enabled for intel variant (#13426) dc1d2adfc0f4de84da7923866d00781ec5c4e666 7c28a74e0783f4bb74a246fb9f19bf212139e365 2025-05-09T23:07:07-07:00 Jeff Bolz vulkan: scalar flash attention implementation (#13324) 33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898) 611aa914ef4231fab5d1ad04773c42e119ae2d2e 0cf6725e9f9a164c39f7a87214d60342f7f946d8 2025-05-09T15:14:56+03:00 Georgi Gerganov metal : optimize MoE for large batches (#13388) 5c86c9ed3ef1cc7307fdce05f0f0e2e45253cf90 efb8b47eda78ea8ae570d4fece3953aae499289e 2025-05-09T12:14:04+02:00 Johannes Gäßler CUDA: fix crash on large batch size for MoE models (#13384) 2189fd3b6327a1d17893694125da8edcf74a6468 3f96aeff394e9b72bbd2fa665c3e023a70ed8648 2025-05-09T11:18:02+02:00 Xuan-Son Nguyen mtmd : fix batch_view for m-rope (#13397) f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 2025-05-08T14:25:39-04:00 Matt Clayton mtmd : Expose helper_decode_image_chunk (#13366) 8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365) 6562e5a4d6c58326dcd79002ea396d4141f1b18e 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 2025-05-08T14:28:33+03:00 Georgi Gerganov context : allow cache-less context for embeddings (#13108) 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 70a6991edf1b60e7afa8962f830320583f3babb0 2025-05-08T14:26:50+03:00 Georgi Gerganov context : remove logits_all flag (#13284) 8733e0cf6eefc7c7752297cc22d0836706f4222c 814f795e063c257f33b921eab4073484238a151a 2025-05-08T10:08:01+01:00 Alberto Cabrera Pérez sycl: addressing non-contiguous src1 mul_mats (nc and batched) (#13343) bc4e1128f78be0fbb4e2fa630adb6a04b969ac68 39e73ae0d69f882d7e29cecc6dd8f5052fca6731 2025-05-07T12:49:27+02:00 Sigbjørn Skjæret llama : deci : support ffn-free with attention (#13296) 32916a49072f01c43e20df374af5f8a1f70d6963 ffc727203af1061fdeb49efef30f76171722e403 2025-05-06T22:40:24+02:00 Xuan-Son Nguyen clip : refactor graph builder (#13321) 27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184) a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd 3f3769ba76061a511f02f2a48da2ad2d93fce511 2025-05-02T20:54:13+03:00 Georgi Gerganov context : fix reorder logic (#13267) 3f3769ba76061a511f02f2a48da2ad2d93fce511 2f567611c0234bbca0a4009762acb47b56866095 2025-05-02T22:23:12+05:30 shalinib-ibm ggml : Enable MMA for BF16 in llamafile_sgemm (#13148) 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 074e42ab31de4c99aa7d9d2d239660f64b2380d6 2025-05-02T11:41:54-04:00 Jared Van Bortel convert : use correct context length for nomic-embed-text-v2 (#13216) c642bc014c105728ce45015813351dc5a37f60a2 cb06a3c363f50cd35113984fe8fb164aea419077 2025-05-02T17:48:36+03:00 Georgi Gerganov kv-cache : separate recurrent vs non-recurrent impl (#12799) fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 dcf886007de4b8e5200f461a13233315f897fb9d 2025-05-02T09:48:31+03:00 Georgi Gerganov server : add cache reuse card link to help (#13230) 8efbdadc616fa717c369059b9b388160958d886c f057808ffadce213f54c1884ab5096e60140f358 2025-05-01T17:32:11-04:00 Justin Santa Barbara rpc : avoid uninitialized memory in serialize_tensor (#13210) f057808ffadce213f54c1884ab5096e60140f358 d7a14c42a1883a34a6553cbfe30da1e1b84dfd6a 2025-05-01T13:46:10-07:00 Jesse Gross ggml: Don't assert fail when tensor data changes (#13222) fc727bcdd5a311c7c69a76dbf87f4784e828c7b4 b0ecbd434be024c06bf547491be444ed92e1123e 2025-05-01T13:19:31-05:00 Jeff Bolz vulkan: Handle src1 batch dimension in non-contiguous mat-vec-mul shader (#13191) 4254bb49518e0f920f14c9aadd96eefdfd38b429 9998540149a490200894acfe595e9a1546bab723 2025-04-30T15:20:40+02:00 Diego Devesa ggml : fix ggml_gallocr_ptr type (ggml/1205) e1e8e0991ffd9e99a445c6812bb519d5bac9f4b5 6f67cf1f480926391ad75ff746e0a021214bf70c 2025-04-30T23:12:59+02:00 Johannes Gäßler CUDA: batched+noncont MMQ, refactor bs>1 MoE code (#13199) 16a457facd996915652f6274384c87602b27d21a 3e168bede4d27b35656ab8026015b87659ecbec2 2025-04-30T15:28:43-05:00 ddh0 fix typo: `n_ctx_pre_seq` -> `n_ctx_per_seq` (#13221) a0f7016d170ca4bfe24d9a9f26c024d034af69f2 19e899ce21a7c9ffcf8bb2b22269a75f6e078f8f 2025-04-30T14:29:22+08:00 xiaofei rpc : fix cache directory initialization (#13188) cdf76586b23c67abd3ca064ee2c084c57ae240bd 7d3af70b089bb349b5d17eb01839224c99ec1952 2025-04-29T16:00:27+02:00 Johannes Gäßler CUDA: fix non-cont. inputs for batched mat mul (#13155) 00e3e5a194e88e604e7c91391b9e90332888fd72 e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68 2025-04-29T11:47:04+02:00 Xuan-Son Nguyen mtmd : add qwen2vl and qwen2.5vl (#13141) 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069) 1831f538f720d1d99fba146f24f0a8e970838cc4 4e87962e34a4b257ec374c4baf6b1568554b81a9 2025-04-28T20:20:39+05:30 Vishal Agarwal llama-bench: add `-d` depth arg (#13096) fb0471d1753824e75474c24f82fbdd54c94dceda d2b2031e5f11b826dcc718138642f147a2009665 2025-04-28T06:45:40-07:00 pockers21 context : do not clear output buffer on reserve (#13152) ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402) 4753791e70acd4d4e02f2098f14a03df26c992bd 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba 2025-04-26T22:39:47+02:00 Xuan-Son Nguyen clip : improve projector naming (#13118) 226251ed56b85190e18a1cca963c45b888f4953c 87616f0680947800ecba3e9f6bc6e101943bf8e6 2025-04-24T22:29:22+03:00 Georgi Gerganov embeddings : fix batch sizes (#13076) 658987cfc9d752dca7758987390d5fb1a7a0a54a dc39a5e7a84815a90fa0c515ed8927870cf858c9 2025-04-22T21:27:40+02:00 Johannes Gäßler CUDA: noncont MMVQ + batched bs1 MUL_MAT_ID (#13014) 7b53389c24a507564be39e1ea82746a39749059b 243453533e029334181dda50d911d5fc5a2b2486 2025-04-22T16:15:51+03:00 Georgi Gerganov metal : add memory pool for temp allocs (#12850) 84778e97703740d8ac5fb64e14d83b80eafa0f3c 510676475f885ec064ff147af9f20ee7a9b12a50 2025-04-15T17:20:38+08:00 David Huang CUDA/HIP: Share the same unified memory allocation logic. (#12934) daa422881a0ec7944771bcc8ff8de34d11f5bd3b eccc7a1602f0752507de4aaad1008b9618a282c8 2025-04-15T07:49:57+01:00 Juk Armstrong llama : DeepSeek V2/V3 MLA implementation (#12801) b0c75ac9f93322b45e3766e149417334b4fd1ed9 d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 2025-04-15T10:04:24+08:00 Xinpeng Dou CANN: Optimize CANN buffer pool memory management (#12875) c772d549264c1be058411312a54049e0dc86a037 81c7e64fc239288e91a58adad9145110e0353822 2025-04-14T13:59:34+03:00 Radoslav Gerganov rpc : use ggml_context_ptr (#12938) bc091a4dc585af25c438c8473285a8cfec5c7695 a4837577aae59c0ae640f3810094724bcac6bb28 2025-04-12T21:03:39+05:30 Prajwal B Mehendarkar common : Define cache directory on AIX (#12915) e8a62631b3b05bcf2ad0e0c686881a9f3e3f03ca b6930ebc421e20399663bbd3bc7b7266d5236d06 2025-04-11T13:04:14-07:00 yuri@FreeBSD rpc : Set cache directory in rpc-server.cpp on FreeBSD (#12903) 68b08f36d047bfa048ebd7d16262c53bf9ece701 578754b3157d662c2fdd51eaa62b6c1f43d3172c 2025-04-11T12:45:44-07:00 yuri@FreeBSD common : Define cache directory on FreeBSD (#12892) 0c509239445088f21265580b86733c5b184261d9 fccf9cae83e6c6cd31a0ecb403d237638e427d0a 2025-04-11T12:09:39+02:00 Xuan-Son Nguyen clip : use smart pointer (⚠️ breaking change) (#12869) 8ac9f5d765f2b1b7f821873618c0cff68ca59bc8 12e9158f25cb47e97ca9b8083e1ec7415f262260 2025-04-11T15:26:17+08:00 R0CKSTAR ci : Replace freediskspace to free_disk_space in docker.yml (#12861) 64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 2025-04-09T17:22:30+08:00 R0CKSTAR musa: enable freediskspace for docker image build (#12839) 0090950f679475c5ecaac2f7bca5049cca96492b 7ecd780b1a1d5214b8d04c25ebfc194d310816ed 2025-04-09T00:25:08-05:00 Jeff Bolz vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833) 7538246e7ce0606694c38055cc2fc9f60535be6c b32efad2bc42460637c3a364c9554ea8217b3d7f 2025-04-08T23:21:31+02:00 Sigbjørn Skjæret cuda : add f32 to bf16 copy op (#12806) a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825) 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 1d343b4069c74b2c7b19ae84260cd98aa2320a9a 2025-04-08T21:49:13+08:00 dm4 llava: add more helper functions to check projector types in clip context (#12824) 8ca6e1c3a4deb6bb27ee294bfd5706098d94ae88 656babd6c21a3b9b3622324cfcc80a2ab78da25b 2025-04-08T14:14:59+05:00 characharm server : webui : Improve Chat Input with Auto-Sizing Textarea (#12785) 656babd6c21a3b9b3622324cfcc80a2ab78da25b a226bc7a9ac50551f9f113808de0f0046837f188 2025-04-08T15:03:21+08:00 Neo Zhang Jianyu Revert "sycl:remove redundant memcopy in function ggml_backend_sycl_buffer_set_tensor" (#12812) 518a01480eb3a7c80a4951b430db9dee55428310 e391d3ee8ddae86be70c034de1082ad51c55e211 2025-04-07T23:22:57+08:00 zhouwg sycl: remove redundant memcopy in function ggml_backend_sycl_buffer_set_tensor (#12734) bd3f59f81289b920bcc597a208c14f55e39ed37e 52b3d71f128c1eeab39b918adf1f7a8f5e256619 2025-04-07T13:35:19+02:00 Xuan-Son Nguyen cmake : enable curl by default (#12761) 80b717d493a9a5bae7167ad2384c12c60bb2ef20 6bf28f0111ff9f21b3c1b1eace20c590281e7ba6 2025-04-06T03:47:13-05:00 Jeff Bolz vulkan: Use unclamped loads for flash attention mask (#12720) 3e1d29348b5d77269f6931500dd1c1a729d429c8 1be76e4620ddc99b3cbff0f206436117ae561047 2025-04-04T21:48:10+03:00 Georgi Gerganov kv-cache : simplify + fix warning for recurrent models (#12756) 3f9da22c2b21a2cef216de50006436ef1cab8764 2a0dc97e56eac6db0a4016f0b45da6d0a0055ef2 2025-04-03T02:31:15+01:00 Alan Gray Simplify and improve CUDA graphs through use of indirect copy pointers (#9017) 2a0dc97e56eac6db0a4016f0b45da6d0a0055ef2 97a20c012be2f9bfbeee0209405a31001f93ccf9 2025-04-03T08:49:51+08:00 hipudding CANN: Fix failed test cases (#12708) 97a20c012be2f9bfbeee0209405a31001f93ccf9 f01bd02376f919b05ee635f438311be8dfc91d7c 2025-04-02T17:01:42-07:00 lhez opencl: use `max_alloc_size` in backend ctx instead of querying again (#12705) f01bd02376f919b05ee635f438311be8dfc91d7c 6f3bd38640f07e4dec7f145d2fbf093ce48c9544 2025-04-02T14:25:08-05:00 Jeff Bolz vulkan: Implement split_k for coopmat2 flash attention. (#12627) be0a0f8cae039e2286f757612accebfb8f21b36e 92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2 2025-04-02T12:40:32-05:00 Jeff Bolz vulkan: Implement grouped query attention in the coopmat2 FA shader (#12559) 92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2 833e2b7409211a07df97716998c5002526642652 2025-04-02T19:12:30+02:00 0cc4m Vulkan: Fix mmq int dot float cache size (#12722) e0e912f49b3195ef9d0c51378629ba03c9b972da a10b36c91a091f4606710fba4e9327fd71e0e738 2025-04-02T14:52:01+02:00 Diego Devesa llama : add option to override model tensor buffers (#11397) a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695) f423981ac806bf031d83784bcb47d2721bc70f97 e39e727e9a3daec7082b9c59540a429ad85914af 2025-04-02T01:54:34+09:00 Junil Kim opencl : fix memory allocation size (#12649) e39e727e9a3daec7082b9c59540a429ad85914af 5936a616e46cffad4579ccaff8f8fa315809da4c 2025-04-01T20:54:28+08:00 jklincn llama : use LLM_KV_GENERAL_FILE_TYPE instead of gguf_find_key (#12672) 5936a616e46cffad4579ccaff8f8fa315809da4c 3fd072a54001a908c54e81fd2e82b682ecfdd475 2025-04-01T14:37:13+02:00 Sigbjørn Skjæret convert : BailingMoE : fix qkv split when head_dim is 0 (#12687) 492d7f1ff77e116e44962b832cc3db24cfc46d24 d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8 2025-03-30T16:59:38+08:00 R0CKSTAR musa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611) 3891e183c61c1e25c2c61afe68d7b95019ea3f89 af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 2025-03-20T07:02:18+01:00 Daniel Bevenius examples : command.wasm updates (whisper/2904) 0bb2919335d00ff0bc79d5015da95c422de51f03 a69f8463510a70fe0c85701b8c7ede283a0d1a7d 2025-03-29T14:07:37+01:00 Djip007 llama : change cpu_buft_list order: ACCEL -> GPU host -> CPU extra -> CPU (#12632) a69f8463510a70fe0c85701b8c7ede283a0d1a7d d07a0d7a79bafb01fb3b6c8992121e75c57c0c2f 2025-03-29T18:04:58+08:00 Jay cmake : fix ccache conflict (#12522) b4ae50810e4304d052e630784c14bde7e79e4132 b86f6007234da4bff51a3ebef2bdb952b52059c6 2025-03-28T20:21:59+02:00 Georgi Gerganov metal : improve FA + improve MoE (#12612) ef03229ff423dd1991f4f44ef1352f03334d86eb 13731766db91ec927c1b61bf502ac7a9be2b11b9 2025-03-28T09:44:13+02:00 Radoslav Gerganov rpc : update README for cache usage (#12620) 13731766db91ec927c1b61bf502ac7a9be2b11b9 ab6ab8f809bd514d88e02a63869b4d619f13fa86 2025-03-28T13:13:22+05:30 amritahs-ibm llamafile : ppc64le GEMV forwarding for FP32. (#12594) ab6ab8f809bd514d88e02a63869b4d619f13fa86 2099a9d5dbdcd2841d02dd396a71d0de70bf4490 2025-03-28T08:18:04+02:00 Radoslav Gerganov rpc : send hash when tensor data is above some fixed threshold (#12496) f125b8dccff34439a26bf750c9edef358c48c1f8 953c2a62cf487e618140f3ea18d94e3b0257af93 2025-03-27T10:49:15Z Si1w llama : add PLM GGUF Conversion & Inference Support (#12457) c7b43ab60855f752ae79937fb93d561bc30b69a4 24feaec05792b972d5ff3e2b12d9237ebd50d1ac 2025-03-27T12:21:47+05:30 amritahs-ibm llamafile : ppc64le MMA implementation for Q4_0. (#12489) f17a3bb4e8b0aa24c0f86636d234aca7dc2cfa01 bd40678df768ab189b26b8b03e3de4062e3b71a3 2025-03-27T07:16:00+05:30 Akarshan Biswas SYCL: implement memset ggml backend buffer interface (#12580) 02082f1519565fc7b49de211b28bc5404a69209b df4d20cd53d5bb6fc21c1dc65f026d53b566d097 2025-03-26T22:06:04+08:00 Ivy233 clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566) 2d77d88e70d017cd82c3f1a4517e3102e2028ac4 c95fa362b3587d1822558f7e28414521075f254f 2025-03-25T09:19:23+02:00 Georgi Gerganov context : fix worst-case reserve outputs (#12545) eddfb438502bd5d1014d63a812e9b6d03d326f8c 4375415b4abf94fb36a5fd15f233ac0ee23c0bd1 2025-03-22T03:40:11-05:00 Jeff Bolz vulkan: Optimize mul_mat_vec p021 and nc shaders (#12505) 1aa87ee53d05505247c54612e40f6a38c680b433 9ffcc9e374080f73b16b7a351e6d76e7a8a19ce3 2025-03-21T14:58:47+08:00 蕭澧邦 [SYCL] Fix build on Windows when ccache enabled (#9954) (#9976) dbb3a4739e53226346c772dd72666e68b78dc583 3d82dbcbce2c677fc35fbf99574ccd107d95a1f8 2025-03-20T12:49:59+01:00 Sigbjørn Skjæret llama : make Qwen2MoE QKV bias optional (#12477) 568013d0cd3d5add37c376b3d5e959809b711fc7 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 2025-03-19T21:01:57+01:00 fairydreaming context : clear sets containing encoder output sequence ids before storing new values (#12470) 75422e8bc42646005be0754f7aa438b97a5e777e bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71 2025-03-18T21:35:19+02:00 Georgi Gerganov graph : normalize Q, K, V shapes + sync cross attention (#12449) 8551c44d840a7db50adb958ccaf464dc3ded82e7 35cae5ba05a5292dc3108636a71ec59fa2f80ab7 2025-03-18T13:05:49+02:00 Georgi Gerganov context : always use non-causal attention for encoder graphs (#12447) 810e0af3f50379682dd46b7967c4aadf3f8286f6 eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c 2025-03-18T12:05:42+02:00 Georgi Gerganov server : fix warmup draft cache type (#12446) fd123cfead49eb32e386e26b8ef7a6d41554dda5 a53f7f7b8859f3e634415ab03e1e295b9861d7e6 2025-03-18T07:21:40+01:00 0cc4m Vulkan: Default to 1GB allocations instead of 4GB to avoid fragmentation and driver issues (#12434) 7dfad387e3f6ac98d383ded2d175eb59736a3993 60c902926c928f9c2cd6390ce411876f92feeaf3 2025-03-18T07:27:50+08:00 Molly Sophia llama: Add support for RWKV v7 architecture (#12412) b3c9a65673a63a6c9a75da24ee00d13499494e0c 8ba95dca2065c0073698afdfcda4c8a8f08bf0d9 2025-03-17T07:15:12+05:30 Akarshan Biswas SYCL: set extras only on GGML_TYPE_Q4_0 (#12366) dc079cfdffa1141a6caf5d41a33d73a1ef03da55 7b61bcc87cfdeab88350e82df1c4b7be64331ea6 2025-03-16T19:29:36+02:00 Georgi Gerganov context : fix init of n_outputs (#12397) c522ce4143a2b5c277f1e5f65cd570dbd0626466 081bee8c643b1f6302e9edfe789ce2d5f0be6c77 2025-03-14T10:47:44+02:00 Georgi Gerganov graph : simplify attn input build for unified KV cache (#12381) 84d547554123a62e9ac77107cb20e4f6cc503af4 be7c3034108473beda214fd1d7c98fd6a7a3bdf5 2025-03-13T19:08:07+02:00 Georgi Gerganov llama : fix Gemma3 SWA KV cache shift (#12373) e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b 2048b5913d51beab82dfe29955f9008130b936c0 2025-03-13T12:35:44+02:00 Georgi Gerganov llama : refactor llama_context, llama_kv_cache, llm_build_context (#12181) 6ab2e4765a673abcd162258a2671560a76106d69 96e1280839561aaabb73851f94972a2cd37b2d96 2025-03-11T19:45:02+08:00 BB-fat metal : Cache the Metal library at the device context level (#12265) 96e1280839561aaabb73851f94972a2cd37b2d96 2c9f833d17bb5b8ea89dec663b072b5420fc5438 2025-03-11T09:20:16+01:00 Xuan-Son Nguyen clip : bring back GPU support (#12322) 2c9f833d17bb5b8ea89dec663b072b5420fc5438 251364549fe4a78d4e2e66f1adfaf2bd53041d2c 2025-03-10T19:28:11Z Eve mat vec double buffer (#12188) 5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 f1648e91cf6c52e9593810aa70857e412d474c09 2025-03-07T15:35:57+08:00 BB-fat metal : simplify kernel arguments using a struct (#3229) (#12194) e721c05c9336a72fbb59d5c75967360bc67036c6 57b6abf85acb1f697913a44e5e105e333d894b78 2025-03-06T08:20:52+01:00 uvos HIP/CUDA: set the paramerter value in maintain_cuda_graph instead of replaceing it. (#12209) 57b6abf85acb1f697913a44e5e105e333d894b78 94bb63e4f0f6135579b88e5700ed40cefa374e09 2025-03-05T22:22:49-08:00 Han Yin android : fix KV cache log message condition (#12212) 94bb63e4f0f6135579b88e5700ed40cefa374e09 f79243992cd31e4e4844d5158d2f3325b1d2d811 2025-03-06T03:33:40+02:00 Henry Linjamäki opencl : fix buffer alignment (#12197) 06a92a193a07afe445929607be9d5e4d033956fb a057897ad4e48e3df0354256e0cc80dadcb57595 2025-03-05T15:25:45+08:00 Clauszy server : fix cache reuse logic (#12161) 2679c3b55d1c9c3fed56dea00fea713622e42594 c43af9276b119dae7436b7878d59671d0f6b1a97 2025-03-03T16:17:36+01:00 Daniel Bevenius ci : set GITHUB_ACTION env var for server tests (#12162) 70680c48e5f77d2d3138712a6582bd8c1e548922 c43a3e7996e585e2addde1e44057a4f3cdbadef8 2025-02-28T05:41:47-08:00 William Tambellini ggml : upgrade init_tensor API to return a ggml_status (#11854) 438a83926afcff3643ffef5543db67545ceffe39 9c42b1718ca8299f9afeabdc122badeab64c9690 2025-02-28T09:42:52+01:00 Rémy O vulkan: add specific MMV kernels for IQ2 and IQ3 quants + optimizations (#11595) 3e9a2860e996657fc10db8393cf65adc40703082 58d07a8043a1395177cf77b3e4f388e34182ae64 2025-02-25T01:29:33-08:00 Vitali Lovich llama : expose llama_model_n_head_kv in the API (#11997) 7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794) af7747c95ae71a5db4184947f837179e82c70b77 a28e0d5eb18c18e6a4598286158f427269b1444e 2025-02-23T05:39:24+08:00 Aaron Teo ggml-cpu: Support s390x SIMD Instruction Set (#12019) 5fa07c2f93c73161bf09ef0b23b5d2686f9a073e 335eb04a91f481f37c0c9b302ee31b449b04c3e9 2025-02-22T12:20:17+01:00 Johannes Gäßler CUDA: optimize FA for GQA + large batches (#12014) 51f311e057723b7454d0ebe20f545a1a2c4db6b2 586d5fe6ebb8f92e9dd53420e04cec2697046073 2025-02-21T18:33:18+02:00 Georgi Gerganov llama : skip loading unused tensors (#12004) b58934c1836b5ea51dbacbe899eee125775e77c9 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d 2025-02-19T00:01:44+02:00 igardev server : (webui) Enable communication with parent html (if webui is in iframe) (#11940) 2eea03d86a2d132c8245468c26290ce07a27a8e8 0f2bbe656473177538956d22b6842bcaa0449fab 2025-02-17T07:55:57+01:00 Rémy O vulkan: implement several ops relevant for ggml_opt (#11769) 3e693197724c31d53a9b69018c2f1bd0b93ebab2 a394039db004c6ee00098250d160b5aa018c2314 2025-02-13T07:07:51+01:00 Daniel Bevenius llama : update llama_decode_internal ref [no ci] (#11840) a394039db004c6ee00098250d160b5aa018c2314 be3bbd62153820ff6d358c817360927f429105c4 2025-02-13T01:02:38+01:00 Diego Devesa ggml-cpu : add chunking support to mul_mat_id (#11666) be3bbd62153820ff6d358c817360927f429105c4 31afcbee0eebbc998ab311aa314e389d60aa2127 2025-02-13T00:33:45+01:00 Xuan-Son Nguyen ggml : x2 speed for WASM by optimizing SIMD (#11453) 19b392d58dc08c366d0b29bd3b9c6991fa4e1662 0893e0114e934bdd0eba0ff69d9ef8c59343cbc3 2025-02-10T19:58:18+01:00 Wilken Gottwalt llama-mmap: fix missing include (#11796) b044a0fe3ca0cbef9dd041edce3ebda8c501fae4 19d3c8293b1f61acbe2dab1d49a17950fd788a4a 2025-02-10T03:08:22-03:00 Wagner Bruna vulkan: add environment variable GGML_VK_PREFER_HOST_MEMORY to avoid VRAM allocation (#11592) 98f6b0fd1ea88ce33f4fcd1775d9a463067156ac 55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 2025-02-09T01:43:51-06:00 Jeff Bolz vulkan: account for lookup tables when checking shared memory size (#11502) c026ba3c23765a648ca27c7a15ecf179f8e27f26 7ee953a64a40c09438b2064539becdbc577cefd0 2025-02-07T04:26:03-06:00 Jeff Bolz vulkan: print shared memory size (#11719) 7ee953a64a40c09438b2064539becdbc577cefd0 ec3bc8270bc67b58955748d40a3e558a05b2d8f2 2025-02-07T04:33:27-05:00 Christian Fillion llama : add llama_sampler_init for safe usage of llama_sampler_free (#11727) 1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19 2fb3c32a1634488a5265d1304ab37628eeb5480d 2025-02-06T09:29:13-05:00 Patrick Peng rpc: fix known RCE in rpc-server (ggml/1103) 1b598b30581bad59e5af86c94362f9a30f261fac 902368a06b915b860236cfc97ff885b2aceae256 2025-02-06T00:02:18-06:00 Jeff Bolz vulkan: use smaller combined allocations to avoid fragmentation (#11551) c3db0480bb820e120249014b380e1f4badf2a1c1 d774ab3acc4fee41fbed6dbfc192b57d5f79f34b 2025-02-06T01:55:25+01:00 Matvey Soloviev readme : add link to Autopen under UIs (#11684) f117d84b48104992ba16961b35a96fa93efbb355 534c46b53c23613628d72e93c63ea01ea4d1e2ac 2025-02-04T19:15:24+08:00 Jhen-Jie Hong swift : fix llama-vocab api usage (#11645) 53debe6f3c9cca87e9520a83ee8c14d88977afa4 cfd74c86dbaa95ed30aa6b30e14d8801eb975d63 2025-02-01T18:22:38Z Olivier Chafik ci: use sccache on windows HIP jobs (#11553) aa6fb1321333fae8853d0cdc26bcb5d438e650a1 a83f528688324a21484a97af1d1be5e1bc8d4c8e 2025-01-31T17:12:40Z Olivier Chafik `ci`: use sccache on windows instead of ccache (#11545) 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f a2df2787b32e0846205f7151dfad88ceab592beb 2025-01-31T00:58:55-05:00 Steve Grubb common: Add missing va_end (#11529) 553f1e46e9e864514bbd6bf4009146db66be0541 8b576b6c55bc4e6be898b47522f0ef402b93ef62 2025-01-30T22:01:06Z Olivier Chafik `ci`: ccache for all github worfklows (#11516) 325afb370a1a7b32b5fe46a749bc840c66db9765 794fe23f29fb40104975c91fe19f23798f7c726e 2025-01-29T12:07:21+08:00 Molly Sophia llama: fix missing k_cache store for rwkv6qwen2 (#11445) cae9fb4361138b937464524eed907328731b81f6 7fee2889e6565830631fbe76d47ef85cf8fd946a 2025-01-28T07:42:20-08:00 Nikita Sarychev HIP: Only call rocblas_initialize on rocblas versions with the multiple instantation bug (#11080) 178a7eb952d211b8d4232d5e50ae1b64519172a9 6f53d8a6b41e48c73b345fc6c712c3b00ea4fb93 2025-01-26T20:06:16+02:00 Georgi Gerganov metal : use residency sets (#11427) 19f65187cbf009801288861133267ee5573ceead 1d8ee06000ecdd274e7f0a0465d6bf26ad2b3491 2025-01-26T12:07:48-04:00 bandoti cmake: add ggml find package (#11369) 4a75d19376f2f00dbae6c266eb9c4f3001872b52 26771a1491f3a4c3d5b99c4c267b81aca9a7dfa0 2025-01-25T15:29:57-06:00 Jeff Bolz vulkan: compile shaders on-demand (#11406) 564804b79b78df1469ec8646869972de5e885ec4 05f63cc9ee859de07f585f7b12939345f39ada8b 2025-01-23T14:51:24-06:00 Jeff Bolz tests: fix some mul_mat test gaps (#11375) 5245729e3317064959faefc5e5cbc63f4e9cfbea 6152129d05870cb38162c422c6ba80434e021e9f 2025-01-23T01:01:17-06:00 Jeff Bolz vulkan: fix diag_mask_inf (#11323) 6152129d05870cb38162c422c6ba80434e021e9f 16d3df7ab0bb9def78047eab4d9b15393997f495 2025-01-22T19:22:20+01:00 Diego Devesa main : update README documentation for batch size (#11353) 12c2bdf2de34f747d13b270fc9d3b52490bf194f c64d2becb13f2a7c0145b516a05f028d949a046b 2025-01-22T17:44:40+01:00 Diego Devesa server : fix draft context not being released (#11354) 3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b 6171c9d25820ccf676b243c172868819d882848f 2025-01-22T15:35:48+08:00 tc-mb llava : support Minicpm-omni (#11289) 6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016) 6da5bec81c34f3b8a8f1b367cf23ad016e83d332 2e2f8f093cd4fb6bbb87ba84f6b9684fa082f3fa 2025-01-21T15:06:41+02:00 Radoslav Gerganov rpc : better caching of the base buffer pointer (#11331) 99487b57d47e14dc342b7b89d238ca11c0345241 a1649cc13f89946322358f92ea268ae1b7b5096c 2025-01-19T14:33:34+01:00 Nicolò Scipione SYCL: Introducing memory host pool (#11251) 4dd34ff83165a483ebff7bd43621b28490fa1fd6 f30f099228f774209aa3010b78dfbe5d262e69aa 2025-01-18T16:18:15+02:00 Georgi Gerganov cmake : add sanitizer flags for llama.cpp (#11279) adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 2025-01-15T19:50:13Z Eve vulkan: scale caching for k quants + misc fixes (#11081) 7426a26b2492fc546a4db6991e871ee605714093 8f70fc3d1b1d3c17b61842330dd106d391cc1227 2025-01-13T14:46:36+02:00 Georgi Gerganov contrib : add naming guidelines (#11177) 2739a71e4b88474833b64aa974ca4515574fd3c4 ba8a1f9c5b675459c55a83e3f97f10df3a66c788 2025-01-11T05:50:33+01:00 Daniel Bevenius convert : sort print supported models [no ci] (#11179) ff3fcabc727b2dd0c477d23a258217b27cc639fb c3f9d25706ac84297067aeaa662c1f1af42ed443 2025-01-10T11:30:53+01:00 Daniel Bevenius convert : add --print-supported-models option (#11172) ee7136c6d1e0ba7633294dad137b1573048031ec c6860cc7346c90219475e4467bb8a288e0df975c 2025-01-10T09:58:08+08:00 Molly Sophia llama: add support for QRWKV6 model architecture (#11001) 8cef75c743ba13ebbd6d380c531200c768a8b8aa 0d52a69e4bf0d6181beec7853307bdcdeec9905b 2025-01-08T16:24:19+05:30 amritahs-ibm llamafile : ppc64le MMA INT8 implementation (#10912) 017cc5f446863316d05522a87f25ec48713a9492 a3d50bc022bedd6c7754c24749a1fef4d2d60c7c 2025-01-07T16:11:57+01:00 Diego Devesa ggml-backend : only offload from host buffers (fix) (#11124) a3d50bc022bedd6c7754c24749a1fef4d2d60c7c a4dd490069a66ae56b42127048f06757fc4de4f7 2025-01-07T12:38:05+01:00 Diego Devesa ggml-backend : only offload from host buffers (#11120) c0d6f790d07aa78be15584ec394ac20739ade93b dc7cef9f373f2a24b851f0df7a618c5209e593fa 2025-01-07T11:56:07+05:30 Akarshan Biswas SYCL: Use get_multi_ptr instead of deprecated get_pointer in wkv6 (#11087) dc7cef9f373f2a24b851f0df7a618c5209e593fa ecebbd292d741ac084cf248146b2cfb17002aa1d 2025-01-06T22:45:28Z Eric Curtin llama-run : fix context size (#11094) 6369f867a410416239d9f20ec27c2b1d6a9fee52 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 2025-01-06T10:28:17+01:00 Daniel Bevenius llama : rename missed batch params/vars to ubatch (#10059) 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 2025-01-06T10:55:18+02:00 Georgi Gerganov llama : update llama_model API names (#11063) 9394bbd484f802ce80d2858033583af3ef700d25 f922a9c542ee117550a168395c63ea79261f5c99 2025-01-04T21:06:11+01:00 fairydreaming llama : Add support for DeepSeek V3 (#11049) f922a9c542ee117550a168395c63ea79261f5c99 46be942214e295cd34660bbbd6b846155d1c36a0 2025-01-04T16:10:30Z matt23654 [GGML][RPC] Support for models with non-512-aligned tensors over RPC. (#11047) 4b0c638b9a68f577cb2066b638c9f622d91ee661 e7da954eccdf39ee795a6135bdb86f0978902681 2025-01-03T20:13:18+08:00 Molly Sophia common : disable KV cache shifting automatically for unsupported models (#11053) f66f5829276650cd83a087ab2cfed1a760183ea1 2f0ee84b9b02d2a98742308026f060ebdc2423f1 2025-01-03T10:18:53+02:00 Georgi Gerganov llama : refactor `src/llama.cpp` (#10902) 0da5d860266c6928b8c9408efbd264ae59fedda6 a45433ba209ee0b33d02c7dc4c31f29894ad83a6 2025-01-02T15:05:18+01:00 Xuan Son Nguyen server : allow using LoRA adapters per-request (#10994) 716bd6dec3e044e5c325386b5b0483392b24cefe c250ecb3157f3bae0a45f44c3c953b5414d4c2f7 2024-12-30T11:27:11-06:00 Jeff Bolz vulkan: optimize mul_mat for small values of N (#10991) c250ecb3157f3bae0a45f44c3c953b5414d4c2f7 a813badbbdf0d38705f249df7a0c99af5cdee678 2024-12-30T20:35:13+08:00 ag2s20150909 android : fix llama_batch free (#11014) 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 09fe2e76137dde850b13313f720e7ffa17efdefa 2024-12-24T18:54:49+01:00 Djip007 ggml : more perfo with llamafile tinyblas on x86_64 (#10714) 7024d59e6a572730626cb11896829d115043a1b1 7c0e28585843b366864b43b48f92425e2ea17df6 2024-12-22T16:20:11-08:00 yuri@FreeBSD ggml : fix run-time on FreeBSD in get_executable_path() (#10948) ebdee9478ca7ba65497b9b96f7457698c6ee5115 5cd85b5e008de2ec398d6596e240187d627561e3 2024-12-22T03:44:01-06:00 Jeff Bolz vulkan: build fixes for 32b (#10927) eb5c3dc64bd967f2e23c87d9dec195f45468de60 0ca416c91aea4549d9c77e3efeca403e15aa6c75 2024-12-20T21:01:28+05:30 Akarshan Biswas SYCL: Migrate away from deprecated ggml_tensor->backend (#10840) 0a11f8b7b5c39fdf6e91ef9674bc68ff08681af7 d408bb9268a988c5a60a5746d3a6430386e7604d 2024-12-20T17:44:58+08:00 Molly Sophia convert : fix RWKV v6 model conversion (#10913) d62b532c52e0118323277eaa5f442e11ce6505ed 081b29bd2a3d91e7772e3910ce223dd63b8d7d26 2024-12-17T17:24:22-05:00 DAN™ Use model->gguf_kv for loading the template instead of using the C API. (#10868) 130d0c90bd26b25e3a713b17a61a5d4eb0a66405 3919da8e335dbfd0741d239932a9b9e72061bf27 2024-12-14T03:23:08+01:00 Daniel Bevenius ggml : remove return from ggml_gallocr_allocate_node (ggml/1048) 160bc039c862c10b9938269a90ddb09d794a7b0d 08ea539df211e46bb4d0dd275e541cb591d5ebc8 2024-12-17T05:00:46+08:00 Zhiyuan Li rwkv6: add wkv6 support for Vulkan backend (#10829) 644fd71b44c4cdbfc6482fbf0353d289c3bc29e6 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 2024-12-16T12:31:14+02:00 Georgi Gerganov sampling : refactor + optimize penalties sampler (#10803) ba1cb19cdd0d92e012e0f6e009e0620f854b6afd 56eea0781cbd2608ed8ff524955495569b9264be 2024-12-14T20:43:46+08:00 HimariO llama : add Qwen2VL support + multimodal RoPE (#10361) a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) 83ed24a97b500ccdb32b90b94e6f9621ad8db79e d583cd03f663701858ba152a334cbb467fabe342 2024-12-13T12:12:15+05:30 Akarshan Biswas SYCL: Reduce most of the compiler warnings (#10748) 484d2f31aed34ff9f096e3961125762e81d9b7d6 4b4d92b0986e3b627b9a9ef4782973108bf47691 2024-12-11T22:48:04+09:00 kallewoof bug-fix: snprintf prints NULL in place of the last character (#10419) ae4b922614d452477cf5d2fb8cad247c9c12596c 750cb3e246f7e544124cf18cb0c5e0c8b7e38738 2024-12-10T12:23:50-05:00 Bartowski imatrix : Add imatrix to --no-context-shift (#10766) 26a8406ba9198eb6fdd8329fa717555b4f77f05f c37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b6 2024-12-09T20:07:12+01:00 Johannes Gäßler CUDA: fix shared memory access condition for mmv (#10740) 06d70147e6480c021e493c442ae0f0d83ae366de 43ed389a3f102517e6f7d5620d8e451e88afbf27 2024-12-08T19:19:19+01:00 stduhpf Vulkan: fix NaN in tanh.comp with AMD proprietary driver on Windows (#10723) 62e84d984875372f4b0fb89a67658e012ff0cc9f 3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 2024-12-07T16:12:27-05:00 Robert Collins llama : add 128k yarn context for Qwen (#10698) 19d8762ab61df8286367588a80b9c7db4cb568db c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 2024-12-07T13:37:50+01:00 Djip007 ggml : refactor online repacking (#10446) c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b 3df784b3050f657ea681f804187ce5bddb433e88 2024-12-07T11:52:44+02:00 Georgi Gerganov server : fix free of spec context and batch (#10651) 86a1934978ce5daffc7e5b4251f6540ee5e7b47b 784a14aa496a66cc43e76014a1bf4333b4a2a55a 2024-12-07T01:55:01-06:00 Robert Ormandi metal : Extend how Llama.cpp locates metal resources (#10676) 1da7b765692764a8b33b08da61cbee63812a7bd9 59f4db10883a4f3e855cffbf2c3ab68430e95272 2024-12-04T22:38:20+02:00 Georgi Gerganov server : fix speculative decoding with context shift (#10641) 82bca2257b3cec72676abb26011f1b99fcdab29d 0115df2f65ac7c64dd0e5915c72ecc4a9343a130 2024-12-03T12:50:08+02:00 Nikolaos Pothitos readme : add option, update default value, fix formatting (#10271) 0115df2f65ac7c64dd0e5915c72ecc4a9343a130 515d4e53727924e48774f45ecb15bdacbf851e13 2024-12-03T11:52:33+02:00 Georgi Gerganov metal : small-batch mat-mul kernels (#10581) 70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e 2024-12-03T11:20:00+02:00 Georgi Gerganov server : fix default draft model parameters (#10586) f095a649ec390e04dfab1b04e646ae8549dafaef 678d7994f4da0af3d29046be99950ac999ee9762 2024-11-29T00:18:02-06:00 Jeff Bolz vulkan: get the first command buffer submitted sooner (#10499) 46c69e0e752ff16206347bb12f96ed69f4a01abf 9e2301f4a4ef1690bd99360c11de43fe830b1c8d 2024-11-27T11:03:25+01:00 Diego Devesa ci : faster CUDA toolkit installation method and use ccache (#10537) 5b3466bedfa84aa29c6871c7254467550186ecc6 249a7902ec710c8d027b9cc0ed10219d2b4184f8 2024-11-27T01:30:27-06:00 Jeff Bolz vulkan: Handle GPUs with less shared memory (#10468) 71a64989a5d2e25c13507efada145f12cf358914 4a57d362e1948ada50af997a92c3cbff9711e78b 2024-11-27T01:08:54-06:00 Jeff Bolz vulkan: skip integer div/mod in get_offsets for batch_idx==0 (#10506) 45abe0f74ee281aea6e5283c1e738061256cfcae 0bbd2262a3263f37385297b30de37941836e57f7 2024-11-26T16:20:18+01:00 Xuan Son Nguyen server : replace behave with pytest (#10416) 0cc63754b831d3a6c37bc5d721d12ce9540ffe76 50d5cecbda3b0d03344eed326287adc1f6c7f3ef 2024-11-25T16:56:24-05:00 Eric Curtin Introduce llama-run (#10291) 47f931c8f9a26c072d71224bc8013cc66ea9e445 106964e3d266740f571b5aad7b57545b4a901ac9 2024-11-25T21:50:07+02:00 Georgi Gerganov server : enable cache_prompt by default (#10501) d9d54e498d38ec99bbc0031022f9c92711e97bbc cce5a9007572c6e9fa522296b77571d2e5071357 2024-11-25T09:58:41+02:00 Georgi Gerganov speculative : refactor and add a simpler example (#10362) cce5a9007572c6e9fa522296b77571d2e5071357 dc39012cbaf8752fabecaeb60af78ccdd1dfb73b 2024-11-24T18:03:25+02:00 Georgi Gerganov flake.lock: Update (#10470) 1bb30bf28cb5a7adf111bc41c935bdaf128397e7 87a533be57e602f8ca469d14ad15ee851265b655 2024-11-21T10:22:47+02:00 Georgi Gerganov llama : handle KV shift for recurrent models (#10402) 8fd4b7fa29c3061b2e02e897d818dfcbc593430a 1bacb9f62514b520bdf74ed6feb46c80508dad38 2024-11-20T01:40:18-06:00 Jeff Bolz vulkan: copy iq4_nl LUT into shared memory (#10409) 1bacb9f62514b520bdf74ed6feb46c80508dad38 ad21c9e1f14d82b8c15ae369a8839019e3d498b4 2024-11-20T01:11:00-06:00 Jeff Bolz vulkan: further optimize mul_mat_vec using larger loads (#10387) 8e752a777b272606f22cb741b03e062de4ddb8fe a88ad007de3eb5d92cb538fd269ff94c4bf0c8d2 2024-11-19T13:29:26+02:00 Georgi Gerganov llama : add check for KV cache shifts (#10401) b3e585988fc65d3a8083c6d94dfc0629f9ce226d 557924f22237c76387a39c4db5abae154d57e754 2024-11-19T01:25:17-06:00 Jeff Bolz vulkan: Optimize soft_max (#10301) 2eb76b2a5e4ea395b971a419c95b473ab6f253e4 9b75f03cd2ec9cc482084049d87a0f08f9f01517 2024-11-18T16:08:20+02:00 Georgi Gerganov flake.lock: Update (#10346) be5caccef945546ee9fd25a151330a88d785faf9 20a780c7b64c38071fe70ad23e16e80c23c0147b 2024-11-17T12:25:45+01:00 Diego Devesa llama : only use default buffer types for the KV cache (#10358) eda7e1d4f54711de1c9b40502d6c88bbc217da60 24203e9dd7355a4a10bc32d959fd0148d37bf666 2024-11-17T07:31:17+01:00 Diego Devesa ggml : fix possible buffer use after free in sched reserve (#9930) fb4a0ec0833c71cff5a1a367ba375447ce6106eb 5ea926dad7f62ebccff7b24784bd1e01a06d13ae 2024-11-13T20:00:35+02:00 Michael Podvitskiy llama : propagate the results of `graph_compute` (#9525) 2e82ffa4af29f87e7d3d6dff8060a2a79613b72f 80dd7ff22fd050fed58b552cc8001aaf968b7ebf 2024-11-13T09:40:57Z Alberto Cabrera Pérez sycl : Fixes to broken builds and test-backend-ops (#10257) 80dd7ff22fd050fed58b552cc8001aaf968b7ebf 54ef9cfc726a799e6f454ac22c4815d037716eda 2024-11-13T00:58:57-06:00 Jeff Bolz vulkan: Optimize contiguous copies (#10254) b141e5f6efbab3a00633df88c4f9425bfe8b78ab 4b3a9212b602be3d4e2e3ca26efd796cef13c55e 2024-11-11T08:38:43+02:00 Georgi Gerganov server : enable KV cache defrag by default (#10233) e89213492d3e01705739789733f0f2d250b4c449 8fc393f246c550d2481e53323a47644a94e8d01f 2024-11-09T12:47:50+05:30 amritahs-ibm ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156) 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 5c333e014059122245c318e7ed4ec27d1085573c 2024-11-07T18:19:10+11:00 Zhiyuan Li Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133) 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 1dc04b2deed2d2f2ae3aff9b14ae29674dee1fb8 2024-11-06T12:10:07+01:00 Diego Devesa metal : fix from ptr buffer name (#10189) a1eaf6a9600bb1608753420ba886a3b0a208ffc0 b8deef0ec0af5febac1d2cfd9119ff330ed0b762 2024-11-06T10:24:23+02:00 Georgi Gerganov metal : add quantized FA support (#10149) 401558b7ba7a08175c153cd3607230f63c8a528e 9e0ecfb697d297355e43c20559d29bcc71beb0c3 2024-11-04T17:34:08+01:00 Diego Devesa ggml : fix q4xx mat mul, increase ggml_aligned_malloc alignment (#10167) 329ed914c959c510d076fb06b43eeb3f7b804d6f ce027adfb3b131f0d2368294fc276bb0e342b3f6 2024-11-04T19:08:22+08:00 leo-pony CANN: adjust backend registry refactor. (#10158) 1926d6e39d6f6358bc1a4c52316a560178be7233 b634f8a26fef65210fd9fb2f87e83a2809535e89 2024-11-02T15:18:56+02:00 Georgi Gerganov llama : adjust default context size + print warnings (#10136) 418f5eef262cea07c2af4f45ee6a88d882221fcb ba6f62eb793d6617892d252f5c04d7685d908a38 2024-11-02T02:33:14+08:00 Shupei Fan vulkan : improve ggml_vk_create_buffer error handling (#9898) f221d56220899f38f0126e683b2432bc79d1e3f6 e597e50794f07ec8dc24b9efb18f94ec6386fda0 2024-11-01T10:23:05+02:00 Georgi Gerganov ggml : alloc ggml_contexts on the heap (whisper/2525) 85679d37f34f66783cc04664a06c405b28e8e035 1e9f94994ef908d964cf81069f03d9d3668beb7d 2024-11-01T00:49:53+01:00 Diego Devesa llama : improve output buffer type selection (#10098) c02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce7 ab3d71f97f5b2915a229099777af00d3eada1d24 2024-10-31T22:54:23+01:00 Diego Devesa llama : fix buffer checks for mamba and rwk (#10111) b9e02e8184f5e6094a9e87eaf040becd404bfc90 6763f713bb692910e9b2d9d1a82d6959cee2dcf3 2024-10-30T14:51:21+01:00 Diego Devesa ggml : fix memory leaks when loading invalid gguf files (#10094) 8d8ff715367480b856ad86ac3888e9742b13a6fa 61715d5cc83a28181df6a641846e4f6a740f3c74 2024-10-29T10:42:05+02:00 Georgi Gerganov llama : remove Tail-Free sampling (#10071) 8125e6cbfcf2b3b9066e4d923aca9295526730f5 8841ce3f439de6e770f70319b7e08b6613197ea7 2024-10-28T08:49:32+02:00 Georgi Gerganov server : don't overfill the batch during infill (#10018) bc5ba007b2c83ac95875e68724dabfc12159fc61 958367bf530d943a902afa1ce1c342476098576b 2024-10-25T10:13:46+03:00 Georgi Gerganov server : check that the prompt fits in the slot's context (#10030) 167a515651a4b065a16225ffc69564c5674f3d0f c39665f589091903396a442a6ee56613303e0350 2024-10-24T14:40:23+02:00 Johannes Gäßler CUDA: fix insufficient buffer clearing for MMQ (#10032) c19af0acb1fe6d0fdbecadd8483c1fbe5d68d095 ac113a0feee0935b2018312f7bc8d7a646b117ed 2024-10-16T20:10:01+02:00 Daniel Bevenius ggml : remove redundant set of contexts used field (ggml/978) ac113a0feee0935b2018312f7bc8d7a646b117ed 4c9388fb96ac2415fbb1239b7ba8346616606e2e 2024-10-23T07:09:26-04:00 Michael Coppola llama.vim : add classic vim support (#9995) c8c07d658a6cefc5a50cfdf6be7d726503612303 19d900a7565b8f6b0a708836a57d26966cb9efe2 2024-10-22T16:59:02+02:00 Xuan Son Nguyen llama : fix empty batch causing llama_batch_allocr to crash (#9966) 19d900a7565b8f6b0a708836a57d26966cb9efe2 11d47057a51f3d9b9231e6b57d0ca36020c0ee99 2024-10-22T15:31:06+02:00 Daniel Bevenius llama : rename batch to ubatch (#9950) 11d47057a51f3d9b9231e6b57d0ca36020c0ee99 c421ac072d46172ab18924e1e8be53680b54ed3b 2024-10-22T21:22:26+08:00 Molly Sophia Rwkv chat template fix (#10001) 4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4 6b8447352df3d662b56280c8fc38d7f092885787 2024-10-22T18:33:37+08:00 Molly Sophia llama : add chat template for RWKV-World + fix EOT (#9968) bc219750845a59166d79f0d4ee3da1993b369b8a 1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31 2024-10-21T09:37:12+03:00 Georgi Gerganov speculative : fix handling of some input params (#9963) cda0e4b648dde8fac162b3430b14a99597d3d74f afd9909a6481402844aecefa8a8908afdd7f52f1 2024-10-18T23:18:01+02:00 Xuan Son Nguyen llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745) 60ce97c9d809f4b040e90b597468b839df5728d0 8901755ba328643c9ab071c20e1939ea52951a0e 2024-10-18T13:34:36+08:00 Ma Mingfei add amx kernel for gemm (#8998) 6f55bccbb8835d42147add4ee48807450f5ff535 17bb9280807cfbb6611b853aa1ef05114bd9efe9 2024-10-18T01:41:51+02:00 Daniel Bevenius llama : rename batch_all to batch (#8881) 17bb9280807cfbb6611b853aa1ef05114bd9efe9 9f45fc1e9950a496febc575cdd196cd5cad000cc 2024-10-17T23:43:05+03:00 Georgi Gerganov readme : remove --memory-f32 references (#9925) 21942002780352b4a54f4bd3e5eefa3bc7f14fe6 73afe681aa76e818733fc1f30de082c1d6910bcd 2024-10-17T02:34:22+03:00 Gilad S. fix: allocating CPU buffer with size `0` (#9917) 73afe681aa76e818733fc1f30de082c1d6910bcd 9e041024481f6b249ab8918e18b9477f873b5a5e 2024-10-17T01:36:51+03:00 Gilad S. fix: use `vm_allocate` to allocate CPU backend buffer on macOS (#9875) cd60b88bf7ad7785fb6ac9864e360cf10e42faad becfd387f6919d99ec34b76c2522f90ac250c489 2024-10-09T16:40:35+02:00 Daniel Bevenius ggml-alloc : remove buffer_id from leaf_alloc (ggml/987) 223c25a72fcc3f65cdfd7f5d57edd5b44b550e18 fbc98b748e7b075e327bcf13237057f647678049 2024-10-15T16:28:55+03:00 Georgi Gerganov server : improve infill context reuse (#9894) d4c19c0f5cdb1e512573e8c86c79e8d0238c73c4 c7181bd294757dd80a7904e3dd0fea2d0be914e7 2024-10-13T21:31:35+03:00 Georgi Gerganov server : accept extra_context for the infill endpoint (#9874) c7181bd294757dd80a7904e3dd0fea2d0be914e7 92be9f12164f18ce845a5bab60cefa5f7fec6836 2024-10-13T18:52:48+03:00 Georgi Gerganov server : reuse cached context chunks (#9866) 1bde94dd024b632f98428f4bf2ce483295130779 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 2024-10-12T16:06:31+03:00 Georgi Gerganov server : remove self-extend features (#9860) 11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798) 6374743747b14db4eb73ce82ae449a2978bc3b47 f1af42fa8c925096407c61ff0a3d5d5d669cc535 2024-10-07T21:55:08+02:00 Diego Devesa ggml : add backend registry / device interfaces to BLAS backend (#9752) 6279dac039ddeb6d5ebd125a6274fd3c37a77ba8 d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 2024-10-07T19:35:42+03:00 Georgi Gerganov flake.lock: Update (#9753) d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 96b69121033d2b6b951d1b6b1b43f8b4f97dac99 2024-10-07T18:27:51+03:00 Georgi Gerganov ggml : add metal backend registry / device (#9713) 96b69121033d2b6b951d1b6b1b43f8b4f97dac99 d5cb86844f26f600c48bf3643738ea68138f961d 2024-10-07T13:26:31+01:00 Paul Tsochantaris metal : single allocation of encode_async block (#9747) b0915d5b51cbaa982ce9bbb9ce302bb9abdca0eb 8c475b97b8ba7d678d4c9904b1161bd8811a9b44 2024-10-06T08:34:20+01:00 SRHMorris vulkan : retry allocation with fallback flags (whisper/2451) 905f5485b279518d30b402565c23fb153f822c0d 71967c2a6d30da9f61580d3e2d4cb00e0223b6fa 2024-10-05T14:33:54+03:00 Georgi Gerganov metal : zero-init buffer contexts (whisper/0) 55951c018d7c107b6ef0a4c8561a6e68183d19d9 ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee 2024-10-04T15:46:18+02:00 Daniel Bevenius ggml : fix typo in example usage ggml_gallocr_new (ggml/984) ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee f3fdcfaa79afa12047def3a8793d4a566e0532d4 2024-10-04T08:41:40+02:00 Diego Devesa ggml : fixes after sync (ggml/983) d6fe7abf04e8ec5240dead6e2773ed1b7e7495d3 e3c355ba654d4164c1c09e5d0dcacecb8b214af8 2024-10-03T12:39:03-03:00 bandoti ggml: unify backend logging mechanism (#9709) cb00020504416606601f8cb35f55ee07b710b4b7 6c5322481a75f1be54e58a000c3f78484d07f948 2024-09-30T09:14:09+02:00 Salvatore Mesoraca vulkan : mul_mat: fix UB with small warps (ggml/952) 7254cdf7e8d6312840509ca8d766358c687c6266 cad341d88924788b940997c55e7bef000c99e784 2024-09-29T23:18:02+02:00 Johannes Gäßler ggml: fix gradient allocation logic (ggml/966) faac0bae265449fd988c57bf894018edc36fbe1e f99d3f8367174f7aba73c07fd87de687d4a0ece1 2024-09-29T05:25:00-07:00 matiaslin common : ensure llama_batch size does not exceed max size (#9668) 89f9944981010d195e411a9fbfbb19959412f710 b5de3b74a595cbfefab7eeb5a567425c6a9690cf 2024-09-28T12:05:05+02:00 Markus Tavenrath Enable use to the rebar feature to upload buffers to the device. (#9251) afbbfaa537a96f562c34df4542930fa951b40d9e 3d6bf6919f7b10726421779cd344f2da05421c68 2024-09-25T14:05:13+02:00 Xuan Son Nguyen server : add more env vars, improve gen-docs (#9635) 116efee0eef09d8c3c4c60b52fa01b56ddeb432c 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 2024-09-24T03:14:24+03:00 Ivan cuda: add q8_0->f32 cpy operation (#9571) 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607) f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598) c35e586ea57221844442c65a1172498c54971cb0 912c331d3dba3a079815844208dc36164baa8cc7 2024-09-22T22:55:49+08:00 R0CKSTAR musa: enable building fat binaries, enable unified memory, and disable Flash Attention on QY1 (MTT S80) (#9526) ecd5d6b65be08927e62de1587d5fd22778cdc250 2a63caaa69fad6c2afddc47bae052cf2afb01529 2024-09-21T19:30:34-07:00 Shankar llama: remove redundant loop when constructing ubatch (#9574) 2a63caaa69fad6c2afddc47bae052cf2afb01529 d09770cae71b416c032ec143dda530f7413c4038 2024-09-22T10:29:12+08:00 Molly Sophia RWKV v6: RWKV_WKV op CUDA implementation (#9454) d09770cae71b416c032ec143dda530f7413c4038 41f477879fd5ccc31211634292e8e293ec700e85 2024-09-21T14:24:23+02:00 slaren ggml-alloc : fix list of allocated tensors with GGML_ALLOCATOR_DEBUG (#9573) 424c5d00a9b97dd5559635872db9b57f87c23b02 a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 2024-09-20T19:04:44+03:00 Johannes Gäßler ggml/examples: add backend support for numerical optimization (ggml/949) faf67b3de4688f47c3b1019c89df255df2fd59b4 7be099fa817e9c53ffb4c3ed7d063e1cffcd675a 2024-09-18T08:30:31+08:00 Neo Zhang Jianyu [SYCL]set context default value to avoid memory issue, update guide (#9476) 0226613853133c081b55bb892a41bb5eacc0bc94 503147a9f9d195d6a14e7c998df23b6eb61f2bae 2024-09-17T01:19:46-07:00 Max Krasnyansky threadpool : skip polling for unused threads (#9461) acb2c32c336ce60d765bb189563cc216e57e9fc2 a6a3a5c531c73aef85750a847d21e7d4671e723d 2024-09-16T13:07:13+02:00 Daniel Bevenius llama : rename n_embed to n_embd in rwkv6_time_mix (#9504) 441b72b91f818fe69497e5816f87969e90c73c43 c4965a64f72ac9434c21cf0e1c3421d13e889155 2024-09-16T01:20:01-05:00 Vinesh Janarthanan main : option to disable context shift (#9484) c4965a64f72ac9434c21cf0e1c3421d13e889155 90a2fff0e7f80c6fea3fc6cf9a7b482744f3f164 2024-09-16T09:05:56+03:00 Georgi Gerganov metal : handle zero-sized allocs (#9466) e6b7801bd189d102d901d3e72035611a25456ef1 e665744317c77fc3483fc5224fe6d586b5166b33 2024-09-12T19:46:43+08:00 Dou Xinpeng cann: Add host buffer type for Ascend NPU (#9406) 39f852f44039b058fdd0611ee127c6efa7ba4a04 2b00fa799773cc75d53b841c03d21d7468a1e3a1 2024-09-12T19:25:16+08:00 Molly Sophia py : add special tokens in hf_converter for RWKV v6 (#9428) d2b496bff4f353a6429f8e833448f071bd237ba7 b34e02348064c2f0cef1f89b44d9bee4eb15b9e7 2024-09-11T10:03:54+03:00 Georgi Gerganov batched-bench : remove unused code (#9305) 83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1 0b4ac75772b744bb0a0d674927587621d1057884 2024-09-10T09:03:21+02:00 Daniel Bevenius llama : update llm_build_copy_mask_state comment [no ci] (#9385) 0b4ac75772b744bb0a0d674927587621d1057884 fb3f2498156b3140e2050ec9c7bf61372f63ff56 2024-09-10T15:02:30+08:00 Molly Sophia RWKV v6: Add time_mix_decay_w1/w2 in quant exclusion list (#9387) 293bebe0773c907c0c866213856eeba41b035df1 5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2 2024-09-09T18:40:10+03:00 Radoslav Gerganov rpc : fix segfault with nkvo (#9389) daa9623ab051a8162ae750b150b9522571b55f21 e079bffb6678e1b5ded21c719600bedd7175e726 2024-09-08T21:43:48+02:00 Markus Tavenrath Overlap cmdbuffer creation and cmdbuffer execution in Vulkan backend by submitting smaller cmdbuffers early. (#9118) 2a358fb0c4b6e917ac852aa17444cc94dd28a2a6 eae597182cb61bbde0b26e7cec5999d28b9327fe 2024-09-08T19:05:29+08:00 Neo Zhang Jianyu [SYCL] add check malloc result on device (#9346) 60a3107ccd791d858e12a87e6024ce918d3bf595 406c1a32a18807b9b5711aa2fa1859527106bc1d 2024-09-08T09:38:42+03:00 Georgi Gerganov scripts : option to increase git patch context 406c1a32a18807b9b5711aa2fa1859527106bc1d 9cb9260861e464e40d38764cfb021856786c7202 2024-09-06T14:34:25+02:00 Salvatore Mesoraca vulkan: add dryrun support to sin and cos ops (ggml/947) f12295b8a9336962bf02a359beb1be0d322b4be7 faf69d4237c9ae4d7f572b4674d1002463e8acd3 2024-09-08T00:33:33+03:00 Georgi Gerganov llama : fix empty ring buffer push (#9358) faf69d4237c9ae4d7f572b4674d1002463e8acd3 e536426ded3fb4a8cd13626e53508cd92928d6c2 2024-09-08T00:33:13+03:00 Georgi Gerganov llama : sanitize invalid tokens (#9357) e536426ded3fb4a8cd13626e53508cd92928d6c2 1b9ae5189cd279c6b45e36d43e4f9ccae628d02f 2024-09-07T19:02:26Z Eve llamafile : disable sgemm for batch-size 1 (#9330) 815b1fb20a53e439882171757825bacb1350de04 409dc4f8bb5185786087f52259ee4626be93f54d 2024-09-06T18:59:58+03:00 Aarni Koskela batched-bench : add `--output-format jsonl` option (#9293) 4db04784f96757d74f74c8c110c2a00d55e33514 bdf314f38a2c90e18285f7d7067e8d736a14000a 2024-09-05T11:13:11+02:00 slaren cuda : fix defrag with quantized KV (#9319) f1485161e58d562099dd050f8ac3a9ea9f4cd765 048de848ee4baad4531fcd6239438f5d55be365c 2024-09-03T01:53:23+08:00 Zhenwei Jin src: make tail invalid when kv cell is intersection for mamba (#9249) f771d064a95d212ddadea452ad0cc1e42b2c3db3 6e7d133a5f9409dd257fad90d7f320721b07a1b2 2024-09-02T08:25:30-07:00 yuri@FreeBSD ggml : add pthread includes on FreeBSD (#9258) 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980) 42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672) a77feb5d71831c61e455541e8a655b9f0337ea8c 2e59d61c1b321431c597c1f12249273427d5640d 2024-08-27T11:07:01+02:00 Xuan Son Nguyen server : add some missing env variables (#9116) 06658ad7c37f440502de2b9486ce43c47b4ec710 fc18425b6a8ad03847383ce2b69d52edfd49b0ff 2024-08-26T18:31:02+03:00 Georgi Gerganov metal : separate scale and mask from QKT in FA kernel (#9189) a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526) 4b9afbbe9037f8a2d659097c0c7d9fce32c6494c 37501d9c79ed5897db4b73ea7502211d25b3f763 2024-08-15T15:40:12+08:00 gtygo retrieval : fix memory leak in retrieval query handling (#8955) 5fd89a70ead34d1a17015ddecad05aaa2490ca46 98a532d474c73d3494a5353024cb6a4fbbabbb35 2024-08-14T18:32:53+02:00 0cc4m Vulkan Optimizations and Fixes (#8959) 98a532d474c73d3494a5353024cb6a4fbbabbb35 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 2024-08-14T02:51:02-04:00 compilade server : fix segfault on long system prompt (#8987) 84eb2f4fad28ceadd415a4e775320c983f4d9a7d 1262e7ed13ac197c944f15e1ddb083cb4f36cf65 2024-08-12T20:45:50+08:00 Frank Mai docs: introduce gpustack and gguf-parser (#8873) 7c5bfd57f83fd3630934cfa70892aa4022d3faf7 6e02327e8b7837358e0406bf90a4632e18e27846 2024-08-11T10:09:09+02:00 Markus Tavenrath Optimize Vulkan backend for better CPU performance and less GPU synchronization overhead. (#8943) 70c0ea35609a2ab87a358e25f4ffad1aad408992 5b2c04f4925e152c362b824f4b41eb2a081fa623 2024-07-16T03:21:09-04:00 Matt Stephenson whisper : use vulkan as gpu backend when available (whisper/2302) 345a686d8271a24db20d31789c0d4b9ed51dcb0c 3a14e00366399040a139c67dd5951177a8cb5695 2024-08-08T23:54:00-04:00 compilade llama : reduce useless copies when saving session (#8916) c21a896405de4cdf4207eb8130555ceaac0ab110 d4ff847153e9cf7220d1b39aa21172069e6e8cea 2024-08-06T12:42:42+08:00 Mengqing Cao [CANN]: Fix ggml_backend_cann_buffer_get_tensor (#8871) 0a4ce786814b123096d18aadca89cd352b9e590b bc0f887e159c0d78c28121e2c8b5c58094170875 2024-08-06T00:14:10+08:00 Liu Jia common : Changed tuple to struct (TODO fix) (#8823) bc0f887e159c0d78c28121e2c8b5c58094170875 b42978e7e4d56eaaa93588414e804d9fbbc3cae2 2024-08-05T21:10:37+08:00 wangshuai09 cann: fix buffer_num and runtime speed slowly error (#8865) a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904) ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839) afbb4c1322a747d2a7b4bf67c868148f8afcc6c8 b7a08fd5e0e7c898c68d1743066ea495202d9608 2024-08-01T23:28:28+02:00 matteo ggml-cuda: Adding support for unified memory (#8035) 7e72aa74fd676a093eb9970e761085ec22734c71 7c27a19b2eb91bb0f43c7f7aec0386cec2dddc33 2024-07-31T00:57:03+10:00 Brian py: add_array() will not add to kv store if value is an empty array (#8774) 4c676c85e59ef8f771f3a129e6eb217552139231 e54c35e4fb5777c76316a50671640e6e144c9538 2024-07-28T00:42:05-04:00 compilade llama : refactor session file management (#8699) 203b7f1531303a060730ec1d1e01920e70302398 d2b851bfa131478665315bc5c7c707506c14d703 2024-07-20T20:49:44+02:00 Tony Wasserka vulkan : initialize vk_buffer_struct members to VK_NULL_HANDLE (ggml/893) b5e95468b1676e1e5c9d80d1eeeb26f542a38f42 92090eca212650727e38b335c1d4accfbcc9b79c 2024-07-27T05:03:45-07:00 Jeffrey Morgan llama : add support for llama 3.1 rope scaling factors (#8676) 49ce0ab6d45402e8bb622bf86f86529f2b0ba552 4226a8d10e3904db3a1297919fe6c7f06beba6c0 2024-07-25T22:23:05+01:00 DavidKorczynski ggml: handle ggml_init failure to fix NULL pointer deref (#8692) 328884f4219c0228673cf1870ac63987fb4f9fd0 c69c63039cd75f8f33f253ab7485d82a8b4cd403 2024-07-20T21:58:49-04:00 compilade gguf-py : fix some metadata name extraction edge cases (#8591) c3776cacabce2ee35f172fb72be7a519752125fa 87e397d00bdcedd5cbf6dfda06a7b0f302462728 2024-07-20T17:35:25+10:00 Brian gguf_dump.py: fix markddown kv array print (#8588) 3d0e4367d99087892e355ddbeebd232a0b2f40de a15ef8f8a08e12f9c5162c221e67779e71182073 2024-07-19T17:51:51+10:00 Brian convert-*.py: add general.name kv override (#8571) 672a6f101839a150180fc28891ebed379c8f2353 3807c3de04cde853418033c95e96642876545f3e 2024-07-18T20:40:15+10:00 Brian convert-*.py: GGUF Naming Convention Refactor and Metadata Override Refactor (#7499) da3913d8f9475b0d4bcbeb4936c724af4eade092 d65a8361fed8be97389776fb94217e937ec6b03c 2024-07-17T16:34:28+09:00 Masaya, Kato batched: fix n_predict parameter (#8527) d65a8361fed8be97389776fb94217e937ec6b03c 5e116e8dd51775f8f1c090570be148d5d7eea6c3 2024-07-17T10:32:59+03:00 Georgi Gerganov llama : disable context-shift for DeepSeek v2 (#8501) 7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc 97bdd26eee11fe109dec00de75690ceef61c03f2 2024-07-15T23:13:10-04:00 compilade convert_hf : faster lazy safetensors (#8482) 97bdd26eee11fe109dec00de75690ceef61c03f2 4db8f60fe79a391e82b0464013ada123baced96a 2024-07-15T20:50:47+02:00 Xuan Son Nguyen Refactor lora adapter support (#8332) 9104bc20edf47f74dc49379b7d61d0c6e85a4882 fc690b018e459012cd82c37f1343e9bb658987d1 2024-07-15T14:54:58+03:00 Georgi Gerganov common : add --no-cont-batching arg (#6358) fa79495bb4897953a75607addd9d2cdd2ec63222 17eb6aa8a992cda37ee65cf848d9289bd6cad860 2024-07-13T23:35:10-04:00 compilade llama : fix pre-tokenization of non-special added tokens (#8228) c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420) 808aba39161e5d7ca2ff24110b5aa14d2e536988 a977c115448e40856fb9cbe3ceb6d8ce802553b0 2024-07-11T16:47:47+02:00 Johannes Gäßler CUDA: optimize and refactor MMQ (#8416) 278d0e18469aacf505be18ce790a63c7cc31be26 dd07a123b79f9bd9e8a4ba0447427b3083e9347a 2024-07-10T20:08:17-04:00 Clint Herron Initialize default slot sampling parameters from the global context. (#8418) 0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) a59f8fdc85e1119d470d8766e29617962549d993 fd560fe680c72fd0a0af2bc8881add20ad919071 2024-07-09T18:26:40-04:00 Clint Herron Server: Enable setting default sampling parameters via command-line (#8402) a03e8dd99d3954e7547137936c5a2a3b348bdb7f 5b0b8d8cfb5ddf2118f686ba6c30fab3f71b384b 2024-07-09T17:11:07+02:00 Johannes Gäßler make/cmake: LLAMA_NO_CCACHE -> GGML_NO_CCACHE (#8392) 470939d483d1c89b7292f78bac1fd27c42c171ce 6f0dbf6ab087bcd286fb78560099ca0458316735 2024-07-08T03:26:53-04:00 Kevin Wang common : preallocate sampling token data vector (#8363) 3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d a8db2a9ce64cd4417f6a312ab61858f17f0f8584 2024-07-07T15:04:39-04:00 compilade py : type-check all Python scripts with Pyright (#8341) f7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c 905942abdba5ba0b28a1b0805e51e4f818c54bc9 2024-07-07T22:58:43+10:00 Brian gguf-hash: model wide and per tensor hashing using xxhash and sha1 (#8048) cb4d86c4d723af87d3d7e3177e9485f200391384 86e7299ef5dff0f388922dc6fcbce009e99d8005 2024-07-07T11:10:38+02:00 Bjarke Viksøe server: Retrieve prompt template in /props (#8337) 87e25a1d1bd26eb06d1cab9e2ee4e14a7a0be33c 213701b51a17175d0d326b566efc03f30ec7fbe6 2024-07-06T09:22:16+02:00 Daniel Bevenius llama : add early return for empty range (#8327) 1f3e1b66e21310ed78b964f72f19766549633f0e 148ec970b62c3c5ae0a8bfdaad2fc237aaae350d 2024-07-05T13:23:25+01:00 Ouadie EL FAROUKI Enabled more data types for oneMKL gemm_batch (#8236) f09b7cb609d80b8031803f89255991dc8b35db69 a38b884c6c4b0c256583acfaaabdf556c62fabea 2024-07-05T10:32:29+08:00 Neo Zhang Jianyu rm get_work_group_size() by local cache for performance (#8286) 1e920018d38aee270a044cc48eaefe7c64cb8750 01a5f06550a866bd63717635e5e7e1ff4203b873 2024-07-03T01:02:56+05:30 ditsuke doc: Add context for why we add an explicit pytorch source 807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763) d08c20eddedb24515a3212e2de66bdff41a26b8c 5fac350b9cc49d0446fc291b9c4ad53666c77591 2024-07-02T02:16:00Z luoyu-intel [SYCL] Fix the sub group size of Intel (#8106) 97877eb10bd8e7f8023420b5b5300bcbdadd62dc 387952651a8fc493f8c85ea4c9774bd4a5694f87 2024-06-27T15:48:07+01:00 jukofyork Control vector loading fixes (#8137) c8771ab5f89387cdd7d9a8a69280dac46b45e02f 494165f3b6c4cbcd793123cb57fb3e1f5477f1db 2024-06-26T08:28:02+02:00 Johannes Gäßler CUDA: fix misaligned shared memory read (#8123) 3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950) 083bacce14c1aaf9976aa40e8266cdc25ac749d3 2df373ac40ea581ccca8a58c713f03ad9d4b658d 2024-06-25T10:19:20+08:00 Meng, Hengyu [SYCL] Re-enabled mul_mat_batched_sycl (#8095) 52fc8705a0617452df08333e1161838726c322b4 8cb508d0d5c024e12692370d85237b45469a004b 2024-06-24T05:42:03-04:00 Christian Zhou-Zheng Option to split during conversion (#6942) e112b610a1a75cb7fa8351e1a933e2e7a755a5ce 6a2f298bd784403c5c33eebb822217ec5d9b5590 2024-06-24T02:27:57+08:00 Eddie-Wang llama : add support for BitnetForCausalLM (#7931) 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc b5a5f34efadec8d8f0057b35cb04742abfeb2ef5 2024-06-23T10:21:25+02:00 0cc4m Refactor Vulkan backend to allow multiple contexts (#7961) 80ea089d771f0c2d97afa8bead80ded412f600d7 0e64591e8290037db6412665a56354b789a0597e 2024-06-21T00:38:22-05:00 Douglas Hanley llama : allow pooled embeddings on any model (#7477) d50f8897a797a5a03f31228d1b5a7b8130ee1bc2 2075a66a96cc1b04eabec7cf4b3051193d6f719e 2024-06-20T14:39:21+02:00 Johannes Gäßler CUDA: stream-k decomposition for MMQ (#8018) 37bef8943312d91183ff06d8f1214082a17344a5 91c188d6c296bd3384f2a02a83b71187aa3d18b3 2024-06-18T18:40:52+02:00 jaime-m-p tokenizer : BPE fixes (#7530) e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084 a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f 2024-06-18T09:37:20+03:00 Georgi Gerganov whisper : use ggml_backend_sched (whisper/2239) a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f 5b6da187508f49a9fa9d95fa22ae804a0780d256 2024-06-17T22:08:46+03:00 Ștefan-Gabriel Muscalu update: support Qwen2-57B-A14B (#7835) 7c26775adb579e92b59c82e8084c07a1d0f75e9c b473e95084c286780165568cf0f385f21141d68d 2024-06-17T19:40:01+03:00 Georgi Gerganov llama : disable FA if KV head size do not match (#7982) 6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 2024-06-17T16:10:15+02:00 Markus Tavenrath Implement non-mapped async IO for CUDA on Windows. (#7896) 7c7836d9d4062d6858e3fb337b135c417ccee6ce 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 2024-06-16T07:17:31+02:00 0cc4m Vulkan Shader Refactor, Memory Debugging Option (#7947) 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514) 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 f8ec8877b75774fc6c47559d529dac423877bcad 2024-06-15T14:05:10+08:00 Meng, Hengyu [SYCL] remove global variables (#7710) 66ef1ceedf983773c8ceb4d925285d41d4e50e2a e65bbf606c61f49dc06c7ac060cd5ba7ae446025 2024-06-14T17:14:09+03:00 Georgi Gerganov metal : utilize max shared memory for mul_mat_id (#7935) f578b86b2123d0f92afbaa98a031df4d4464e582 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 2024-06-13T03:11:35+02:00 slaren move BLAS to a separate backend (#6210) ef52d1d16afc695d798396cdd13594ea5e45a9dd 14f83526cd27f638c856ea6eff08110b9860eb2a 2024-06-11T21:20:29+02:00 0cc4m Update Vulkan RoPE implementation (#7818) af4ae502ddaeb03cd5861273ca2e9a5ae4551db7 10ceba354a3b152ff425e9fa97f9caaef99a46b1 2024-06-10T02:21:31-07:00 Ben Ashbaugh use the correct SYCL context for host USM allocations (#7777) d4d915d351d1f1270d56184bdd46672893e8a5d8 7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f 2024-06-08T20:21:08+01:00 Olivier Chafik url: save -mu downloads to new cache location (#7826) da799b41891e34aac86ce4e173f9c4c0afd4fab3 c00fad71e507ff386d42bd74846fe06d19dd63a4 2024-06-07T19:47:49+02:00 slaren vulkan : reuse parent extra for views (#7806) 7027b27d765db95d4ac6b569d976e387a8715881 a5cabd76491f07494c5b8267f921c73f5e2bbfb4 2024-06-07T11:15:49+02:00 Johannes Gäßler server: update cache_prompt documentation [no ci] (#7745) 2b3389677a833cee0880226533a1768b1a9508d2 9973e81c5ccf4f31b3980f5aa73f5cfea8699860 2024-06-05T11:29:20+03:00 Georgi Gerganov ggml : refactor rope norm/neox (#7634) 1442677f92e45a475be7b4d056e3633d1d6f813b 554c247caffed64465f372661f2826640cb10430 2024-06-04T21:23:39+03:00 Georgi Gerganov common : refactor cli arg parsing (#7675) bde7cd3cd949c1a85d3a199498ac98e78039d46f a5735e4426b19a3ebd0c653ad8ac01420458ee95 2024-06-03T20:03:26+03:00 Radoslav Gerganov llama : offload to RPC in addition to other backends (#7640) 549279d8049d78620a2b081e26edb654f83c3bbd 9e405b6e2ecb888e860f7b92720b4809e21b3915 2024-06-03T08:34:43+03:00 Georgi Gerganov llama : avoid double token-to-piece cache (#7654) 3413ae2193d0693f14bead02e5018f442cbf579b 1669810d7c2446af8425aa54ff6611bf6f14646c 2024-06-03T07:59:54+10:00 Dave Airlie fix bug introduced in using calloc (#7701) 2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) 750f60c03e4d3f53fa51910551ce87a3d508d2d7 9b596417af11c9ac44fcae0fcfbc6f3665089083 2024-06-01T15:47:04+02:00 Johannes Gäßler CUDA: fix Pascal FA, deq. KV to FP16 for batch > 8 (#7681) 9b596417af11c9ac44fcae0fcfbc6f3665089083 a323ec60af14a33d560df98f2cc41b4112cb4f80 2024-06-01T08:44:14+02:00 Johannes Gäßler CUDA: quantized KV support for FA vec (#7527) 5921b8f089d3b7bda86aac5a66825df6a6c10603 5dcdf946764fae49a8e2a90bf2f0960bde1c44e8 2024-05-30T19:01:41+03:00 Georgi Gerganov llama : cache llama_token_to_piece (#7587) 02c1ecad07f0e2d2febe8196271bcc64bdc9c006 6bd12ce409f949012935b7d1b15a21ffa473a565 2024-05-28T21:46:34+02:00 jaime-m-p Tokenizer WPM fixes (#7500) ee3dff6b8e39bb8c1cdea1782a7b95ef0118f970 edc29433fa08b4e5aeb67649a29fc7713af13d04 2024-05-28T17:07:05+02:00 fairydreaming Add support for DeepseekV2ForCausalLM (#7519) b9adcbbf92fc7096bee23fe61496d25652ebf765 9588f196b1d7b21bdff013fcf958c249576b2619 2024-05-26T06:26:34+05:30 HanishKVC SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480) 902184dd3a9d6685e752b19027a48423742531db 57684331fc2d685f7d1f5775af0b9e47d1829833 2024-05-25T05:30:59+02:00 Xuan Son Nguyen fix missing slash in `fs_get_cache_directory()` (#7503) 3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464) 9b82476ee9e73065a759f8bcc4cf27ec7ab2ed8c a61a94e543e3c6877c087e80fca27a0313ce5fd5 2024-05-23T11:49:53+02:00 fairydreaming Add missing inference support for GPTNeoXForCausalLM (Pythia and GPT-NeoX base models) (#7461) a61a94e543e3c6877c087e80fca27a0313ce5fd5 152da28ae54139e3754189b9e6e1c28e11277502 2024-05-23T12:38:18+03:00 Georgi Gerganov llama : rename n_ctx -> cache.size, less confusing (#0) 1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) 201cc11afa0a1950e1f632390b2ac6c937a0d8f0 6369bf04336ab60e5c892dd77a3246df91015147 2024-05-22T04:28:32+08:00 liuwei-git llama : add phi3 128K model support (#7225) 11474e756de3f56b760986e73086d40e787e52f8 d8ee90222791afff2ab666ded4cb6195fd94cced 2024-05-21T17:13:12+03:00 Amir examples: cache hf model when --model not provided (#7353) db10f01310beea8a1ef7798651b9d692fd1149d0 3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 2024-05-20T16:36:55+03:00 Radoslav Gerganov rpc : track allocated buffers (#7411) f030ec1f7a72aa825b2104823946551b9ec5dfc1 e4e6f67be6a8a697f5f89a28c98934e53c99c359 2024-05-19T17:19:53+02:00 0cc4m Vulkan Embedding Fix (#7360) 5ca49cbecda27ce0a7266658fc3b640bff3ed386 1b01f06db0cff5f5f600bb754fc39fde565ed56a 2024-05-19T16:46:13+02:00 Johannes Gäßler ggml: implement quantized KV cache for FA (#7372) ab33f7a338593f6cf1ae98b10b6f8684f63bd72c e23b974f4cf9270d05062d446f406e3ff55d9451 2024-05-19T14:19:37+02:00 slaren cuda : clear error after buffer allocation failure (#7376) e23b974f4cf9270d05062d446f406e3ff55d9451 854d365abab7194b5013a523f72da19860c3c550 2024-05-19T20:51:03+10:00 Brian labeler.yml: Use settings from ggerganov/llama.cpp [no ci] (#7363) 0f98acfac6cc561dc57586bfff778405e42b576b ca57e0f35e33f714b9a6c2c4482b87bfe059c819 2024-05-18T10:04:55+02:00 Steffen Röcker llama : add support for larger Granite Code Models (20B, 34B) (#7324) 0fc1e820a9900a3dd08ddd3c6abe6604c53b689b 82ca83db3c8d45df559c03a4225b6eb34808a2db 2024-05-17T18:54:52+02:00 Johannes Gäßler CUDA: faster large batch FA without tensor cores (#7314) 27b040691cbe45314147c2745e891a38e9c048d4 29c60d8cddcfd14fa8a6bf023a6c4eb8692c76ba 2024-05-17T13:24:38+02:00 fairydreaming llama : use n_embd_head_v when reshaping kqv (#7327) 3b3963c55c8332e33533c44b2aa882b0e45f8292 dda64fc17c97820ea9489eb0cc9ae8b8fdce4926 2024-05-15T15:29:07+03:00 Radoslav Gerganov rpc : add command line arg for specifying backend memory dc020985b8755dd6aa93a2f002f43c3ede808cce 344f9126cc0d15891fde9472fe40b8572628ad7d 2024-05-15T14:44:49+01:00 agray3 Avoid unnecessarily disabling CUDA graphs (#7302) ea3b0590ee33d3573eb8ef76f88cc60f36d2a38d 29499bb59383c2a8c5d557a90abb08b696cef7f6 2024-05-15T20:01:12+08:00 dm4 embedding : free the batch after execution (#7297) e8a7fd4fb06d82f663850c21fcf86c0fb98ad9b4 a5e3fde8578d54b98d941344a4da150669af200d 2024-05-14T19:09:30+03:00 Georgi Gerganov metal : support FA without mask + add asserts (#7278) 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 1265c670fd8e41e1947352c96c5179adda97fb2c 2024-05-14T10:11:24-04:00 Steve Grubb server: free sampling contexts on exit (#7264) 5e31828d3e35c76ecfee665bc23771a4bec1d130 541600201e6480f54ae09e58d16b154d4b4b331d 2024-05-14T14:27:19+03:00 Radoslav Gerganov ggml : add RPC backend (#6829) 541600201e6480f54ae09e58d16b154d4b4b331d efc8f767c8c8c749a245dd96ad4e2f37c164b54c 2024-05-14T09:33:42+02:00 slaren llama : disable pipeline parallelism with nkvo (#7265) 27f65d6267cf22a44c5ccefa7765d53a05bd1259 ee52225067622babc277371511b8124884e1c797 2024-05-14T14:20:47+09:00 Ryuei docs: Fix typo and update description for --embeddings flag (#7026) 614d3b914e1c3e02596f869649eb4f1d3b68614d 30e70334f71b3bd115024affcf98cac3d79aaa95 2024-05-13T17:15:15+03:00 Georgi Gerganov llama : less KV padding when FA is off (#7257) b1f8af1886e8187db6bb2a9b87cfc1c0f175f629 e586ee42595500c53938e937b6b6ad5353ad76dc 2024-05-13T12:56:47+10:00 Brian convert.py: Outfile default name change and additional metadata support (#4858) 5a419926b0c4efab0531401aea91522aaea9fd07 fae9d234b6606693704eca62fe4aefbb6c6abb45 2024-05-11T11:06:26-04:00 compilade convert-hf : support bfloat16 conversion (#7158) 988631335a20d06497f58be0b8ba13adb4323a22 f99e1e456eaf69cc38c1982a2693ce41c0f897ef 2024-05-11T04:13:02-04:00 Steve Grubb server : free llama_batch on exit (#7212) 4e3880978f8b1bf546dd4e6f3b524d6b8739c49c f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 2024-05-10T07:01:08-04:00 Justine Tunney Fix memory bug in grammar parser (#7194) f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 d11afd665241c1b3910ab5f040d0216403019d87 2024-05-10T15:51:58+05:30 HanishKVC Main+: optionally allow special tokens from user in interactive mode (#7097) befddd0f15de6efb15d7e7f5b527dfb671f4196f d46dbc76f8770caec0175f1e57777173c70556a0 2024-05-09T20:39:54+02:00 0cc4m Vulkan Bugfixes and Improvements (#7084) 43248e559472556f368988575d9fba906b3eb139 a743d76a01f23038b2c85af1e9048ee836767b44 2024-05-09T15:30:44+02:00 jaime-m-p llama3 custom regex split (#6965) a743d76a01f23038b2c85af1e9048ee836767b44 f31ec120bc36c6270e4948e6a065a7c4cfa0c404 2024-05-09T14:32:02+02:00 Johannes Gäßler CUDA: generalize FP16 fattn vec kernel (#7061) fd9f92b154850014146f61717cd292a59a5cee5a 22842164bcae3251b81ad9e497a16ef66833cb9e 2024-05-09T13:03:29+02:00 Daniel Bevenius llama : update llama_timings.n_p_eval setting (#7160) 47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090) f98eb31c517c95960df1d0abc48002787f145f3b bc4bba364fb96d908f2698e908648df5e6f55e02 2024-05-08T18:16:38-04:00 compilade convert-hf : save memory with lazy evaluation (#7075) bc4bba364fb96d908f2698e908648df5e6f55e02 c12452c7aec8a02264afc00196a13caa591a13ac 2024-05-08T21:55:49+01:00 agray3 Introduction of CUDA Graphs to LLama.cpp (#6766) 26458af1d63c85195cd96cd1673051e332d06d30 83330d8cd6491e53e1aca4c5dfc47e039b3c04ff 2024-05-08T22:08:10+03:00 Gilad S metal : use `vm_allocate` instead of `posix_memalign` on macOS (#7078) c780e75305dba1f67691a8dc0e8bc8425838a452 48b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e 2024-05-07T21:26:43-03:00 Jeximo Further tidy on Android instructions README.md (#7077) 48b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e af0a5b616359809ce886ea433acedebb39b12969 2024-05-08T01:24:16+01:00 jukofyork Fixed save_imatrix to match old behaviour for MoE (#7099) 858f6b73f6e57a62523d16a955d565254be889b4 b3a995b416e13ae3123a117a743e11d0ede0ca4c 2024-05-06T11:12:14-07:00 William Tambellini Add an option to build without CUDA VMM (#7067) 03fb8a002df2e96104f9e06de9c78d2a8ed91e92 92139b90af4841d7fd060b526bdd443b621770ff 2024-05-04T12:06:40+03:00 maor-ps If first token generated from the server is the stop word the server will crash (#7038) 433def286e98751bf17db75dce53847d075c0be5 60325fa56f61c228464c9f065db3aa6a61f2156e 2024-05-03T15:24:30+02:00 Daniel Bevenius llama : rename ctx to user_data in progress_callback (#7045) 8d608a81b7bd170f700648f8214e6f3279d4d715 3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 2024-05-02T04:27:41+09:00 l3utterfly main : fix off by one error for context shift (#6921) 3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 1613ef8d8eb2479ba55c4d598e08c8f3f18a0fed 2024-05-01T17:52:55+02:00 Johannes Gäßler Server: add tests for batch size, different seeds (#6950) 9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021) f4ab2a41476600a98067a9474ea8f9e6db41bcfa 3f167476b11efa7ab08f6cacdeb8cab0935c1249 2024-04-29T16:58:41+03:00 Georgi Gerganov llama : fix BPE pre-tokenization (#6920) 0c4d489e29e53589bf13a801fe7c94b7b546d8f6 017e6999b5184234370b22a2f868e1be911e8d88 2024-04-26T20:06:33+02:00 Pierrick Hymbert quantize: add imatrix and dataset metadata in GGUF (#6658) e2764cd7ca1112d9303eba9e81c9935ee67352ff 4b1c3c98b442a4c84a788fff6323f6fa7e678a5b 2024-04-26T17:07:42+02:00 slaren gguf : fix mismatch between alloc and free functions (#6929) 7f5ff558eed0f732af8f25c2ab0645610bdec80c 9e4e077ec50fde6049b128662c72d37a3c28e34b 2024-04-26T12:15:30+02:00 Pierrick Hymbert server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638) 83b72cb086ce46a33dececc86bfe4648b6120aa8 d4a9afc1009f0da88d04b2c5f672d81d5ae94675 2024-04-26T10:41:53+03:00 Georgi Gerganov Merge pull request from GHSA-p5mv-gjc5-mwqv 28103f4832e301a9c84d44ff0df9d75d46ab6c76 c0d1b3e03e27634ac2871761f5033cf9324d472d 2024-04-24T11:08:36+02:00 Johannes Gäßler Server: fix seed for multiple slots (#6835) e931888d5024de814ce7119a18d6a959bfff3821 8960fe86ae075c846c5df8848230d1904ba8877f 2024-04-23T00:05:06+10:00 Dave Airlie ggml : fix calloc argument ordering. (#6820) b97bc3966e852adb626c90be64fd48282800f504 b8109bc0139f15a5b321909f47510b89dca47ffc 2024-04-21T13:50:41+02:00 Pedro Cuenca llama : support Llama 3 HF conversion (#6745) 1958f7e06ca2d2e3ab5698cc67513ba359144d8e 04fbc5f23e9708136ff03ebe194c7a7e965a7ca4 2024-04-14T15:24:15-04:00 David Renshaw llama : add missing kv clear in llama_beam_search (#6664) de17e3f7455dc7fd298cc61d86798533b9ca7a29 b5e7285baffb0da8a6619567b52d8e67de41291d 2024-04-14T10:42:29+08:00 Neo Zhang Jianyu fix memcpy() crash, add missed cmd in guide, fix softmax (#6622) 24ee66ed0d908d156bd0d1747b63a636a495cd7a 91c736015b66ba1d0b82cbae6313b6d5eaa61b68 2024-04-12T13:49:21+02:00 Pierrick Hymbert server : coherent log output for KV cache full (#6637) 91c736015b66ba1d0b82cbae6313b6d5eaa61b68 5c4d767ac028c0f9c31cba3fceaf765c6097abfc 2024-04-12T18:45:06+08:00 jiez llama : add gguf_remove_key + remove split meta during quantize (#6591) dee7f8d6928cc680cc969f7d93f98c3e24dcad41 81da18e71ccfc196d4516fbea5dc3a6a1f92dccb 2024-04-12T16:28:12+08:00 MasterYi1024 Correct free memory and total memory. (#6630) b804b1ef77351d2a11be945462c6c251710476cb 8228b66dbc16290c5cbd70e80ab47c068e2569d8 2024-04-11T14:51:07+02:00 Pierrick Hymbert eval-callback: Example how to use eval callback for debugging (#6576) e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519) beea6e1b16e783a0886e78dec01002a8c00db24d 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 2024-04-08T20:43:30+08:00 Jan Boon llama : save and restore kv cache for single seq id (#6341) d752327c3338d5b9634121d651c0105f2c933f9b 855f54402e866ed19d8d675b56a81c844c64b325 2024-04-08T00:48:29-07:00 Firat Adding KodiBot to UI list (#6535) 87e21bbacd830437ab653cf03b6f26d45c15395d 1b496a745c315022df2d919374052e6004ced8d3 2024-04-06T01:34:53+07:00 Ting Sun bench : make n_batch and n_ubatch configurable in Batched bench (#6500) 4399f13fb9462cd06f3f154d0aee738425000fea 1a43c7254ed5de91d09274b853db843c518f1b64 2024-04-04T09:34:58+03:00 Georgi Gerganov server : remove obsolete --memory-f32 option 1a43c7254ed5de91d09274b853db843c518f1b64 72d73af65132792a52433952ca4729b01c36cde2 2024-04-04T01:33:48-05:00 Xiao-Yong Jin server : add option to disable KV offload (#6468) 08a0c0206075556e82aca0feafad530dcc5f1426 52604860f93063ef98863921da697576af1c7665 2024-04-03T15:07:05+02:00 slaren ggml : mul_mat_id use the same tensor for all the experts (#6387) 52604860f93063ef98863921da697576af1c7665 f87f7b898651339fe173ddf016ca826163e899d8 2024-04-03T10:34:40+08:00 Meng, Hengyu [SYCL] Disable iqx on windows as WA (#6435) ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6c d48ccf3ad4fea5b9ede209c7f40be65371987bfe 2024-03-29T17:29:21+01:00 0cc4m Vulkan k-quant mmq and ggml-backend offload functionality (#6155) 069574775cea67d8a977904e4d534aff47a671f4 cfde806eb95de06d84162bdee593dad33a1d2693 2024-03-29T21:37:03+08:00 hxer7963 [Model] Add support for xverse (#6301) 057400a3fd457f4f214684eeb171444663b47a23 b75c38166cf0c66793a32d5c3d6cb69929dd083d 2024-03-29T08:23:22+01:00 Daniel Bevenius llama : remove redundant reshape in build_kv_store (#6369) cfc4d75df6399b36153ef739f2c1abee4c114bb8 6902cb7f2e3479f364ee177118200fb7e4e9fc92 2024-03-28T16:51:06+08:00 Ting Sun doc: fix outdated default value of batch size (#6336) e82f9e2b833d88cd2b30123ef57346c2cb8abd99 cbc83436197cde617cad696e665879c20df77daa 2024-03-27T08:16:40Z AidanBeltonS [SYCL] Fix batched impl for NVidia GPU (#6164) 557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122) deb7240100da99555b9ab9dc635021e591fceaf5 3d032ece8e6973441273601ca2981130608e287d 2024-03-26T18:11:46+09:00 Minsoo Cheong embedding : adjust `n_ubatch` value (#6296) 64e7b47c6986221f2ff5c57c89dfc018bb0e9e6d 7733f0c76081b2a69b5f8b192db2db7c43629d58 2024-03-25T16:38:22+09:00 Minsoo Cheong examples : add "retrieval" (#6193) a32b77c4b2c1808654d0b952f26c37d73d2e746b a0e584defd8c16e7a51ab895f595df0448d710d0 2024-03-24T14:45:56-07:00 Rick G Fix heap corruption from wmode out-of-bound writes on windows (#6272) 586e7bc561be88e929a9afca7e67d8ead00c53bd ddf65685105a39a57b1e7f80c3aa502a6313af24 2024-03-24T17:54:07+09:00 Minsoo Cheong sampling : deduplicated code for probability distribution access (#6240) 1997577d5e121568ae39f538021733ccd4278c23 476b0251b27fb64c575507024a671e639d675594 2024-03-23T18:00:38+01:00 Pierrick Hymbert server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254) 50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652 56a00f0a2f48a85376f48b5ce77699df781631ae 2024-03-23T01:24:36+01:00 Johannes Gäßler lookup: complement data from context with general text statistics (#5479) dba1af612926cbd4ebe2d876277af1e3305177e0 ee804f6223777019cf921e0d99cc24669313ab98 2024-03-22T19:00:01+01:00 Pierrick Hymbert llama_model_loader: support multiple split/shard GGUFs (#6187) 68e210b3543e0cc71268bee0920441747679ee13 b3e94f26bab8e3b5338b5902e5af5bb01894cb4a 2024-03-22T13:08:28+02:00 Georgi Gerganov server : enable continuous batching by default (#6231) b3e94f26bab8e3b5338b5902e5af5bb01894cb4a b2075fd6a578f5685060df4baa90ae9e48e98c70 2024-03-22T11:35:53+02:00 Georgi Gerganov metal : proper assert for mat-mat memory alignment (#6225) 95d576b48ebf582b112d1c9cf4eed7142fa4e464 59c17f02de8fdf7b084d6100b875b7e2bc07a83b 2024-03-22T09:36:03+02:00 Georgi Gerganov metal : pad n_ctx by 32 (#6177) 76aa30a26353f597e4fbe3cf776772ae812af89a c5b8595e3f4f4ed319ef71c9c9d868d1b7a27626 2024-03-21T08:27:57+01:00 Kawrakow Add ability to use Q5_0, Q5_1, and IQ4_NL for quantized K cache (#6183) d0d5de42e5a65865b5fddb6f5c785083539b74c3 b80cf3b2d1dee0ad325f7a794fecc66befce7336 2024-03-19T12:05:44+01:00 Pierrick Hymbert gguf-split: split and merge gguf per batch of tensors (#6135) 104f5e0fc156d48476258295457cafeec2a2af10 5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c 2024-03-18T16:40:22+01:00 Felix clip : fix memory leak (#6138) 2bf8d0f7c4cc1235755ad06961ca761e458c5e55 496bc79bc2b79bfd6124b8687a8dbd6a646e9b06 2024-03-18T11:03:04+01:00 slaren backend : offload large batches to GPU (#6083) 12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033) 6e0438da3cc95b89cdbf55f45fa4e324d9076792 727107707a73b3dc8a497cf9fc9405722c16dd2b 2024-03-14T14:29:32-04:00 Steve Grubb gguf : fix resource leaks (#6061) f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017) d894f352bf433157232dc8dc54eacd50014e898e 098dbaab449f5309a54871ba7e5acef72ae696de 2024-03-09T19:55:54+01:00 slaren perplexity : support using multiple sequences to allow larger batch sizes (#5946) fd72d2d2a5e79d61ccef6af3d15f16e5e5cbc352 c2101a2e909ac7c08976d414e64e96c90ee5fa9e 2024-03-09T10:30:04+01:00 Pierrick Hymbert server: tests: add truncated prompt tests, better kv cache size (#5933) c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328) af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 581ed5c4fe3a8909aaa8313633ac443f471ba755 2024-03-08T12:40:02+02:00 Georgi Gerganov server : fix EOS token detection with disabled cache (#5938) 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882) 61d1c88e155515dd03940913a5707ea84a8b119b 21b08674331e1ea1b599f17c5ca91f0ed173be31 2024-03-05T13:33:42+01:00 0cc4m Vulkan Improvements (#5835) 21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862) 29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796) 6d341ab6c53cd51f2921d986d0090cc8b049b39a 4ffcdce2ff877ebb683cd217ea38faf20faa5ffe 2024-03-05T03:24:00+09:00 Minsoo Cheong speculative : implement stochastic speculative sampling (#5625) 7d43c585dc174bb586775c22c15e5db9242b5b4b 82f3e668adafba647de703f835991e91a96b5ac4 2024-03-03T20:23:52+08:00 leejet add some new ops, fix some operators and add batch operations to certain operators. (ggml/747) de9692a7d2db66e29e5cb373c6551acc49145ccd e6029348e86c3810d4435faee54ba822cb43e2ef 2024-03-03T03:41:55-05:00 compilade llama : fix llama_copy_state_data with fragmented KV cache (#5840) 9731134296af3a6839cd682e51d9c2109a871de5 4a6e2d6142ab815c964924896891e9ab3e050632 2024-03-02T22:00:14+01:00 Pierrick Hymbert server: tests: passkey challenge / self-extend with context shift demo (#5832) bbde6eb2561153aabbdfac5001c690fe00cad639 ef2cd694c4155fbf25bae61c5178c47eb3676dba 2024-03-02T17:00:51+02:00 Kawrakow ggml : IQ3_S improvements (#5829) 38d152160898b0173ffe4dc7df5daadcbd2eceb0 052051d8ae4639a1c3c61e7da3237bcc572469d4 2024-03-01T07:36:47Z AidanBeltonS [SYCL] Use batched mul_mat pathway (#5591) 47bb7b48c7cec9d8f57d56812ce811ec130b89a3 c4d7f8178608440506e5489bae0109e4ca12e44a 2024-02-26T15:36:38+01:00 Johannes Gäßler CUDA: fix DEBUG_CUDA_MALLOC (#5729) bf08e00643fd529f748f0a858fd79f3061e3fa18 f7625019c51ca437a5840576d92362cfa710e4a2 2024-02-25T22:12:24+02:00 Georgi Gerganov llama : refactor k-shift implementation + KV defragmentation (#5691) f7625019c51ca437a5840576d92362cfa710e4a2 abbabc5e51d0d4656b438aec10b7fae9479ef37d 2024-02-25T13:43:50-05:00 compilade server : fix crash when system prompt is bigger than batch size (#5714) 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 525213d2f5da1eaf4b922b6b792cb52b2c613368 2024-02-24T16:23:52+02:00 Kawrakow IQ3_S: a much better alternative to Q3_K (#5676) 525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566) fd43d66f46ee3b5345fb8a74a252d86ccd34a409 54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea 2024-02-23T19:31:54Z AlpinDale server : add KV cache quantization options (#5684) 4cb4d8b22d4fda971621a68c570ce84d66897c37 3a03541cedea474fa9d41214484cc3fbcf468a9e 2024-02-22T16:32:09Z Someone workflows: nix: hardcode cachix ids, build unconditionally (#5663) 7fe4678b0244ba7b03eae66ebeaa947e2770bb1a ba2135ccae7462470b3865c6e41d2e1d734eac05 2024-02-21T22:52:39+01:00 slaren llama : fix session save/load with quantized KV (#5649) 89febfed9322c8849520dc63c93ee4f5fd72556e 5022cf242d689e15defd133f96c4345ad30c5d19 2024-02-21T10:33:54-05:00 Jared Van Bortel examples : do not assume BOS when shifting context (#5622) eccd7a26ddbff19e4b8805648f5f14c501957859 c14f72db9c62d71d35eb1c141745c0bd0cb27b49 2024-02-21T16:17:10+02:00 Georgi Gerganov sync : ggml (#5633) a14679cc30c785e75d38028bae6ec39c6209ddef 6560bed3f066c876682464762cad90f1e28e3f1b 2024-02-21T11:39:52+02:00 Kawrakow IQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590) a3145bdc305422973e25f0b066da6f469ed5dc45 890559ab28e354052e16e770155ad007fd0856e8 2024-02-19T14:53:48+02:00 Georgi Gerganov ggml-alloc : apply ggml/731 4480542b2271ba1438f0daff8e5f3a74b1dc8609 11b12de39bd787c0494da0cd405958fdfedc29c4 2024-02-19T03:25:38-05:00 NawafAlansari baby-llama : allocate graphs in ggml_context (#5573) 11b12de39bd787c0494da0cd405958fdfedc29c4 3a9cb4ca6408c29423373dd6cd7aa78a58286c00 2024-02-19T09:23:37+01:00 Xuan Son Nguyen llama : add llama_chat_apply_template() (#5538) 4cb072769804c77ab466bc8351c76ede9d5ba49d 65085c713e14f78cdda6abc275b1a5d8c2b8ca15 2024-02-16T12:43:23Z Herman Semenov llava : removed excess free(NULL) operation (#5531) 0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491) 704359e29985a06a389337a2617b7f3fa8eff908 594fca3fefe27b8e95cfb1656eb0e160ad15a793 2024-02-15T17:11:15+11:00 Neuman Vong vulkan: Find optimal memory type but with fallback (#5381) aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267) 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc ad014bba97ef6ef6c3e2f78b2fc463e91ae94579 2024-02-13T06:06:58-06:00 Douglas Hanley llama : support batched embeddings (#5466) 3b169441dfe8e420f88d1592708cc2a871daadb9 3bdc4cd0f595a6096cca4a64aa75ffa8a3503465 2024-02-12T09:16:06+02:00 Georgi Gerganov sync : ggml (#5452) f026f8120f97090d34a52b3dc023c82e0ede3f7d cd9aea63b577a83def84dbd6dcd90a6fa02af745 2024-02-10T02:53:28-08:00 Ian Bull metal : use autoreleasepool to avoid memory leaks (#5437) 44fbe34360dd760f9e68b4271f21533436397f84 8e6a9d2de0096af7120606c74ee2f26684e87b41 2024-02-09T06:52:33+01:00 0cc4m Fix Vulkan crash on APUs with very little device memory (#5424) ee1628bdfea8b0079fed0140ac2f00ef1b465b57 ed0bf32290ee5b30ffad5becd99cbecef74aedd7 2024-02-07T07:54:50+01:00 0cc4m Basic Vulkan Multi-GPU implementation (#5321) 17c97fb0620448b37516a3f53fea6c482b0a30a4 b08f22c882a1443e6b97081f3ce718a4d1a741f8 2024-02-06T18:43:06+01:00 Johannes Gäßler CUDA: mul_mat_vec_q max. batch size 8 -> 4 (#5370) 2c516611f1d0f1e5e9754f8ea1cf97cb1b17bf2c 8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be 2024-02-06T14:44:06+01:00 Johannes Gäßler CUDA: mul_mat_vec_q for batch sizes > 1 (#5351) 098f6d737b65134cf220d12b9b706e8cfc5e4610 78b00dda6c0d62c34f5371d47718defff6ed2b22 2024-02-05T19:33:00+01:00 Johannes Gäßler make: Use ccache for faster compilation (#5318) 1ec3332ade60aeb1494ace2211cf1a966db6d770 6a66c5071a74a96c4f52cf1015a092acd18c3714 2024-02-03T06:22:06-05:00 Jared Van Bortel YaRN : store rope scaling type as int32_t in memory (#5285) e805f0fa9951081ce0a86378a7aa52b6f636b82d af3ba5d94627d337e32a95129e31a3064c459f6b 2024-02-02T15:54:14+08:00 Meng, Hengyu [SYCL] get MAX_MEM_ALLOC from device property (#5270) af3ba5d94627d337e32a95129e31a3064c459f6b e1e721094d8169636d55f68efe37f222cd3f0677 2024-02-02T15:53:27+08:00 Neo Zhang Jianyu [SYCL] update guide of SYCL backend (#5254) e1e721094d8169636d55f68efe37f222cd3f0677 128dcbd3c9c4b12f42b560a4430427d7b2828628 2024-02-01T23:20:13-08:00 Ian Bull llama : fix memory leak in llama_batch_free (#5252) 4d0924a8902010d31bd737b6f1f594943d120d0f 8ca511cadee2c67f0bd8c7034a2513778ee9a1b7 2024-02-01T19:25:24+01:00 0cc4m Vulkan Phi Fix for AMD Proprietary Drivers (#5260) ce32060198b7e2d6a13a9b8e1e1369e3c295ae2a 1cfb5372cf5707c8ec6dde7c874f4a44a6c4c915 2024-02-01T17:19:51+08:00 Guoteng llama : support InternLM2 (#5184) 15606309a05ccf7fadbaad5538cb7c32acb1e06b b2b9f025e7821e78bd501d75d01838c26de07a57 2024-01-31T21:10:15+08:00 JidongZhang-THU llava : add MobileVLM support (#5132) f8e9140cb46eebaa867e1184a9946e4840eec772 d62520eb2cc1d7168a30edec6110e1daefbd959f 2024-01-31T11:44:19+01:00 0cc4m Vulkan Fixes (#5223) e6f291d15844398f8326940fe5ad7f2e02b5aa56 4003be0e5feef320f3707786f22722b73cff9356 2024-01-30T20:17:30+02:00 Georgi Gerganov server : fix context shift (#5195) a4b07c057a553b1ac253051efc3f040351e2eae1 549a1e6cd5b39fe0dc3d4ea5515c65f17797a31e 2024-01-29T14:00:10+02:00 Georgi Gerganov gguf : add input validation, prevent integer overflows (ggml/709) 2256f36b79a932a478d4dcdf02c1e5a60056e5f3 7359016c7c0f65dc30cf79791212b06f15866450 2024-01-30T13:59:30+01:00 0cc4m Vulkan Windows APU Memory Handling (#5199) 813416991ab0d1caa0d12f93ac4e8a24a2add0a3 5589921ef84a4fb1c6d1c9c34d626a5a83033db6 2024-01-30T10:18:02+01:00 divinity76 main : allow empty --prompt-cache file (#5176) ceebbb5b21b971941b2533210b74bf359981006c 6daa69ee81851ab26ca8aefca1a4202941fc0262 2024-01-29T22:19:29Z Paul Tsochantaris ggml alloc: Fix for null dereference on alloc failure (#5200) fbe7dfa53caff0a7e830b676e6e949917a5c71b4 172ac82629815d038702b049070f4c8c02662da5 2024-01-29T09:05:13+01:00 slaren ggml : add max buffer sizes to opencl and metal backends (#5181) d2f650cb5b04ee2726663e79b47da5efe196ce00 35dec26cc25a9ff7d8c3ed52326b94f772b911ce 2024-01-28T19:50:16Z Paul Tsochantaris metal : free metal objects (#5161) 2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059) 0f648573dde61c510560f68244f70ece7e60d8c1 b764b8f1d079ba44d912801ce6d29bd0d94d51cf 2024-01-28T21:26:23+05:30 Abhilash Majumder ggml : add unified SYCL backend for Intel GPUs (#2690) 35a2ee914308c85ab5cb576467381443ad23f0ac ec903c034131848da9222536ff18da07ec0882a0 2024-01-27T15:25:55+01:00 Michael Klimenko Remove unused data and add fixes (#5154) 62fead3ea0a30c8d424f4a8373fa14165c7c707f 15b4538ff29b280a395a1406d711497d8eaa2564 2024-01-26T18:59:43+01:00 slaren cuda : fix tensor size calculation for non-split buffer (#5145) 15b4538ff29b280a395a1406d711497d8eaa2564 7032f4f6349c17a8352f9f93f7d2122f45469e59 2024-01-26T18:18:26+01:00 slaren ggml-alloc : add 10% margin to the buffer sizes (#5149) 6dd3c28c9cd1ef74b49d79f47d668759346a3c6c 38b431de232d1b736b5af19b8c7d72f7075a70bc 2024-01-26T12:16:07Z Paul Tsochantaris metal : remove unused `n_buffers` and `buffers` (#5129) 1387ea21178f9f154944013d4dd9764b54c69deb 26d607608d794efa56df3bdb6043a2f94c1d632c 2024-01-24T12:48:14+01:00 slaren llama : pre-allocate input tensors in a separate buffer (#5100) 011e8ec577fd135cbc02993d3ea9840c516d6a1c 6f9939d119b2d004c264952eb510bd106455531e 2024-01-22T23:42:41+01:00 slaren llama : fix not enough space in buffer with Qwen (#5086) 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 942c0107a7301434c0a5e7da46bc4cf2393aa556 2024-01-21T08:01:20+02:00 Kawrakow Slightly faster imatrix (#5050) 6df465a91d402370bcba6676b19fad85b06ce7e0 77bc1bbd05f0c31cb45773eb5eb59b9ff2b07e1b 2024-01-20T16:05:49+01:00 slaren llama : run all KQV ops on the CPU with no KV offload (#5049) 77bc1bbd05f0c31cb45773eb5eb59b9ff2b07e1b 48e2b1337257bb77573bf76cfffcff3a5efa8704 2024-01-20T08:11:31Z Herman Semenov cmake : add support for ccache (#5002) 381ee195721d8e747ee31a60c0751822b3072f02 a5cacb22b2114fd9adf61c00cbb237384d86bced 2024-01-19T13:20:50-05:00 Uzo Nweke finetune : fix ggml_allocr lifetimes (tmp workaround) (#5033) 8b20858e5e9c44b99b4b31ae9c40b8f20d01d94f 57e2a7a52a819883f40dada8a2edc24ecf48186b 2024-01-19T10:45:06+02:00 Georgi Gerganov perplexity : faster Winogrande via batching (#5024) ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017) 682986a08eb5cb04865d2e713449f17304d266d8 dcad445d0c83ad49bca1b58cf9c139cfcebee5d4 2024-01-18T13:46:27+02:00 Kawrakow Add Winogrande evaluation (#5015) 1e605f4102c7ea8dc0dff82f5eaa6a71973d549f 6b6916b215251e09bd57cdbf870dc8a73345edc2 2024-01-18T08:47:24Z Paul Tsochantaris metal : fix memory leak, dangling pointer and unused autorel (#5007) 44a1a4a41a4c0b03afaa7d9e06bcbc7cf95aa1e6 c918fe8dca8fa1c4602427e0a4b88e20046f6c34 2024-01-17T18:39:41+02:00 Georgi Gerganov backend : add eval callback (#4935) 959ef0c0df725c013c7f712eaa7790b8e38a8e20 c37b3474e61d609d43cccc3bde5d559e80e4f5d1 2024-01-16T19:34:54+02:00 Georgi Gerganov perplexity : fix kv cache handling for hellaswag (#4981) 158f8c9e21302114bac3c646f80ea85b52ffa0bd 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 2024-01-16T17:05:19Z Paul Tsochantaris metal : localized logic in `ggml_metal_graph_compute` (#4924) 4483396751c79dea540808b9cb9238245d06da2b d9aa4ffa6e0296d42f1f676dd85de97c8491eb73 2024-01-15T14:06:52+01:00 David Friehs llama : apply classifier-free guidance to logits directly (#4951) c71d608ce7a1584bf5072f197919dd24f3a6163f 4be5ef556de830c5c4f6e45c05ef4427823fe607 2024-01-13T21:41:37+01:00 Johannes Gäßler ggml: cache sin/cos for RoPE (#4908) df845cc982e7e2ea7b9900e29d55b15338faa78d 6b48ed089377330cdb362970a51c1c89b6d857a8 2024-01-13T17:29:43+01:00 David Friehs llama : minimize size used for state save/load (#4820) b38b5e93ae31019e87f692b69d27124eae6aac02 7dc78764e2ff86512e6e31cb0fcb8087df4b4708 2024-01-13T18:03:45+02:00 Georgi Gerganov metal : refactor kernel loading code (#4794) e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766) f34432ca1e0b288129390c1db8296a82aaf1e632 7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 2024-01-05T16:00:00+01:00 Erik Scholz fix : cuda order of synchronization when setting a buffer (ggml/679) 8f900abfc09851e281bc9027e0ab2f16bf079b29 1fc2f265ff9377a37fd2c61eae9cd813a3491bea 2024-01-09T08:58:55+01:00 Johannes Gäßler CUDA: faster softmax via shared memory + fp16 math (#4742) dd5ae06405c5565b99889bdb3f168f4351252cfb 668b31fc7d86245435ad6574e0e1126e734049e2 2024-01-08T16:02:32+01:00 Kawrakow SOTA 2-bit quants (#4773) 52531fdff88764282c1b233174721aab8347252d b0034d93ce2949ce7d9c098ca02e56f66cd484e2 2024-01-08T11:18:32+02:00 Georgi Gerganov main : add self-extend support (#4815) b0034d93ce2949ce7d9c098ca02e56f66cd484e2 b7e7982953f80a656e03feb5cfb17a17a173eb26 2024-01-08T11:14:04+02:00 Georgi Gerganov examples : add passkey test (#3856) 226460cc0d5b185bc6685fb76f418fd9418d7add d5a410e8556191672465f7ff58682ea2474038b0 2024-01-07T17:59:01+01:00 slaren llama-bench : add no-kv-offload parameter (#4812) 83e633c27efdf0eb0ba54249e784b0ea760b1007 32866c5edde402f42ff4233bb89dcfcede34fd22 2024-01-02T03:51:28-08:00 postmasters llama : differentiate the KV dims in the attention (#4657) 5d7002d4372ebf107cfaf46fcd90df27b204f330 26f3071d714f0b27ad7f021a46a66a1085480258 2024-01-02T04:38:15-06:00 minarchist server : add --override-kv parameter (#4710) edd1ab7bc34c10a780ee7f9a4499f7689cdad36d 198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a 2023-12-31T17:42:22Z Someone Serge flake.lock: update 198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a d8361747317c5cb2e00e7fb3b59ff4dce5a176a5 2023-12-30T18:25:25Z Someone Serge flake.nix: suggest the binary caches 0235b9b571f3cc7d2b8836409a5404b41ce1379c ce18d727a47f2473ca863a6f78bf3ad480008f72 2023-12-29T18:53:34+02:00 Georgi Gerganov clip : use ggml_backend_buffer_is_host (#4205) 441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576) 879b690a9e1eb1ab0a29b58236fc76978fb4d902 b47879b0dda43f2d26415e88b6840295817e552a 2023-12-27T15:16:55+01:00 Daniel Bevenius finetune : fix output formatting in print_params (#4653) dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a de8e496437c59e7d1cc84109e3e49a3478aee25a 2023-12-26T21:23:59+01:00 slaren cuda : fix vmm pool with multi GPU (#4620) 5bf3953d7e9831ea22b0bc017ce97409b801ccf1 708e179e8562c2604240df95a2241dea17fd808b 2023-12-24T14:34:22+01:00 slaren cuda : improve cuda pool efficiency using virtual memory (#4606) 708e179e8562c2604240df95a2241dea17fd808b 925e5584a058afb612f9c20bc472c130f5d0f891 2023-12-23T16:10:51+01:00 slaren fallback to CPU buffer if host buffer alloc fails (#4610) 7082d24cec35e9ce9147535a2224dfc67ee0a78c ba661751322a7c201fd3bef71af077c5aebfaa2a 2023-12-22T17:05:56+01:00 LeonEricsson lookup : add prompt lookup decoding example (#4484) ba661751322a7c201fd3bef71af077c5aebfaa2a a55876955b1a83464171de8d578d3ab062a7b62d 2023-12-22T17:53:43+02:00 Georgi Gerganov sync : ggml (fix im2col) (#4591) 4a5f9d629ecfd0a53afdddbaf54a4fa02d9a9ce9 d232aca5a73b290e218a2e48b91023d5e994203f 2023-12-21T22:36:26+02:00 Samuel Maynard ci : add `jlumbroso/free-disk-space` to docker workflow (#4150) d232aca5a73b290e218a2e48b91023d5e994203f 31f27758faf4a4bd08101a57c7ec3a473f771f86 2023-12-21T21:07:46+01:00 slaren llama : initial ggml-backend integration (#4520) 31f27758faf4a4bd08101a57c7ec3a473f771f86 56fa50819f7a3ca2128f63b81c17c08a4454479e 2023-12-21T11:57:48-08:00 Marcus Dunn llama : allow getting n_batch from llama_context in c api (#4540) 0f630fbc924aaabeea6eaf466bb4b47d13015c3e 562cf222b5129e40b312877e928eac3a02e4ec33 2023-12-21T13:45:32-06:00 Erik Garrison cuda : ROCm AMD Unified Memory Architecture (UMA) handling (#4449) 9154494808dc865475c59022c29060b4947a803b c083718c895b7c8c7fb2a4660643fb78d0c64dfd 2023-12-21T18:42:59+01:00 Johannes Gäßler CUDA: mul_mat_id always on GPU for batches >= 32 (#4553) 1d7a1912cea2227f9a1a449758ed622c560542f9 799fc2268989482054944c902874cca76337580f 2023-12-21T01:59:27-08:00 LoganDark Fix access violation in ggml_cuda_free_data if tensor->extra is NULL (#4554) 799fc2268989482054944c902874cca76337580f 328b83de23b33240e28f4e74900d1d06726f5eb1 2023-12-20T15:41:22+01:00 Johannes Gäßler CUDA: Faster Mixtral prompt processing (#4538) b9e74f9bca5fdf7d0a22ed25e7a9626335fdfa48 3c04bf6da89eaf4c7d317e0518f0687dfcbf2de7 2023-12-18T17:27:47Z Ebey Abraham llama : add phi-2 + fix NeoX rope + ggml_mul_mat_set_prec (#4490) 45668633fdb522a925c3dafc1ecf426f539efb27 0ffc92d2d23a789625f018840469af045be1e3c0 2023-12-17T16:05:56+01:00 slaren finetune : keep allocs alive until all allocations are done (#4486) c6c4fc081c1df1c60a9bfe3e6a3fd086f1a29ec7 8a5be3bd5885d79ad84aadf32bb8c1a67bd43c19 2023-12-16T18:58:46+01:00 slaren lora : add support for non-llama models (#3333) 20a68a7030ee06e8eb7eb8e24ae4ac52dc17803f 55e87c3749cb4985c3b316984d40e00e4df4a5d0 2023-12-14T20:13:33+08:00 LostRuins ggml : add ggml_row_size() (fixes llama out of space) (#4461) 873637afc7924f435ac44c067630a28e82eefa7b 0353a1840134b24b07ab61fd4490192f28c4db6b 2023-12-14T17:09:34+09:00 wonjun Jang convert : support loading vocab from fast tokenizer config (#3633) 799a1cb13b0b1b560ab0ceff485caed68faa8f1f fecac45658a99eddc4d6e36ba0310ca8f87a77f0 2023-12-13T13:04:25+01:00 slaren llama : add Mixtral support (#4406) 6391817cd19a4507c6c941a1fd08756268662b2d d9d4cfef64ea416dd66632173787d03ffb180cc7 2023-12-12T04:25:57-05:00 crasm llama : document logits_all deprecation (#4418) bcc0eb4591bec5ec02fad3f2bdcb1b265052ea56 81bc9214a389362010f7a57f4cbc30e5f83a2d28 2023-12-07T13:03:17+02:00 Georgi Gerganov llama : per-layer KV cache + quantum K cache (#4309) 81bc9214a389362010f7a57f4cbc30e5f83a2d28 05cd6e5036d72d0930de4d8f6be7bce09e8dda24 2023-12-07T02:25:22-08:00 Hongyu Ouyang train : fix #4227 (double free in examples/train-text-from-scratch/train-text-from-scratch.cpp) (#4351) 05cd6e5036d72d0930de4d8f6be7bce09e8dda24 caa9249217c5fd524b900add5ddcbeaa20cbcb12 2023-12-06T20:21:59+02:00 Georgi Gerganov server : recognize cache_prompt parameter in OAI API (#4347) 5aa365d88fdb8fdd430ef3fc141c7a5fd37c3502 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 2023-12-05T10:19:18-07:00 Kerfuffle llama : allow overriding GGUF metadata when loading model (#4092) 23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324) d7b800b8bc490a221acbd83c575206a907f2f6e2 5a7d3125e7c24f223659b7f0b7aa7736986e92c0 2023-12-03T10:58:16+02:00 Georgi Gerganov llama : pad KV cache size (#4280) 03562f3a86d6706eea9f4fc09b532946c191b34e 37c746d687d877bc11803e96b4dc5f378b83c0a0 2023-12-02T02:17:06+08:00 CausalLM llama : support attention bias on LLaMA architecture (#4283) ef47ec18da469423c276b683dd9b5741cee7023e 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de 2023-12-01T10:51:24+02:00 Georgi Gerganov ggml : add ggml_soft_max_ext (#4256) bde629bb53b85886ee0fe83524c1efe2689bc618 f7f9e06212d44530b3200033286049dbdf84b3d3 2023-12-01T06:45:17+09:00 Miwa / Ensan batched.swift : update README.md (#4214) 4fea3420ee3918d125d74c94d962a6ea82875351 64e64aa2557d97490b2fe1262b313e2f4a1607e3 2023-11-28T23:16:34-08:00 Peter Sugihara readme : add FreeChat (#4248) 8406b0924bf323f37d536dee8b8165c1f3d9d11d b38a16dfcff88d547f78f52d1bea31b84a05aff7 2023-11-28T10:32:03+02:00 Georgi Gerganov ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240) bb03290c17540768a16000a2b01ee4f22440aba1 f3b269813f6147c5b5cda082e6b45cf04a932e0d 2023-11-27T09:56:52-05:00 Bailey Chittle examples : iOS example with swift ui (#4159) 2568a4bf548d7392e9c78c008b33b4c11d53fe95 b35f3d0def3efde92ed465d92a267430d957e87d 2023-11-24T18:25:10+09:00 eastriver main.swift : fix eos checking (#4197) 6b0a7420d03b9d13cb0e9439a01ce8476d8bf093 d103d935c0e75769a6a597f7a64cab72c6cc3e79 2023-11-23T19:07:56+02:00 Georgi Gerganov llama : KV cache view API + better KV cache management (#4170) e937066420b79a757bf80e9836eb12b88420a218 28a2e6e7d476717881be6eb9e2d3331342cec57b 2023-11-19T11:10:52+01:00 slaren gguf-py : export chat templates (#4125) 4760e7cc0b68570d58f55e8dda469805d1759d0d bb50a792ec2a49944470c82694fa364345e95170 2023-11-13T14:16:23+02:00 Georgi Gerganov sync : ggml (backend v2) (#3912) d96ca7ded77df764db797b68b4a29e34c5b56285 34b0a082074b073eb14c2bd93c0c070e20ddcd16 2023-11-11T05:48:21Z Alexey Parfenov server : fix crash when prompt exceeds context size (#3996) 875fb42871a0f5a88fbe31a0b5edd697b84038e4 0a7c980b6f94a049cb804573df2d8092a34df8e4 2023-11-08T13:15:14+01:00 slaren ggml-alloc : fix backend assignments of views (#3982) 0a7c980b6f94a049cb804573df2d8092a34df8e4 413503d4b92500d82b002d03c580a71a54747138 2023-11-07T12:43:04-05:00 Jared Van Bortel gguf : track writer state, free unneeded tensors, cleanup (#3871) 381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613) 48ade94538fa509465d71023e49d07aab0ec8cd5 f28af0d81aa1010afa5de74cf627dcb04bea3157 2023-11-05T08:12:13+01:00 slaren cuda : revert CUDA pool stuff (#3944) d6069051de7165a4e06662c89257f5d2905bb156 4ff1046d75e64f0e556d8dcd930ea25c23eb8b18 2023-11-02T18:10:39+01:00 Oleksii Maryshchenko cuda : use CUDA memory pool with async memory allocation/deallocation when available (#3903) 0eb332a10f3f14a3746c391bf80ff5e7bdf29d5d d02e98cde035d91ed8032ab943d1d504fe9da394 2023-11-01T19:29:14-04:00 cebtenzzre llama : fix llama_context_default_params after #2268 (#3893) d02e98cde035d91ed8032ab943d1d504fe9da394 898aeca90a9bb992f506234cf3b8b7f7fa28a1df 2023-11-01T23:10:09+01:00 slaren ggml-cuda : compute ptrs for cublasGemmBatchedEx in a kernel (#3891) 50337961a678fce4081554b24e56e86b67660163 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 2023-11-01T20:11:02+02:00 Georgi Gerganov llm : add llm_build_context (#3881) 71e3718abdb2771b50c9606d3a7569623a0b0afe 238657db2364cfb728c694470a4a81702afea760 2023-11-01T08:04:02+02:00 Georgi Gerganov llama : refactor graph build code (#3837) 6e08281e588bbba1a5d180290a94a43f167f3a1a 2046eb4345e62c4575b3cdc0115a51db89f3fb70 2023-10-29T11:31:40-06:00 Kerfuffle Extend llama_kv_cache_seq_rm to allow matching any sequence (#3843) 71a09da301705b9c5ad4ca3cf3fbd966dd3f1ec5 d69d777c02b9ac405a95f3cbfba219a990caefff 2023-10-29T18:32:51+02:00 Georgi Gerganov llama : fix kv shift bug (#3835) c8d6a1f34ab6f1b6bd468d256e535a61f98f114c 2f9ec7e271220a78fe27c9e6ccbcc0dda31cda0f 2023-10-27T16:37:41+02:00 Thibault Terrasson simple : fix batch handling (#3803) 2f9ec7e271220a78fe27c9e6ccbcc0dda31cda0f 34b2a5e1ee4fe6295fb4420eb91131d743694c65 2023-10-27T17:01:23+03:00 Georgi Gerganov cuda : improve text-generation and batched decoding performance (#3776) 6961c4bd0b5176e10ab03b35394f1e9eab761792 cc448774866e6479c750bd7c135cd8f92cedee67 2023-10-25T10:26:27+03:00 Georgi Gerganov batched-bench : print params at start ad939626577cd25b462e8026cc543efb71528472 1717521cdb976a2219888b0e5cba36e210eee9df 2023-10-24T16:10:43-04:00 cebtenzzre server : add parameter -tb N, --threads-batch N (#3584) (#3768) 2b4ea35e56792064598e922e46d081e02bc96b94 daab3d7f45832e10773c99f3484b0d5b14d86c0c 2023-10-24T16:48:37+03:00 Georgi Gerganov cuda : add batched cuBLAS GEMM for faster attention (#3749) 5be6c803fa5378f62a1590f3ad8c6b64c7c0c2ce 6336701c9378c23c85d1c0e464b663ca2bbb8e60 2023-10-23T12:40:03-07:00 Marcus Dunn llama : remove token functions with `context` args in favor of `model` (#3720) 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677) 22c69a27945e7acf9690dd3210d316f22182751c 465219b9143ac01db0990bbcb0a081ef72ec2008 2023-10-22T08:37:20+03:00 Georgi Gerganov batched : add len CLI argument a0edf73bda31c7c4e649e6f07c6fd30a729929cd f439e506e8ae8b01df2ae2156380f8156d7553e3 2023-10-20T13:06:10+03:00 Georgi Gerganov server : fix uninitialized sampling context (close #3685) 0e89203b517c95ec6675eda75d200a60d1e8921d c67fe68e417f766970fb1feaf2e66458aa24116a 2023-10-18T16:21:57+03:00 Georgi Gerganov speculative : add tree-based sampling example (#3624) 40e5ce054f4c4fa555e4510ea5f760bb29185332 a5e8c1d8c71f01d98ae2ec63a57c118664f9764d 2023-10-11T21:30:06+04:00 shibe2 CLBlast: Fix temporary buffer size for f16 conversion (wsize) a5e8c1d8c71f01d98ae2ec63a57c118664f9764d e74c705e15cd228ad696c4a3cdea6d6fb4ff434c 2023-10-17T19:00:58+02:00 slaren train-text-from-scratch : fix assert failure in ggml-alloc (#3618) 2a4bcbacead886996f175f33479d1d874a3e577f 424b6381c4daeed62e6600e0402e72f39845b58d 2023-10-13T12:33:16+02:00 Daniel Bevenius llama : remove n_threads from llama_decode_internal (#3614) 424b6381c4daeed62e6600e0402e72f39845b58d 1e0e873c373c33989beb6bc64d83cd572ab7fe2b 2023-10-13T12:23:10+02:00 slaren ggml : add context enumeration functions (#3605) 370359e5baf619f3a8d461023143d1494b1e8fde 9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee 2023-10-12T18:23:18+03:00 M. Yusuf Sarıgöz examples: support LLaVA v1.5 (multimodal model) (#3436) 57dd55e2c742bfc50e0f5c6fb95c14118cff44f6 b8fe4b5cc9cb237ca98e5bc51b5d189e3c446d13 2023-10-12T09:29:04+03:00 Georgi Gerganov server : fix kv cache management (#3588) a8bdd65525ae86dea905e9866ad369b53e30ac14 70c29da118cdb02bfcbd0376c32b5b2236e48e48 2023-10-11T15:42:22-04:00 Michael Coppola server : add parameter -tb N, --threads-batch N (#3584) 70c29da118cdb02bfcbd0376c32b5b2236e48e48 8c70a5ff25964f0a81e20d142a2f5ac5baff22fc 2023-10-11T13:35:46-06:00 Kerfuffle common : fix mirostat state when using multiple sequences (#3543) 8c70a5ff25964f0a81e20d142a2f5ac5baff22fc 24ba3d829e31a6eda3fa1723f692608c2fa3adda 2023-10-11T21:25:33+03:00 Georgi Gerganov batched : add bench tool (#3545) 24ba3d829e31a6eda3fa1723f692608c2fa3adda 9f6ede19f3cfa50d4a51a5babb056c3f8a450b80 2023-10-11T04:14:05-07:00 Zane Shannon examples : add batched.swift + improve CI for swift (#3562) f5f9121de140eff558f13b5c5e78a3a3b6b94377 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 2023-10-10T09:50:23+02:00 Jan Ploski llm : add MPT support (#3417) 95bd60a0a69f57e9a2ff1269667ea484a1a9bb40 fcca0a700487999d52a525c96d6661e9f6a8703a 2023-10-09T14:44:58+02:00 slaren ggml-alloc : fix assert in debug builds (#3555) fcca0a700487999d52a525c96d6661e9f6a8703a dcc09d25961c5d0626bc148e558ee841141748f7 2023-10-09T14:32:17+03:00 Georgi Gerganov refact : fix convert script + zero out KV cache to avoid nans (#3523) b0ec5218c3d24755786b80ecce9cf4ffc07583f8 63d3b06a4318329f92b078e8aa0be7ab6e9f871f 2023-10-08T10:01:53+03:00 Georgi Gerganov metal : support MTLGPUFamily < Apple7, formatting, style (#3524) 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493) ac2219fef34eb5b713c286c34c6e4162c39c8f3b 48be797ffbd80b062f55778e09e97180eb25d2ab 2023-10-03T21:04:01+03:00 Georgi Gerganov llama : fix session saving/loading (#3400) 48be797ffbd80b062f55778e09e97180eb25d2ab f56e1baec361b5381e32ee6b6e56e4f00e002dfe 2023-10-03T10:09:28-07:00 Alex Klinkhamer llama : expose model's rope_freq_scale in the API (#3418) bc34dd4f5b5a7c10ae3ed85a265ce6f2ed2fab79 2777a84be429401a2b7d33c2b6a4ada1f0776f1b 2023-09-29T19:05:18+03:00 Georgi Gerganov train : fix KQ_pos allocation (#3392) 16bc66d9479edd5ee12ec734973554d4493c5dfa 0512d66670de3f650c579519833c085014b0f200 2023-09-28T21:42:38+02:00 slaren llama.cpp : split llama_context_params into model and context params (#3301) 0512d66670de3f650c579519833c085014b0f200 0e76a8992c8200237bbc6471a53fb8796b3872f7 2023-09-28T19:31:04Z Eve ci : multithreaded builds (#3311) 0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632) 2619109ad57d7a75388a9cce51e5da645410d92e ec893798b7a2a803466cc8f063051499ec3d96f7 2023-09-28T19:36:36+03:00 Georgi Gerganov ci : disable freeBSD builds due to lack of VMs (#3381) ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228) dc6897404e141c74cbbf8030ecfebd74e1815411 527e57cfd8a9a26bf622c0510c21c2508a24be26 2023-09-27T17:48:33+02:00 Rickard Hallerbäck metal : reusing llama.cpp logging (#3152) a40f2b656fab364ce0aff98dbefe9bd9c3721cc9 d119c04c159d015a93567df7e73e0e45a22d0f1d 2023-09-20T15:06:36+03:00 Alon CI: FreeBSD fix (#3258) 578d8c8f5cb72f354bc115ba230ee5b2d803eee7 b541b4f0b1d4d9871c831e47cd5ff661039d6101 2023-09-17T14:16:22+02:00 Johannes Gäßler CUDA: fix scratch malloced on non-main device (#3220) 4fe09dfe665c58a753dc9eb638dd4dca1cd35488 80291a1d02a07f7f66666fb576c5b1e75aa48b46 2023-09-16T03:02:13+08:00 Meng Zhang llama : add support for StarCoder model architectures (#3187) 8c00b7a6ff38e27fa1e471452b8a480913772c2a 7e50d34be68aae2cc766203703dd188e910e033a 2023-09-15T19:06:03+03:00 Georgi Gerganov sync : ggml (Metal F32 support + reduce ggml-alloc size) (#3192) 83a53b753a9499a2a3535c93975b430cb2c828a9 5c872dbca2c7979b1f6dafc97db0774b8bbf9372 2023-09-14T20:21:25+03:00 Alon CI: add FreeBSD & simplify CUDA windows (#3053) e64f5b55783e910d8287363895d652b4bea6527a 94f10b91ed69980f299441e49c8dbdb448f0ccc6 2023-09-08T11:43:35-04:00 Cebtenzzre examples : make n_ctx warning work again (#3066) cb6c44c5e045709b6bb5cc9bb8c9be107c771a78 a21baeb12202a9020b48c53beaaf4b355228e8ba 2023-09-08T14:09:21+02:00 Przemysław Pawełczyk build : do not use _GNU_SOURCE gratuitously (#2035) ebc96086af49fe70108cafcea6ab4bebd658a41a 7f412dab9c8801f5d37904f7dce1faf4c2b43b42 2023-09-08T04:04:56+02:00 slaren ggml-alloc : correctly check mmap return value for errors (#3075) c4f496648c1e32efeb714200e7eae7fc7cfbb223 fec2fb19e4229aac58c98171c46e77144b99f8a3 2023-09-07T15:49:09+03:00 Georgi Gerganov metal : fix kernel_norm (fixes Falcon on Metal) (#3057) bd33e5ab92e7f214205792fc1cd9ca28e810f897 31035681445181fb414e0def7ec3f84462b3bd97 2023-09-04T14:59:52+02:00 slaren ggml-opencl : store GPU buffer in ggml_tensor::extra (#2994) cf9b08485c4c2d4d945c6e74fe20f273a38b6104 47068e517004d90f13c16352bb3b4cafd53a00cd 2023-09-03T20:34:09+02:00 slaren ggml-alloc : use virtual memory for measurement (#2973) 6460f758dbd472653296044d36bed8c4554988f5 ca82cf7bac0c91d03e3d320b3a865dd006f854ac 2023-09-03T16:46:44+08:00 Wentai Zhang opencl : fix a bug in ggml_cl_pool_malloc() for ggml_cl_mul_mat_f32() (#2955) 21f3d1be867b4d7be07c26f5da6e4bc69bcf4d27 571083f508266c4eb5cb5457d836df5dd3c173ce 2023-09-02T20:23:45+08:00 Jhen-Jie Hong k-quants : fix build on armv7 (android only) (#2920) 18705a30ef3d6a89e1d7c6cb8cfe8633f760cb53 e8d91589258f9204397a7ac5f9b3c857835c98f8 2023-09-01T05:03:49-04:00 Cebtenzzre llama2c : fix segfault and alloc-dealloc-mismatch (#2913) e8422de39e4aa2f7e50574124b060a80607e654a 92d0b751a77a089e650983e9f1564ef4d31b32b9 2023-08-31T04:21:45-07:00 DannyDaemonic @vxiiduu's fix for PrefetchVirtualMemory (#2930) 8afe2280009ecbfc9de2c93b8f41283dc810609a 71d6975559acfd6c8407a4ef8275a9979c737765 2023-08-30T21:46:19+02:00 Johannes Gäßler CUDA: mul_mat_q=true llama_context_params default (#2912) 06abf8eebabe086ca4003dee2754ab45032cd3fd c03a243abf9f30889f31fefdfa94fe9d7034820c 2023-08-29T23:24:42+02:00 slaren ggml : add view_src and view_offs to ggml_tensor for views (#2874) 95b6e5212f5e4e1419de1d833d7f8d788f9f2227 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 2023-08-28T23:33:27-07:00 Marcus Dunn added `struct` to llama_dump_timing_info_yaml's `llama_context` (#2857) 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439) 35feac6560387cf0484371af3d9b12bff678e0b9 92b1bbd2ec43c82ec0530ba3c8758846c5790c75 2023-08-28T14:24:53+03:00 Georgi Gerganov ggml : sync (mem align to header + conv_transpose_2d fixes + ggml_alloc) (#2852) f55538c3ccba9b926846ef862fa830cea08c433e ebcee207b6058b7f695bb5c203ad87b1066a9790 2023-08-28T10:59:08+03:00 Georgi Gerganov metal : fix memory leak (#2762) 50526f37eba0b28336700890242ff282b949cd83 04f4b1eb10f3e25750ca3e530265ce2841730e6b 2023-08-26T12:53:52-04:00 Cebtenzzre llama : use std::abs in llama_sample_tail_free (#2800) b91ad7f46134d0d051dc516eb59a76f402de55c2 2e5f70a25fc4576e9ed78603fe493eb7702c37a3 2023-08-25T01:58:00-04:00 Shouzheng Liu ggml-alloc : enlarge size of parse_seq (#2776) d0f77b1353fc820d1ff1e6b87bc6bedde315938d 0d3094f0c742ce61f84feb6e4f0b59beee6194d7 2023-08-24T21:10:39+02:00 slaren convert.py : try to determine n_ctx automatically for CodeLlama (#2770) 38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4 8f8c28e89cb9531211783da697d6e7c445e2af1d 2023-08-24T12:27:25-04:00 Shouzheng Liu metal : bug-fix when enable ggml-alloc (#2757) cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717) bac66994cf356cf488078c056831396eb4ce31d5 519c981f8b65ee6c87c2965539685ced0a17223b 2023-08-22T19:14:09+03:00 Kawrakow Quantization imrovements for k_quants (#2707) 519c981f8b65ee6c87c2965539685ced0a17223b 1123f7fbdfb8012e46f05e903e6f675922916378 2023-08-22T16:03:12+02:00 slaren embedding : evaluate prompt in batches (#2713) 1123f7fbdfb8012e46f05e903e6f675922916378 ef3f333d3775600d1646a9fa249aca532d15fb89 2023-08-22T15:25:19+02:00 slaren ggml-cuda : use graph allocator (#2684) 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398) cb1c0727bd59803b439b6a3af121c99e6393ff3d 9e232f0234073358e7031c1b8d7aa45020469a3b 2023-08-21T11:11:31+03:00 Kawrakow HellaSwag: split token evaluation into batches if needed (#2681) 097e121e2f17ed3541cf02c55ff7e9febc091b19 eaf98c2649d7da705de255712f0038ac7e47c610 2023-08-18T12:44:58+02:00 slaren llama : add benchmark example (#2626) a872a2b28eaefc8d464eaa535c94deeb501666f9 0919a0f73d95cfb93a1646a1d1741a0615fe2c5e 2023-08-17T03:35:53-04:00 Shouzheng Liu ggml-alloc : fix discrepency between measure&eval (#2639) fc8ef549e50087762a0b4f901cd74b2defcc6ae3 bf83bff6742c0f1795b4c18695a13a34ac7adf62 2023-08-16T16:08:28-04:00 Shouzheng Liu metal : enable ggml-alloc (#2627) bf83bff6742c0f1795b4c18695a13a34ac7adf62 b5ffb2849d23afe73647f68eec7b68187af09be6 2023-08-16T16:07:04-04:00 Shouzheng Liu metal : matrix-matrix multiplication kernel (#2615) e59fcb2bc129881f4a269fee748fb38bce0a64de 1638757767072a4957f52b9e3594f0b67610631b 2023-08-10T10:28:27-04:00 Christian Demsar Add --n-predict -2 for stopping generation on full context (#2565) 916a9acdd0a411426690400ebe2bb7ce840a6bba ea04a4ca1940d92becc0ee26523aa2c4a18cf938 2023-08-09T23:47:42+03:00 Sam Spilsbury ggml-alloc: Don't try to re-use buffers of external tensors (#2562) ea04a4ca1940d92becc0ee26523aa2c4a18cf938 25d43e0eb578b6e73046d9d6644a3a14d460600d 2023-08-09T22:46:40+02:00 grahameth add log_callback to llama_context_params for custom logging. (#2234) 415e99fec27be5a2e4283f1937afd17eb33fbd66 ff966e7ca6af127c9405523cdb07ef8fa01bf6d6 2023-08-04T19:29:52+08:00 l3utterfly Stream save llama context data to file instead of allocating entire buffer upfront (#2488) 2dbf518911926ef5a30f43aa83a0b1b1cdeaaa11 9d2382b3e45b5815fc6a054045a2f2c2b18c22a2 2023-07-31T13:18:51+02:00 Johannes Gäßler CUDA: fewer memory bank conflicts for mul_mat_q (#2458) 9d2382b3e45b5815fc6a054045a2f2c2b18c22a2 a113689571420fb4d6540f1a324d12965781356a 2023-07-31T11:02:53+02:00 slaren Fix Metal backend broken from the allocator changes (#2455) a113689571420fb4d6540f1a324d12965781356a 11f3ca06b8c66b0427aab0a472479da22553b472 2023-07-30T15:58:01+02:00 slaren ggml : add graph tensor allocator (#2411) d91f3f0c55663719ea03b76311e8c36ed55eb0e2 65cdf34bdc469fa86248e667a5880992684ef114 2023-07-28T10:44:43+02:00 Weird Constructor readme : fix the description of the Tail free sampling (TFS) method (#2431) 5488fb789ea5692268309baa76f67598155060be eb542d39324574a6778fad9ba9e34ba7a14a82a3 2023-07-26T15:56:53+02:00 slaren ggml : allocate graphs in a context (#2392) 0c06204fb39aa5560e883e0ae74be9518c57d88e 1fed755b1fb9babb6dbc1b4023e492950cd5a5be 2023-07-25T07:19:11-05:00 Xiao-Yong Jin main : add `--in-prefix-bos` to prefix BOS to user inputs; keep EOS (#2304) 1aa18ef994a6a2b531434eb13251ef48e56d345b 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 2023-07-25T08:00:19-04:00 Shouzheng Liu metal : concurrently dispatch commands (#2358) 91171b8072f6f0c8ae3a61e23451acb538bb9ece 355c80f49e32b0b15c0a457f3bad380e57f5b9ac 2023-07-23T07:52:08-04:00 Jose Maldonado make : fix CLBLAST compile support in FreeBSD (#2331) b47b8a9cfeb439d271bf997fb985fd6d82b3af5e b5fe67f8c69113bd9354bc1adcfe2df6be323740 2023-07-22T21:17:57+03:00 Georgi Gerganov llama : optimize memory buffers (#2325) d924522a46c5ef097af4a88087d91673e8e87e4d 4d76a5f49b9b5382dba5d13d92edb9159536c225 2023-07-21T17:27:51+03:00 Kawrakow Custom RoPE + bettter memory management for CUDA (#2295) 73643f5fb1136dc2b65ae910bdc5a431520d70a2 a814d04f81121e0429b39a61fe4afd946cd42046 2023-07-21T06:53:27-04:00 Jose Maldonado gitignore : changes for Poetry users + chat examples (#2284) 417a85a0010519224cf154eb85d383ffeafeeead 294f424554c1599784ac9962462fc39ace92d8a5 2023-07-20T06:32:22-04:00 Shouzheng Liu metal: minor q4 optimization and reduce code size (#2248) d01bccde9f759b24449fdaa16306b406a50eb367 6cbf9dfb32f0e23ed3afd02d30ab066ed53e2c4d 2023-07-18T14:24:43+03:00 Georgi Gerganov ci : integrate with ggml-org/ci (#2250) 6e7cca404748dd4b1a3affd0d1296e37f4ac0a6f a6803cab946c817fb7aaf2a40b317f5d3e373bd1 2023-07-15T06:34:16-04:00 Xiao-Yong Jin llama : add custom RoPE (#2054) 7cdd30bf1f84339c55a5e3de29384f6bbdebb61c e8035f141e1f71d739fa5cfc9c01531cdee6fc16 2023-07-15T03:00:58+08:00 Bach Le cuda : allocate all temporary ggml_tensor_extra_gpu from a fixed-size buffer (#2220) 7513b7b0a1c11faa00ad5a34d22681e5f07d32e4 de8342423d9600cf6e15455c1a27bae441262b45 2023-07-15T02:55:24+08:00 Bach Le llama : add functions that work directly on model (#2197) 975221e9548ef6d9f4af8d39cdffc4811c050beb 4523d10d0cf8c088f1b26c76d38d73290eb3b444 2023-07-12T20:51:29+03:00 Georgi Gerganov ggml : broadcast mul_mat + conv batch support (#2199) c9c74b4e3f9dcfab8b0032749ff8a579ab4e4d8d 3ec7e596b2ba3f43c22f441254ca2bcfa91102ba 2023-07-12T00:18:43+08:00 Bach Le llama : add classifier-free guidance (#2135) 1d656d6360359cfdaaf5d64ed9690047b600dbcb 72421402834141df6cbdcf595fe46dbd11874dce 2023-07-08T00:24:01+08:00 Qingyou Meng ggml : change ggml_graph_compute() API to not require context (#1999) 36680f6e40e4440c3ec3385d0b7e5ca8bb6c37f7 a17a2683d8fdb899ba497d0c28ccafb28c62efb6 2023-07-07T00:23:49+08:00 Judd convert : update for baichuan (#2081) befb3a35627432473f143c90994557d78ff5bc67 b2132270678c473f7cd9ba871b03d694126bc33a 2023-07-01T21:47:26+02:00 Johannes Gäßler Test-based VRAM scratch size + context adjustment (#2056) 2f8cd979ecd1fa582852e7136e92ff8990b98fd8 471aab6e4cb89d8ef6d043f1bc93acb6eb78ab67 2023-07-01T11:14:59-07:00 Aaron Miller metal : release buffers when freeing metal context (#2062) d3494bb86bf7ad5b0b60aae0220ea576f273b5c0 5b351e94d041742cd50ffcf2d44718d63bab398a 2023-06-28T20:39:08+02:00 m3ndax llama : replacing auto &kv with const auto &kv (#2041) cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e 9d23589d638dc74577d5ff880e6d4248b795f12e 2023-06-28T23:53:37+08:00 ningshanwutuobang llama : support input embeddings directly (#1910) b853d456018b10820686362af41b2f2f75f1eec6 9225baef71407d799a6f7f563b77fd7f82791416 2023-06-26T13:57:59-04:00 zrm ggml : add NUMA support (#1556) cbebf61ca7584e9709265395f0127ae7fc0f1882 447ccbe8c39332fcdd0d98a041b6e2ff6f06219d 2023-06-26T23:15:47+08:00 Howard Su Fix assert when free invalid cuda pointer (#2005) 527b6fba1d237befb324fd846bda7418c0fa394d d7b7484f74d486f77feb4c0b7af7e1718ed91651 2023-06-24T11:47:58+03:00 Didzis Gosko llama : make model stateless and context stateful (llama_state) (#1797) ba4e85a8339b9dd7cdffad31838235f2fe45a8ea 23fc5c219a9aebd57c8af3fac454062cc4622980 2023-06-19T23:20:06+08:00 l3utterfly llama : use aligned memory during ggml_init call from loading saved sessions (#1934) ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8 b97ca431db35ec96a339a721acb1219c1dd78bed 2023-06-19T18:14:09+03:00 Kawrakow cuda : faster k-quants on older GPUs (#1930) ce2c7d72e2d06988b5ddec6811ab923254542077 57cd69460f736031a3fc54af1e97c03f80128478 2023-06-18T09:09:47+03:00 Georgi Gerganov metal : handle buffers larger than device's maxBufferLength (#1826) 051e1b0e6a6e3aee7d989b47760980e6fda5861c 86c7571864ff331f8cdb9e092f3abeb123729a56 2023-06-17T19:30:22+03:00 Georgi Gerganov llama : fix kv_cache `n` init (close #1903) 794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570) 4bfcc855abdb2c9fcc3c5a84747974521909fa41 6b8312e7979b852f6b6ac9d29cd51fda16c17948 2023-06-15T20:29:48+03:00 Georgi Gerganov metal : parallel command buffer encoding (#1860) 254a7a7a5ff4c874ff8488f1f5cbdd7e9c89d682 92549202659fc23ba9fec5e688227d0da9b06b40 2023-06-14T19:47:19+02:00 Johannes Gäßler CUDA full GPU acceleration, KV cache in VRAM (#1827) e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652) 74a6d922f12ccfe16b0c265f43be8978c6f25e98 e4caa8da59c1c97dc23fa336f4d726984a20560f 2023-06-12T22:39:21+03:00 Kawrakow Metal implementation for all k_quants (#1807) 58970a4c39124a647ac2a640d9e178ea6c961e65 8c0a10e64dbf60fd9946c0cd5e6f59690800b123 2023-06-12T20:44:16+08:00 Howard Su Leverage mmap for offloading tensors to GPU (#1597) 8c0a10e64dbf60fd9946c0cd5e6f59690800b123 fa84c4b3e80199a5683438f062009c031a06c4fa 2023-06-12T14:31:36+03:00 Kawrakow metal : fix failure to load model (#1817) fa84c4b3e80199a5683438f062009c031a06c4fa 12b063f0ecf280e98028e444fc492ee6222cdcdc 2023-06-11T08:19:17-06:00 Kerfuffle Fix issue where interactive mode crashes when input exceeds ctx size (#1789) 17c10acfb44ecb7af25e37fb67b9501cbc0034d2 e9b66ee9829039d4ab54550d6222e42a0b31e52a 2023-06-10T12:06:45+03:00 Georgi Gerganov ggml : force no_alloc == false when creating opt tensors (close #1699) e9b66ee9829039d4ab54550d6222e42a0b31e52a 4f0154b0bad775ac4651bf73b5c216eb43c45cdc 2023-06-10T11:28:11+03:00 Kawrakow metal : add Q4_1 implementation (#1785) 98ed16557432d7a5179c57eddcc3a08a7ae6d54d ae9663f1887513e152839e91f61c513075a19422 2023-06-10T01:24:40+09:00 Robert Sung-wook Shin OpenCL: Add release memory (#1741) 72ff5282bf0388c60821f504c4c8cc2b1f491aa6 0bf7cf1b296fc9fca05411b37afdf08a531487d2 2023-06-08T22:28:21+03:00 Kawrakow metal : add Q2_K implementation (#1762) 35a84916fb029905c44746127026079268216e7a 2d7bf110edd8c49209401a16132052cba706ffd0 2023-06-07T04:10:17+02:00 Willy Tarreau main: add the possibility to open the prompt cache read-only (#1640) 17366df842e358768c0df7024484fffecfc7865b 44f906e8537fcec965e312d621c80556d6aa9bec 2023-06-06T21:33:23+02:00 Johannes Gäßler Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703) d5b111f53d14972669eb52055f9df2567663ad8b 2d43387dafe9c60f15f57aa23ee0b37864b98b32 2023-06-07T01:00:01+08:00 LostRuins Clblast fixes + enhancements to save VRAM and offload more layers (#1675) 590250f7a9847bc9c83aa063dbaac8fa0fea27c8 f4c55d3bd7e124b101bc974cbbf0e0dbbc32d5a3 2023-06-05T23:28:17-04:00 Spencer Sutton metal : add checks for buffer size (#1706) 9d0693bce38013364b1042568d9083353bfff48f efe05076323f5c6bafece109e21cce046f5e4b07 2023-06-05T13:24:04-07:00 kiltyj metal : use shared buffers between CPU and GPU (#1696) 99009e72f8072fa552eb02efee436be596c71cdd 5220a991a5e92bddad9542267ab445a2c033681c 2023-06-05T22:56:18+03:00 Kawrakow ggml : add SOTA 2,3,4,5,6 bit k-quantizations (#1684) 5220a991a5e92bddad9542267ab445a2c033681c d1f563a743a83dabc11e125d4a7d64189c16498c 2023-06-05T13:43:08+03:00 Henri Vasserman Increase 3B scratch buffers. (#1698) d1f563a743a83dabc11e125d4a7d64189c16498c 827f5eda91e5b7299848ee2c7179d873bdee0f7b 2023-06-05T10:19:03+03:00 Georgi Gerganov llama : fix Metal KV cache sync (close #1695) dcb2ed48268e421baf25adc00d602dad0f415564 d8bd0013e8768aaa3dc9cfc1ff01499419d5348e 2023-06-04T08:12:05+02:00 0cc4m OpenCL: Fix duplication of layers in VRAM and RAM, add GPU mul kernel (#1653) 136476e898fb96c302b0829ee3e79267ae12660f ffb06a345e3a9e30d39aaa5b46a23201a74be6de 2023-06-03T07:28:45-04:00 Evan Jones Fix prompt cache saving and chat-persistent rollover (#1678) 248367605ead6fb7c36d2bfb1ebd8f00a23f7c71 0e730dd23b0fb5f93dba574e0a48d9a69dc5dbae 2023-05-29T05:13:40-07:00 DannyDaemonic Work around for recalculating logits in cached prompts (Fixes #1585) (#1609) 1b78ed20818b72306edc7208b9bfb69a1a0d3297 337aea11390221bc925e4acb1f603f1649af2735 2023-05-28T11:48:57-06:00 Kerfuffle Only show -ngl option when relevant + other doc/arg handling updates (#1625) bb051d9723d628414b9e929e5264e23262a2f1b2 ca74884f6625b15ef69832f07fc60fe00db5f90c 2023-05-29T01:13:36+08:00 Howard Su opencl : no need to allocate cl_mem on heap (#1612) ca74884f6625b15ef69832f07fc60fe00db5f90c a6704643b62243bc4b6bbcd727d63d44e01a1002 2023-05-29T01:09:56+08:00 Howard Su opencl : use strstr to check if fp16 supported (#1611) 66874d4fbcc7866377246efbcee938e8cc9c7d76 1fcdcc28b119a6608774d52de905931bd5f8a43d 2023-05-25T20:18:01-06:00 Kerfuffle Some improvements to loading the session with --prompt-cache (#1550) affc76edfdefa7b326f526e463cc65ff13fcfb92 ea600071cb005267e9e8f2629c1e406dd5fde083 2023-05-20T14:19:28+02:00 Johannes Gäßler cuda : loading models directly into VRAM, norm calculation on GPU, broadcasting for ggml_mul (#1483) 5ea43392731040b454c293123839b90e159cbb99 ee9654138ab0ae5f138f4abddf56ca234ea3c352 2023-05-18T19:31:01+02:00 Erik Scholz make kv_f16 the default for api users (#1517) 13c351ad7292c5b5ab35db25c7a4f993e75d9cfd 60f8c361ca26328ef8523dfb08077fe2f1034490 2023-05-14T18:22:50+03:00 Georgi Gerganov ggml : various fixes (#1450) f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) 738ace394a6f8cf0174e90a97185d9e512c0e200 699b1ad7fe6f7b9e41d3cb41e61a8cc3ea5fc6b5 2023-05-13T09:08:52+03:00 Georgi Gerganov llama : free ggml context in set / copy state data (close #1425) cf348a60e0af3905acd1d297cb064b918265b7ac e6a46b0ed1884c77267dc70693183e3b7164e0e0 2023-05-10T11:37:14-04:00 Evan Jones main : add option to save full output to session (#1338) e216aa04633892b972d013719e38b59fd4917341 2485d7a4d39406cd0f468e35551b472cceb5bd61 2023-05-02T22:26:13-04:00 Evan Jones llama : only copy used KV cache in get / set state (#1272) b925f1f1b082319ee69943f8d1a83ac9b6ff09ca 90b19bd6eee943832584f9cac0b6f9ea29cc42a4 2023-05-01T13:32:22+02:00 slaren cuBLAS: fall back to pageable memory if pinned alloc fails (#1233) 90b19bd6eee943832584f9cac0b6f9ea29cc42a4 7ff0dcd32091c703a12adb0c57c32c565ce17664 2023-05-01T00:24:20-07:00 Alex Klinkhamer llama : let context be const when accessing const data (#1261) 76a884920aa1d2fc0dc7a7ac12dfc5ec5816377c 6bc4400e67e6bc4faad3ad3d5e9d8a6576a9752d 2023-04-30T20:34:52+02:00 0cc4m ggml : add CLBlast q5_0, q5_1, q8_0 dequant kernels (#1225) 214b6a35702a489e3738acd81fad6d46182d3036 305eb5afd51325e3142c01c17431febb7c67de87 2023-04-29T18:43:28+03:00 Georgi Gerganov ggml : adjust mul_mat_f16 work memory (#1226) dd7eff57d8491792010b1002b8de6a4b54912e5c 7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c 2023-04-29T08:34:41+03:00 Ivan Stepanov llama : new sampling algorithms (#1126) 7fc50c051ae8a78e9643fdf172d12e20f2dd9b6c b1ee8f59b4101b46999a0995d9a34506f7285466 2023-04-29T02:04:18+02:00 slaren cuBLAS: use host pinned memory and dequantize while copying (#1207) 7296c961d9303010a2b98379f738da2a8a55aa1b 78ec543733d10a1629f984fd0302fdaa4e87fe66 2023-04-28T16:57:16+02:00 0cc4m ggml : add CLBlast support (#1164) dd0eabc049fb1efc631cab8eb0a646808d704e18 54bb60e26858be251a0eb3cb70f80322aff804a0 2023-04-25T19:20:46+02:00 unbounded ggml : use full range for Q4_0 and Q4_2 quantization (#729) 957c8ae21d1e7052ea45a40ee8c0407b909e90cc 9b0a4d421459f4e5e1af735c9784c3247b379025 2023-04-24T18:47:03+03:00 Georgi Gerganov llama : increase scratch buffer size for 65B (ref #1152) c4fe84fb0d28851a5c10e5a633f82ae2ba3b7fae 1d78fecdab4087028a38517e86ed129f077174d8 2023-04-24T07:40:02+03:00 Georgi Gerganov llama : refactor get / set state + remove redundant kv cache API (#1143) 36b4f7e06406eed8a605cc9f2921d9244ef6a8e5 10f19c1121068ce3dab9bece03a8b9caaea2db36 2023-04-22T16:56:35+08:00 wbpxre150 llama : print timings on ctrl+c exit (#1021) 10f19c1121068ce3dab9bece03a8b9caaea2db36 7e312f165c5047d6e16680d1eebc83055e95c313 2023-04-22T04:27:05-04:00 eiery llama : have n_batch default to 512 (#1091) b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105) 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 25d7abbd1f73582b7e0fdc422a936e8541c0780b 2023-04-21T21:59:17+02:00 slaren Improve cuBLAS performance by using a memory pool (#1094) 9411288271ab548216902a029f42a0a38ebcedb7 8687c1f2581d059cd5b6a9502f89bd343566062a 2023-04-21T11:18:09-07:00 Alex Klinkhamer main : evaluate tokens in batches after swapping context (#1014) 8687c1f2581d059cd5b6a9502f89bd343566062a 1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 2023-04-21T17:25:21+02:00 xaedes llama : remember and restore kv cache data pointers (#1104) 74f5899df4a6083fc467b620baa1cf821e37799d 2f7c8e014e3c0ceaf39688845c2ff6f919fb03b7 2023-04-15T14:53:21-07:00 comex convert.py: Fix loading safetensors and ggml format on Windows (#991) c14e0d2f23e6d1e785255f4da8c253c1b4723659 723dac55fa2ba7adc6e3fc8609781d1ad0378906 2023-04-14T13:31:15+03:00 Georgi Gerganov ggml : always allocate buffers with size multiple of GGML_MEM_ALIGN 723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545) be87b6ed20a5f7528bf491a83e759a9fc6a24fea 0e07e6a8399fd993739a3ba3c6f95f92bfab6f58 2023-04-13T14:50:42-07:00 Gary Linscott perplexity : add support for batch size to `--perplexity` (#407) 6c248707f51c8a50f7792e7f7787ec481881db88 8cda5c981d0bf4dcb7664194b2cb9a06e2dbdd54 2023-04-13T16:08:32+02:00 Pavol Rusnak ggml : introduce GGML_ALIGNED_MALLOC/GGML_ALIGNED_FREE macros (#884) 2663d2c6784ad7b77998c6874df25648d597f74b a0caa34b162449b5c13b8d604573053300ff54a1 2023-04-11T06:19:54-07:00 comex Windows fixes (#890) f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone: cc9cee8e9e7598bd280295f6264f36d3a9224006 d2beca95dcfcd6f1145886e914b879ffc3604b7a 2023-04-06T17:59:11+02:00 Sergey Alirzaev Do not crash when it has nothing to say. (#796) 986b6ce9f99503c51ec5afd8a10baa32359434c6 34162989297fdfe3ab7305451ce55bc87e3f4c9c 2023-04-05T22:07:33+03:00 Georgi Gerganov ggml, llama : avoid heavy V transpose + improvements (#775) e986f94829bae0b9e66b326acbbba179931c84f1 c0bb1d3ce21005ab21d686626ba87261a6e3a660 2023-04-02T12:23:04+02:00 Christian Falch Added api for getting/setting the kv_cache (#685) 81040f10aae3160317c5787c9c59acb219927826 c4f89d8d73aab4318a6c61e3835135adfcf55407 2023-04-02T07:18:53Z Stephan Walter llama : do not allocate KV cache for "vocab_only == true" (#682) 78ca9838ee36660a776e97e3391b6fb5dcaacf7f a017390358cdb23fffb30988dc84bb190d0403ca 2023-03-29T13:51:37-07:00 Justine Tunney Make loading weights 10-100x faster 276e5b781155e3bbe6834472c58f03dfe62efabe d68c5dc4356c8f49e933df210f2ceca5002a8118 2023-03-29T08:31:26+02:00 Slaren Unmap the file in llama_free 692ce3164ef1201ecb9cfad315cc0a08b965adb8 96f9c0506fa81cada6f96f45768c34f45406c4bb 2023-03-29T02:02:34+09:00 DooWoong Lee (David) py : removed unused `model` variable and verified that the code functions correctly with `vocab_only` setting. Also confirmed that the code works as expected after running with reduced memory usage due to deletion of no-longer-needed variable. (#547) d502bc7c9d9d6dfb3a09aea404395b666d7b374d 436e56193199a1625f8c561069f702e8840a9e08 2023-03-28T19:51:55+03:00 Georgi Gerganov tests : free llama context at the end of the test e2d490dafd860eaaaf9aa8008ab790527d556daf 03f7e335604b3d68f74995aa2ccb4955833ee423 2023-03-25T21:36:22+02:00 Georgi Gerganov Inifinite generation via context swapping (#71) ab77d7631211b299cb734bea6ad1f74324154150 29b7baab670ae8b76ac0da21c2ded69ff18971ee 2023-03-25T16:47:59+02:00 Georgi Gerganov Add longer DAN prompt for testing big batch numbers 58e6c9f36f97d0a3e287b97256dc5f6b0e9fb5ae 36d07532ef7ccf0bdc12e050472f359a6794957f 2023-03-25T01:26:28-04:00 Jed Fox Add support for file load progress reporting callbacks (#434) 6f1ee4b640912211a4b07965c585d327e32e734d 8520fc310eab87f2c4612f2a00d4adbd44a20d0d 2023-03-24T23:38:14-05:00 Chris Kuehl Fix crash for 65B model with pre-allocated memory (#485) 7a9b6c3a8bdc1cb75fefc826dfaa7331eb63695d 31572d966531f7d768eb773322016ab78eb6e835 2023-03-24T23:17:37+02:00 Georgi Gerganov Reduce memory usage and allocate enough memory for largest context (#473) 31572d966531f7d768eb773322016ab78eb6e835 f4f5362edb01b05c383b23f36d7b3489c77061b5 2023-03-24T18:23:56+02:00 Georgi Gerganov Temporary bump the memory buffer size - hopefully fix issues from 483bab2e afd220d9c665e4c19107120ace2f0cb742e28aa1 481044d50cfe8eaa6cd0c1a1b445680e4b0b3ebc 2023-03-24T17:21:01+02:00 Georgi Gerganov Properly free llama_context on failure 563cdc391dde140f1084d1012234e8e6f57f881f 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 2023-03-24T08:19:05-07:00 comex Support calling mlock() on loaded model data on Linux and macOS (#453) 3cd8dde0d1357b7f11bdd25c45d5bf5e97e284a0 4870e455b3653f7d7769fa5772b2c90ffad088df 2023-03-24T06:22:28+02:00 Georgi Gerganov Revert "Fix memory allocation issues and seg faults" 4870e455b3653f7d7769fa5772b2c90ffad088df 483bab2e3d4a868fe679d8bb32827d2a4df214dc 2023-03-24T00:11:53+02:00 Georgi Gerganov Fix memory allocation issues and seg faults 483bab2e3d4a868fe679d8bb32827d2a4df214dc 404e1da38ec8025707031a8027da14dc1590f952 2023-03-23T23:22:01+02:00 Georgi Gerganov Avoid the transposed X branch in the Z = X * Y matrix multiplication (#439) 2e17dfd80a473099dacc0f41c9146d233c6a5972 20a1a4e09c522a80e2a0db51643d25fa38326065 2023-03-23T15:22:47-05:00 rabidcopy Replace EOS with newline to prevent context/memory being flushed by EOS in interactive mode (#333) 56e659a0b271436e24813a801640d015e7b05328 40ea807a972ec7b5a426f034ebfa593b5e7a06ed 2023-03-22T17:09:38+01:00 Erik Scholz fix perplexity after c-api refactor (#390) 928480ef5b7b03d7a07e98286aebe3d8b24457d9 56817b1f882b1894daa4051d0de0bf9a0926d315 2023-03-22T07:45:00+02:00 Georgi Gerganov Init llama_context_params properly from CLI (#370) 16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301) 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 3ab3e6582f7320c2b6568c892fdfc8215caf7e6c 2023-03-21T09:27:42-07:00 Gary Linscott Compute perplexity over prompt (#270) 3ab3e6582f7320c2b6568c892fdfc8215caf7e6c f157088cb75f23208abc92b473a132ef3f7a7f15 2023-03-21T18:23:15+02:00 Jean-Christophe Hoelt Add chatLLaMa script (#198) eb34620aeceaf9d9df7fcb19acc17ad41b9f60f8 2e664f1ff413995506c9a54f3a8d5b8c64e37a91 2023-03-21T17:29:41+02:00 Georgi Gerganov Add tokenizer test + revert to C++11 (#355) 5c19c70ba631a8f5d54feb6634e0eea178911a84 24568371ae0d7caf85164abe4753f36a7dba0288 2023-03-19T13:44:30-06:00 Rickey Bowers Jr fix coloring of last `n_batch` of prompt, and refactor line input (#221) 0b366e735729327476ec31da02de3c9c9771ddfb 160bfb217da5038ccbd74438f9f16a16012d7866 2023-03-19T18:57:00+01:00 Erik Scholz Command line switch to use F16 for memory_k and memory_v (refactor of #154) (#294) d7def1a7524f712e5ebb7cd02bab0f13aa56a7f9 6f61c18ec9a30416e21ed5abfb1321bdb14979be 2023-03-18T17:10:47-07:00 Ronsor Warn user if a context size greater than 2048 tokens is specified (#274) 554b54152145c30618bac171efb712cf4a7d1e96 d3f202d57b694376cef6f381a6b6901825c3f6d9 2023-03-18T21:58:46+01:00 Pavol Rusnak Add memory/disk requirements to readme 63fd76fbb06f9b723ca11505352387a3148b1814 2a20f48efad692a8c2744f10c673bbdbe0c751b7 2023-03-14T01:33:43+09:00 uint256_t Reduce model loading time (#43) d1f224712d78ab2cbb78777acfeb6739f660eb96 1808ee0500ea674b4bc2911acd0489ee5cbcef87 2023-03-13T17:15:20+01:00 Pavol Rusnak Add quantize script for batch quantization (#92) eb062bb012c4e131818dd757a6d3a757fdee3961 7027a97837c351e0a7bc48db2027af368de382db 2023-03-12T17:15:00-03:00 Sebastián A Windows fixes (#31) 7d9ed7b25fe17db3fc8848b5116d14682864ce8e 0c6803321c818f3f2da4a0693d20128b0f79ad28 2023-03-11T12:44:21+02:00 Georgi Gerganov Bump memory buffer