| 1 | fd9bd632f346085920d523dd307a3e4c11cc0a05 | e08e473cf292ba73789769b993bb35bcdfc31689 | 2026-06-01T14:15:35+08:00 | wangbomeng | HEAD -> dev, origin/dev | llama-bench: fix device-info |
|---|
| 2 | f86112d6758298241ab2fa84ad4f0f7b1ace35c6 | d1bc743c10080fed1253686ce01749b42611ded4 | 2026-05-29T16:40:38+08:00 | wangbomeng | | add dump_pos,fix pos_tensor of pre_by_embeds |
| 3 | f131bf1908b8c5dd1f49d7ae7f616506fc471666 | 33d96dae28e17208ef61a71dba40cda3c04f135a | 2026-05-27T09:38:51+08:00 | wangbomeng | | fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE |
| 4 | 63442fde8dc285817f725bd6c5fae80f478a3813 | fc3f4a9fab88e98eff8eeca8cbc6617333edba2c | 2026-05-20T11:47:42+08:00 | wangbomeng | | fix ubatch and cmakelist |
| 5 | c931ef3163940227c9b6291e04216245cce21429 | a43741244a646d3f8fa3ff01bb9b7d059223d0a5 | 2026-05-18T17:34:37+08:00 | wangbomeng | | calrt: fix prefill_by_ids.fix create_buf |
| 6 | 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 | b35bda124ccd4ed581dd6088d3ffa4931c2809b6 | 2026-05-18T08:40:54+08:00 | Yunzhe Jia | | fix n_ctx_slot error by adding runtime capacity loading for cal-llm |
| 7 | a43741244a646d3f8fa3ff01bb9b7d059223d0a5 | b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 | 2026-05-15T14:39:53+08:00 | wangbomeng | | run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl |
| 8 | b35bda124ccd4ed581dd6088d3ffa4931c2809b6 | 81a2cbd4cef5d28334ff513d6b69e593d9d1cb49 | 2026-05-15T09:19:31+08:00 | Yunzhe Jia | | Implement vocab-only model initialization and enhance cal-llm backend error handling |
| 9 | fabcc7dac4b34d83fe430980bb364b81087c7ee9 | 1e9787962f20a7e82c71589ac1dd0585454e4bfe | 2026-04-30T16:17:17+08:00 | wangbomeng | | calrt: fix encode dump |
| 10 | f584311c716dd078c4b737eebbfda97fe12b7274 | a339954cc2a145a80c5ea349e7896211916cbed9 | 2026-04-30T16:05:15+08:00 | wangbomeng | | calrt: fix encode dump |
| 11 | 0b8e43943846a1cd05c26c9186b9ef778ebae6e2 | 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 | 2026-04-26T08:43:43+08:00 | wangbomeng | | to debug |
| 12 | 509670642e8090a1713f5d73590b549be827aaef | 5d219bfcef239c1e3ddd1baecc0514a9462ff6a8 | 2026-04-24T09:40:34+08:00 | wangbomeng | | rm debug code |
| 13 | 99dd308adb8488fa869bb669e3335e646a938eff | 06c7852e99e34c71e24e3ef6001cb54c72970e4d | 2026-04-21T15:50:01+08:00 | wangbomeng | tag: v0.2.1 | server: fix max_seq_len |
| 14 | ed62eb33447f993d578e156a3c7e38c91b420ece | 015e988a271573a7c11e2a4b45084e1219d69d50 | 2026-04-21T15:05:22+08:00 | wangbomeng | | try server-test:not success |
| 15 | 015e988a271573a7c11e2a4b45084e1219d69d50 | 99962021f2dd1994dbbf90d5712f0ca2633f20f8 | 2026-04-17T16:56:08+08:00 | wangbomeng | | little change |
| 16 | d8b2aaa00049978cebac15041f960d75b552f97b | b6f29ec8140028619efaa50aa6e73146cecf631d | 2026-04-13T11:23:44+08:00 | wangbomeng | | server: fix context-shift |
| 17 | b6f29ec8140028619efaa50aa6e73146cecf631d | 6d55eae7e76b768acfcec045b8e84cded8ae3b55 | 2026-04-13T11:23:31+08:00 | wangbomeng | | server: fix context-shift |
| 18 | 42a181674565411efa5c8b318bc77d6fd084df8a | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | 2026-04-10T09:06:55+08:00 | Yunzhe Jia | | fix prompt_cache issue |
| 19 | a2d5bf362d6c9a546f9deadf4f8975605a915d33 | bd3a57a11aa008e0b5dc2a30f82fcd3a02587208 | 2026-04-09T21:01:46+08:00 | Bomeng Wang | | server: comment fixed time |
| 20 | fcfcdf80b01664a08fb12df879a05df3cc0eba70 | 0cd44929b442860dc0e5f88976108be82350f9dc | 2026-04-09T19:41:52+08:00 | Yunzhe Jia | | tmp fix one run >4K problem |
| 21 | b8153b6b8f244b223c9f4c2940ae1f212634519e | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 2026-04-09T15:07:02+08:00 | wangbomeng | | server: fix limit tokens to max_seq_len |
| 22 | 82842cfc3fa3d5c004c4540aeff8a81f38509bee | 622a22991089c6debd5f4b57738f3df3a0bda8b5 | 2026-04-09T15:06:26+08:00 | wangbomeng | | server: fix limit tokens to max_seq_len |
| 23 | ecf01a17651cd7b1e8b85fd6075e83831463ee23 | 99d2078e89305035d87d966cee7987c7d50b3925 | 2026-04-09T09:47:55+08:00 | Yunzhe Jia | | fix n_parallel problem |
| 24 | 99d2078e89305035d87d966cee7987c7d50b3925 | 9626239f5a9e568c9975d67dd6745fef90279a87 | 2026-04-08T19:01:16+08:00 | Yunzhe Jia | | fix buffer resize problem |
| 25 | 9626239f5a9e568c9975d67dd6745fef90279a87 | da724f3e2a8af2c2537e3edcff41e9415ac66fef | 2026-04-08T17:47:04+08:00 | wangbomeng | | calrt: fix MapBuf |
| 26 | e126c21ed7b793b648d63533ea7ee30885f5a82a | 5603e050af07173589f3b8850121263d86da01fd | 2026-04-01T10:07:12+08:00 | wangbomeng | | sever: fix commit id |
| 27 | 1e8a16cd0e3ad3c9a0f8746852a0a38c6e52322e | 893e52bda0fee99bbda1521ea733a760bc4201f1 | 2026-04-01T10:14:22+08:00 | wangbomeng | | calrt: fix slice and add infer/copy time |
| 28 | 3c08ebf0e442cd730ddffd959ec676f9caf31c82 | 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e | 2026-03-24T02:43:03+08:00 | wangbomeng | | calrt: comment LOG_ERROR in untile_decode_cpy |
| 29 | 613bc2b9a9d7af92efbe42d876ffcdb244f7a00e | 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa | 2026-03-24T02:30:12+08:00 | wangbomeng | | calrt: fix max_seq_len judgment |
| 30 | 4e194ecc6c4b8ebe4c72d93f6055e3605dbfcefa | 16cbf81a731f5839a2f6b0eb9d8539826353748b | 2026-03-24T01:59:03+08:00 | wangbomeng | | calrt: fix ubatch.embd cpy |
| 31 | 16cbf81a731f5839a2f6b0eb9d8539826353748b | 8b4e17d990c23025148c4abadefe1010a0dd0734 | 2026-03-23T09:38:21+08:00 | wangbomeng | | calrt: fix model_name of untile_cpy |
| 32 | 07817cefc14fa359dcecad0630defd3610f8f5c8 | b2c45d8ddefb7ec09435231c8ec5b736fabf9c91 | 2026-03-10T16:32:07+08:00 | Yunzhe Jia | | fix kv issue |
| 33 | f8fba66b657c51a1df1efc7267bfea9f6140cebf | db4a61d2234c2f457b42ecc3f7219a1e1a35508a | 2026-03-06T15:06:36+08:00 | Yunzhe Jia | | fix calrt_install include path |
| 34 | 7a3a9a0e76bb5f530beafcfe52e87e388e93117a | 583c387efaf7bc030574e554088de79d09a27fbd | 2026-03-05T07:24:59+08:00 | wangbomeng | | calrt_infer: fix past_kv_len |
| 35 | 0bd95719fed2f0247c8d0199dd897d24157dfae6 | 365eb0b719e30b0f9e348d854f11c9c3f954a96e | 2026-02-07T10:25:06+08:00 | Yunzhe Jia | | fix get_model_by_name |
| 36 | 886cd1fb3b217efcf51c46209fcb694022346797 | 9328f21378275f2354a19c3af907332b216ab492 | 2026-02-06T17:36:54+08:00 | Yunzhe Jia | | fix compile problem |
| 37 | 7eeb241aad429a68fb8cfa3ba85d000fb2348cd2 | dfb6250031a25058dbc3757e8a7ec75d90dcb48a | 2025-11-21T09:20:01+08:00 | Yunzhe Jia | | fix byte_size error |
| 38 | 1f5accb8d0056e6099cd5b772b1cb787dd590a13 | 2759ccdb4adc8568add4316780d5e675519b0775 | 2025-11-04T05:04:59Z | Noah | | Fix garbled output with REPACK at high thread counts (#16956) |
| 39 | c5023daf607c578d6344c628eb7da18ac3d92d32 | e7da30b584dc1f2ee0414c4a1298ce64eef97e8d | 2025-11-03T11:47:57-08:00 | lhez | | opencl: support imrope (#16914) |
| 40 | e7da30b584dc1f2ee0414c4a1298ce64eef97e8d | ed8aa63320393512bdcfe4b05b5ae01ba91888e1 | 2025-11-03T18:53:26+01:00 | Aleksander Grygier | | fix: Viewing multiple PDF attachments (#16974) |
| 41 | ed8aa63320393512bdcfe4b05b5ae01ba91888e1 | 48bd26501b08a3f0bff1249db47f313641f7bebb | 2025-11-03T18:01:59+01:00 | Daniel Bevenius | | model-conversion : pass config to from_pretrained (#16963) |
| 42 | fcfce040e816c542f374ad51461b3561d73c4bc9 | ee3a5a10adf9e83722d1914dddc56a0623ececaf | 2025-11-03T14:40:02+08:00 | Jinyang He | | ggml : LoongArch fixes (#16958) |
| 43 | 7e994168b1ccc12337ba8de939c4fd466107c1fb | bcfa87622ae46be6345a8e3dfdbdc5ba5414042b | 2025-11-03T03:35:33+02:00 | shani-f | | SYCL: optimized repeat_back kernel (3× fewer asm instructions, 2× faster)Feature/sycl repeat back opt (#16869) |
| 44 | bcfa87622ae46be6345a8e3dfdbdc5ba5414042b | a2054e3a8ff0da3978a4acc18c349ff58554d336 | 2025-11-03T00:41:08+01:00 | Sascha Rogmann | | feat(webui): improve LaTeX rendering with currency detection (#16508) |
| 45 | a2054e3a8ff0da3978a4acc18c349ff58554d336 | dd5286805004db1f9ac3176a1cbbfe373bdda0f8 | 2025-11-03T04:40:30+05:30 | Shagun Bera | | test-backend-ops : fix segfault in moe-expert-reduce test in support mode and coverage (#16936) |
| 46 | dd5286805004db1f9ac3176a1cbbfe373bdda0f8 | 6b9a52422bac0f50dd8f1f8386744fa3ce9783bf | 2025-11-02T23:11:21+01:00 | Sigbjørn Skjæret | | ci : disable failing riscv cross build (#16952) |
| 47 | 2f966b8ed87514e74bb96592217226cb6a6974dd | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 2025-11-02T22:21:48+02:00 | Georgi Gerganov | | clip : use FA (#16837) |
| 48 | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 87c9efc3b297b8a498716b1db3d061842e6fc85b | 2025-11-02T18:14:04+02:00 | Georgi Gerganov | | server : support unified cache across slots (#16736) |
| 49 | a864132ba546b6385922226480ee4e392aaa065c | d38d9f0877a5872daa3c5f06fb9a86376bf15d50 | 2025-11-02T08:48:46+08:00 | Aaron Teo | | devops: fix failing s390x docker build (#16918) |
| 50 | 2f68ce7cfd20e9e7098514bf730e5389b7bba908 | e4a71599e5846110159955dec0008eb4aa24222b | 2025-11-01T19:49:51+01:00 | Pascal | | webui: auto-refresh /props on inference start to resync model metadata (#16784) |
| 51 | cf659bbb8ef9eb048e5153a27cf787fd83c05560 | d8b860a219c2415faac8cc0e50b48b4aa11e3b64 | 2025-11-01T15:51:36+01:00 | Xuan-Son Nguyen | | mtmd: refactor preprocessing + support max/min pixels (#16878) |
| 52 | 1ae74882f8f6755e44dff8f23f3abdc5b53ab7c1 | 961660b8c395afb8903f61ace69396a158ea0cb4 | 2025-11-01T15:02:57+01:00 | Jaromír Hradílek | | webui: recognize AsciiDoc files as valid text files (#16850) |
| 53 | 5d8bb900bc7daa84bfa7bb1d25ab7e32394919f3 | 2e76e013600cb0d51ccf158571ca1d0502952a07 | 2025-11-01T00:52:14-05:00 | Jeff Bolz | | vulkan: Fix multi_add invalid descriptor usage (#16899) |
| 54 | 2e76e013600cb0d51ccf158571ca1d0502952a07 | d3dc9dd898be805c23a408cc36daed5b3bf29221 | 2025-11-01T00:45:28-05:00 | Jeff Bolz | | vulkan: fuse mul_mat+add and mul_mat_id+add_id (#16868) |
| 55 | d3dc9dd898be805c23a408cc36daed5b3bf29221 | bea04522ff1a0d8559ccfd353aa018dcfbb608cc | 2025-11-01T06:13:26+01:00 | Oliver Simons | | CUDA: Remove unneded bias/gate dims in fused mmvq (#16858) |
| 56 | bea04522ff1a0d8559ccfd353aa018dcfbb608cc | 0de0a01576772032008a689afc4d7c80685074c4 | 2025-10-31T23:40:23+01:00 | Piotr Wilkin (ilintar) | | refactor : llama-model.cpp (#16252) |
| 57 | 8da3c0e200a586f768ada6f38745acb01380174c | c22473b580807929fd9e3a3344a48e8cfbe6c88f | 2025-10-31T13:50:33+02:00 | Georgi Gerganov | | batch : fix consistency checks for the input positions (#16890) |
| 58 | 0f715b4e759acceccb9f437cfd2a988fff85514a | d2d931f173b8a736b08999436e9259aafddec718 | 2025-10-31T09:51:26+01:00 | Daniel Bevenius | | server : fix typos in server.cpp comments [no ci] (#16883) |
| 59 | 2976b0374d36609b0429dd6ce48807e2ad39a7c2 | d2a2673dd1c86a01ab010e18b13b8bb959968c48 | 2025-10-31T16:18:59+09:00 | Masato Nakasaka | | vulkan: Fix crash when FP16 mul_mat accumulation is not supported (#16796) |
| 60 | d2a2673dd1c86a01ab010e18b13b8bb959968c48 | 13002a08960e51a76c4d696165b5d7638d2f2b99 | 2025-10-31T08:14:49+01:00 | Ruben Ortlam | | vulkan: fix shmem overrun in mmq id shader (#16873) |
| 61 | 9984cbb61d12491d604484fb38b678fa15064061 | ce18efeaf1234bd08f25bc08f88ef95cf5d9e51f | 2025-10-30T16:00:20-07:00 | lhez | | opencl: fix boundary handling for mul_mm (#16875) |
| 62 | b52edd25586fabb70f0c21b274473b307cf14499 | 517b7170e1a4d733583c4b07c5b7a49acc05911c | 2025-10-30T18:42:57+02:00 | Georgi Gerganov | | server : remove n_past (#16818) |
| 63 | 835e918d8428f5119927d7150bf5a26176dedda0 | d261223d24e97f2df50220e4a5b7f0adb69bba81 | 2025-10-30T21:17:31+05:30 | Shagun Bera | | common: fix typo in cli help text (#16864) |
| 64 | d261223d24e97f2df50220e4a5b7f0adb69bba81 | dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 | 2025-10-30T23:19:14+08:00 | JJJYmmm | | model: add support for qwen3vl series (#16780) |
| 65 | bacddc049a00786df44e682262f6e298742bfbc3 | 229bf686287d18f82c44e89888cc662145ecfdb4 | 2025-10-30T07:18:50-04:00 | Tianyue-Zhao | | model: Add support for CogVLM model (#15002) |
| 66 | 229bf686287d18f82c44e89888cc662145ecfdb4 | d7395115baf395b75a73a17b0b796e746e468da9 | 2025-10-30T08:56:28+01:00 | Sigbjørn Skjæret | | cuda : fix argsort with 64k+ rows (#16849) |
| 67 | 3464bdac37027c5e9661621fc75ffcef3c19c6ef | e3af5563bd049141e036b50f843196db33d23e97 | 2025-10-29T20:11:39+01:00 | Xuan-Son Nguyen | | llama: fix ASAN error with M-RoPE (#16848) |
| 68 | e3af5563bd049141e036b50f843196db33d23e97 | 10fcc41290e233788f5a4215314156e8e023eb92 | 2025-10-29T18:09:18+01:00 | Xuan-Son Nguyen | | llama: store mrope data in KV cell (#16825) |
| 69 | bcf5bda6f5df559565d11d7c8e8295c1159a85ec | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | 2025-10-29T14:39:03+01:00 | Ruben Ortlam | | Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536) |
| 70 | 9a3ea685b937c0f0cbfda2e50004ea54bf187512 | 338074c383c81366320d176d83b94b0a567ee0c2 | 2025-10-29T15:55:06+08:00 | Aman Gupta | | CUDA: Fix bug in topk-moe for gpt-oss (#16821) |
| 71 | 338074c383c81366320d176d83b94b0a567ee0c2 | 851553ea6b24cb39fd5fd188b437d777cb411de8 | 2025-10-29T08:14:39+02:00 | YaelLogic | | sycl: add RMS_NORM_BACK operation support (#16808) |
| 72 | 1c1409e13169d0ced4b1b4d39fb5b268b7525091 | 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e | 2025-10-28T03:51:41-07:00 | Sam Malayek | | embedding: add raw option for --embd-output-format (#16541) |
| 73 | ad8d36beffd791db10c94eb9e964afb891e3ca55 | c053e18a66dd95dc340aa61317877c2a41d4e3cf | 2025-10-28T03:50:33+02:00 | tamarPal | | sycl: add SSM_CONV operation support (#16800) |
| 74 | e1ab0848037c9f9bfe68b3e1cee9ee375e1018a3 | 5a4ff43e7dd049e35942bc3d12361dab2f155544 | 2025-10-27T23:12:16+01:00 | Xuan-Son Nguyen | | mtmd : fix idefics3 preprocessing (#16806) |
| 75 | 5a4ff43e7dd049e35942bc3d12361dab2f155544 | 10640e31aab0819f31c1e1f2d008b019ee737232 | 2025-10-27T13:51:28-07:00 | Diego Devesa | | llama : disable pipeline parallelism if compute buffer allocation fails (#16748) |
| 76 | 10640e31aab0819f31c1e1f2d008b019ee737232 | 80d28f104c0c3e61c11d6af073642b246a9fc19c | 2025-10-27T21:50:22+01:00 | Acly | | ggml : fix interpolate with align-corners and ne=1 (#16700) |
| 77 | 80d28f104c0c3e61c11d6af073642b246a9fc19c | c55d53acec864f64afa1ba92972203dce1bf88f5 | 2025-10-27T21:39:49+01:00 | Johannes Gäßler | | HIP: fix AMDGPU_TARGETS, update documentation (#16803) |
| 78 | 945501f5ea4b8ca56b181ecb035e9ee3fb31f432 | 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa | 2025-10-27T09:17:31+01:00 | Johannes Gäßler | | llama: fix leaked buffers for mmap + split files (#16765) |
| 79 | 75cbdd3fce38ea12d50cd19e73a069aa5dbbd5fa | 2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 | 2025-10-27T09:25:10+08:00 | Aman Gupta | | test-backend-ops: print failed tests at the end (#16785) |
| 80 | 2b9bd9bf4e759c05db629ec1c391dc8aeaa71887 | 59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f | 2025-10-27T03:20:24+02:00 | tamarPal | | sycl: add ROLL operation support (#16665) |
| 81 | 59fc1ec8e83b14354c1a3a8acf8c5c2cbf9af42f | 75d33b9302f84a5b89f82205d2bcd8def5a64e0a | 2025-10-27T03:19:50+02:00 | shani-f | | sycl: add REPEAT_BACK operation support (#16734) |
| 82 | bbac6a26b2bd7f7c1f0831cb1e7b52734c66673b | 73a48c9790d320476b3e5ef75bda09f2f8269e6e | 2025-10-27T02:13:31+08:00 | leejet | | ggml: fix cuda kernel launch configuration for k_compute_batched_ptrs to support large batch (#16744) |
| 83 | 3cfa9c3f125763305b4226bc032f1954f08990dc | 5d195f17bc60eacc15cfb929f9403cf29ccdf419 | 2025-10-26T06:37:38+02:00 | Gilad S. | | vulkan: deduplicate Microsoft Direct3D12 devices (#16689) |
| 84 | 5d195f17bc60eacc15cfb929f9403cf29ccdf419 | 226f295f4dd92ad714533adc5497afed5fa88bb8 | 2025-10-25T20:41:36+02:00 | Galunid | | convert : handle mmproj filename/path properly (#16760) |
| 85 | 55945d2ef51b93821d4b6f4a9b994393344a90db | 0bcb40b48c6fc6f17ba9672625e526ab2574344b | 2025-10-25T03:39:37+08:00 | leejet | | ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742) |
| 86 | 69e9ff010309a1155d704cf9320bdb3aaf4160ca | 5a91109a5d7dab5d7adc40bedb397ede99a705b1 | 2025-10-24T14:10:29+02:00 | Florian Badie | | webui: support q URL parameter (#16728) |
| 87 | 5a91109a5d7dab5d7adc40bedb397ede99a705b1 | f8f071faddf32ea09f4234edb6e809b380a9ee26 | 2025-10-24T12:02:02+02:00 | Daniel Bevenius | | model-conversion : add trust_remote_code for orig model run [no ci] (#16751) |
| 88 | f8f071faddf32ea09f4234edb6e809b380a9ee26 | 0bf47a1dbba4d36f2aff4e8c34b06210ba34e688 | 2025-10-23T16:31:41-04:00 | compilade | | convert : handle pre-quantized models (#14810) |
| 89 | dd62dcfab97e420949519fd0eac9fca7bf97e635 | d0660f237a5c31771a3d6d1030ebe3e0c409ba92 | 2025-10-23T15:54:46+02:00 | Julien Denize | | convert : Make mistral-common dependency optional (#16738) |
| 90 | d0660f237a5c31771a3d6d1030ebe3e0c409ba92 | fe6a9882acf5c02f96624ed8f80144100d7006cb | 2025-10-23T15:00:49+02:00 | Xuan-Son Nguyen | | mtmd-cli : allow using --jinja (#16718) |
| 91 | 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | 2025-10-22T20:05:15-05:00 | Matthew Michel | | sycl: use async memory allocation to fix crashes during graph recording (#16644) |
| 92 | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | a2e0088d9242bd9e57f8b852b05a6e47843b5a45 | 2025-10-22T13:47:09-07:00 | Max Krasnyansky | | Add experimental ggml-hexagon backend for the Hexagon NPU (#16547) |
| 93 | 9b9201f65a22c02cee8e300f58f480a588591227 | 19a5a3edfd306516cc419679d69d6435943b6816 | 2025-10-22T16:58:23+02:00 | Pascal | | webui: introduce OpenAI-compatible model selector in JSON payload (#16562) |
| 94 | d8eaa26e4d9228df3aa46a930db60c8eaab67c1b | 9285325ce0174631c3cd6121d56084adc4ef2d8f | 2025-10-22T12:01:22+02:00 | Acly | | tests : fix test-thread-safety when compiling with multiple backends (#16699) |
| 95 | 9285325ce0174631c3cd6121d56084adc4ef2d8f | 03792ad93609fc67e41041c6347d9aa14e5e0d74 | 2025-10-22T12:33:08+08:00 | Aman Gupta | | CUDA: fix bug in topk-moe softmax (#16711) |
| 96 | 51d1a8c997bd2629ef211a30208058ea87a30982 | 4926419c4d74a1cf724e7163d937eb72f36e7b26 | 2025-10-21T15:27:53+02:00 | Johannes Gäßler | | CUDA: better error for FA kernel with 0 occupancy (#16643) |
| 97 | 6ea37f57391d27736c35cd3c20c1f990b7952b74 | fb349848f387f355450c3187556e71e6d32c145f | 2025-10-20T22:26:17-07:00 | lhez | | opencl: fix warnings and clean up profiling (#16688) |
| 98 | 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | 2025-10-21T01:21:12+03:00 | YehuditE | | sycl : add PAD_REFLECT_D1 operator support (#16145) |
| 99 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | c9c1972e2c2cc6a771fcc145bfa138700179f961 | 2025-10-20T21:38:20+02:00 | Sigbjørn Skjæret | | model : add BailingMoeV2 support (#16063) |
| 100 | b617cfd2896edd592a36ebbc041817eb030a1005 | 79068501fac9a74cca7129a8e5a8281b410a853e | 2025-10-20T05:53:50-07:00 | Diego Devesa | | ggml-alloc : fix leak when reusing a tensor with a larger size (#16679) |
| 101 | 79068501fac9a74cca7129a8e5a8281b410a853e | 0e4a0cf2fae667d3efcf52f2f52398779d986b1d | 2025-10-20T14:21:12+02:00 | Aleksander Grygier | | Prevent premature submission on IME input (#16673) |
| 102 | 0e4a0cf2fae667d3efcf52f2f52398779d986b1d | 13f2cfad4170c096c51a02c24a6a158cb47f1480 | 2025-10-20T13:29:14+02:00 | Aleksander Grygier | | Import/Export UX improvements (#16619) |
| 103 | 13f2cfad4170c096c51a02c24a6a158cb47f1480 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 2025-10-20T12:41:13+02:00 | Aleksander Grygier | | Enable per-conversation loading states to allow having parallel conversations (#16327) |
| 104 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 72d53e6c4decee8b339e49aed8cc0e234b9639dc | 2025-10-20T16:27:09+08:00 | takuya kodama | | llama-batch: fix build fails with `-Werror=missing-braces` (#16614) |
| 105 | 2330de7b847ca84eac766df372c604c26db72747 | 7062dd8460685d6700ed7621e50a22c6f3400ca3 | 2025-10-20T11:08:32+03:00 | safranowith | | SYCL: Add support for FLOOR,CEIL,ROUND and TRUNC unary operators (#16613) |
| 106 | 7062dd8460685d6700ed7621e50a22c6f3400ca3 | 0398752dd450dfabdd1b9e289f6364c2600f6ab5 | 2025-10-20T15:44:21+08:00 | takuya kodama | | llama-context: only warn on pooling_type when user specified (#16674) |
| 107 | c20c0a5c0c44179f5267a262546624854b1203d1 | 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c | 2025-10-20T14:41:08+08:00 | Yunzhe Jia | | kv: turn on common-prefix mtmd: fix output size bug |
| 108 | 4f73d0a95120687e2c527739f771330a5271259a | cec5edbcaec69bbf6d5851cabce4ac148be41701 | 2025-10-20T05:06:39+08:00 | Aaron Teo | | ci : fix binaries release failure for s390x (binaries may not work yet) (#16664) |
| 109 | ee09828cb057460b369576410601a3a09279e23c | e56abd2098dd2e2b0804691b93c13b48ae421627 | 2025-10-18T14:47:32+02:00 | Johannes Gäßler | | HIP: fix GPU_TARGETS (#16642) |
| 110 | 81387858f1fbcc1acedbd308486e1016618ca8f8 | 66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c | 2025-10-17T17:55:32-07:00 | Shawn Gu | | opencl: transposed gemm/gemv moe kernel with mxfp4,f32 (#16602) |
| 111 | 66b0dbcb2d462e7b70ba5a69ee8c3899ac2efb1c | 41386cf365d894134ee0813d15e2f5d76f6a4d8e | 2025-10-17T17:41:09+02:00 | Johannes Gäßler | | llama-model: fix insonsistent ctxs <-> bufs order (#16581) |
| 112 | 41386cf365d894134ee0813d15e2f5d76f6a4d8e | 3d4e86bbeb15f487d6da6174ba6191b7c212cc25 | 2025-10-17T18:02:52+03:00 | Radoslav Gerganov | | rpc : report actual free memory (#16616) |
| 113 | 342c728d031d50673feded797520a44127d73379 | ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 | 2025-10-17T18:01:23+08:00 | muggle-stack | | ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629) |
| 114 | ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 | b19491599d4d42c606601d75e95c1d1de3291f8e | 2025-10-17T10:35:03+02:00 | Pascal | | webui: reorganize settings layout (#16607) |
| 115 | b19491599d4d42c606601d75e95c1d1de3291f8e | 9ad4f1931ee0f3b41d9355245ef744786aaae0aa | 2025-10-17T02:31:04-05:00 | Jeff Bolz | | vulkan: fix debug build (add_rms_len/data not found) (#16624) |
| 116 | 9ad4f1931ee0f3b41d9355245ef744786aaae0aa | 79967ec596c0dacfd2251b085a57e79df292b1cc | 2025-10-17T02:33:58-04:00 | Ilia Ilmer | | metal : add `CONV_TRANSPOSE_2D` (#16542) |
| 117 | ceff6bb253dd306f5404d7ccb3f11fadafe71b52 | 1bb4f43380944e94c9a86e305789ba103f5e62bd | 2025-10-17T05:36:40+03:00 | GittyBurstein | | SYCL SET operator optimized for F32 tensors (#16350) |
| 118 | 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf | b22572e97dc51757d3ebe917a5a283385010ec68 | 2025-10-16T16:28:41+02:00 | Pascal | | fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599) |
| 119 | 62425b3a7e8b169a3bbe6ce8c7324513a7fcee8c | 76a63a2998286c1649de2496bccb7d8a46549895 | 2025-10-16T17:34:39+08:00 | Yunzhe Jia | | kv: let seq_rm free whole seq since current hw-op cannot support common-prefix |
| 120 | 7a50cf388a530127cbbdd2a507ef81a451c9d819 | 6f5d924637a15abedb111cbbffd7da5f31c81855 | 2025-10-16T16:41:11+08:00 | Chenguang Li | | CANN: format code using .clang-format (#15863) |
| 121 | 76a63a2998286c1649de2496bccb7d8a46549895 | b67217078aa748b06e1b2269d88dd18c0aca2c26 | 2025-10-16T16:31:15+08:00 | Yunzhe Jia | | kv: fix common-prefix bug by implementing llama_memory_seq_rm |
| 122 | 6f5d924637a15abedb111cbbffd7da5f31c81855 | adc9b60f190c1016a09f439862fa1cbb302262ac | 2025-10-16T01:11:33-04:00 | takasurazeem | | common : Update the docs on -t --threads (#16236) |
| 123 | adc9b60f190c1016a09f439862fa1cbb302262ac | ee50ee1eadff58777ae746827b04de7ba0befc55 | 2025-10-16T13:10:32+08:00 | takuya kodama | | ggml-cpu: replace putenv with setenv for const-correctness (#16573) |
| 124 | ee50ee1eadff58777ae746827b04de7ba0befc55 | 7adc79c03234de9a20661fd6dbf2d02c32ca7acb | 2025-10-16T07:21:28+03:00 | yael-works | | SYCL: Add GGML_OP_MEAN operator support (#16009) |
| 125 | 7adc79c03234de9a20661fd6dbf2d02c32ca7acb | 466c1911ab736f0b7366127edee99f8ee5687417 | 2025-10-15T22:43:08+02:00 | Aleksei Nikiforov | | gguf-py : add support for endian conversion of BF16 data (#16594) |
| 126 | 0cb7a0683b0529172472d74d21f05470a607f297 | d93f8439b08c4f35e13a41a7366901fdbe770fc8 | 2025-10-15T10:51:04-07:00 | lhez | | opencl: add q8_0 mm support (#16469) |
| 127 | d93f8439b08c4f35e13a41a7366901fdbe770fc8 | f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb | 2025-10-15T10:48:28-07:00 | lhez | | opencl: fix FA for f32 (#16584) |
| 128 | f9fb33f2630b4b4ba9081ce9c0c921f8cd8ba4eb | f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 | 2025-10-15T16:22:20+02:00 | Aleksander Grygier | | Add server-driven parameter defaults and syncing (#16515) |
| 129 | f4ce81c45e7bd910e36bf44c253fc5255c49b1e4 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 2025-10-15T23:05:56+09:00 | Sam/Samuel | | metal: optimise `GGML_OP_SUM` (#16559) |
| 130 | 17304cbcc1dd24de7741cbe57925d58e90a98ac1 | 3e3cb19f6449f9168a128eaeae01f8f41b049acc | 2025-10-15T16:53:12+03:00 | Georgi Gerganov | | server : fix img token logs (#16595) |
| 131 | 3e3cb19f6449f9168a128eaeae01f8f41b049acc | 5acd455460f457942d8dd02e3dd9b1eebfce99fe | 2025-10-15T14:48:08+02:00 | Xuan-Son Nguyen | | llama-quant: add support for mmproj (#16592) |
| 132 | 5acd455460f457942d8dd02e3dd9b1eebfce99fe | 554fd578a5ed78a10f371f5850c6a69aa83df15a | 2025-10-15T13:54:15+02:00 | Julius Tischbein | | CUDA: Changing the CUDA scheduling strategy to spin (#16585) |
| 133 | 554fd578a5ed78a10f371f5850c6a69aa83df15a | fa882fd2b1bcb663de23af06fdc391489d05b007 | 2025-10-15T12:51:27+03:00 | Georgi Gerganov | | server : fix mtmd checkpoints (#16591) |
| 134 | fa882fd2b1bcb663de23af06fdc391489d05b007 | ffa059034c1e41f3e58363ef3c46d2fcf854bc4d | 2025-10-14T20:33:05+03:00 | Georgi Gerganov | | metal : avoid using Metal's gpuAddress property (#16576) |
| 135 | 120bf7046d85a893f064c12abe58bfeebd735f84 | 4258e0cfe72c72ad2787be1e9f93253e89219455 | 2025-10-14T22:48:08+08:00 | Aman Gupta | | CUDA + openCL: fix bug in accessing rms_norm->src while doing fusion (#16577) |
| 136 | 1ee9d0b415cdf5240418c110a18b419f4002b154 | 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 | 2025-10-14T19:16:21+08:00 | Aman Gupta | | CUDA: use fastdiv + ggml_cuda_mad for mmvf (#16557) |
| 137 | 48e2fa9fb7c2de1e53808fdb65ec33f916020fc4 | 5b6913c47b6bc71a6f927805a45387d5657d8b89 | 2025-10-14T19:15:15+08:00 | Aman Gupta | | CUDA: add fp kernel for larger batch size MoE (#16512) |
| 138 | e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 | 5016b7286240d29f8f640039989b84ea3a854344 | 2025-10-13T22:42:37+03:00 | Georgi Gerganov | | graph : support cacheless embeddings with FA and iSWA (#16528) |
| 139 | 5016b7286240d29f8f640039989b84ea3a854344 | 7049736b2dd9011bf819e298b844ebbc4b5afdc9 | 2025-10-13T11:50:37-07:00 | lhez | | opencl: fix build targeting CL 2 (#16554) |
| 140 | 7049736b2dd9011bf819e298b844ebbc4b5afdc9 | 01d2bdc2bc61b676706830305b286b08b9885a41 | 2025-10-13T16:29:45+02:00 | Johannes Gäßler | | CUDA: fix numerical issues in tile FA kernel (#16540) |
| 141 | 01d2bdc2bc61b676706830305b286b08b9885a41 | 56fc38b9655fbe1869d8bd6cfb269418196cea69 | 2025-10-13T20:48:47+08:00 | Jie Fu (傅杰) | | ggml : fix build broken with -march=armv9-a on MacOS (#16520) |
| 142 | 56fc38b9655fbe1869d8bd6cfb269418196cea69 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 2025-10-13T17:01:24+08:00 | Chenguang Li | | CANN: fix CPU memory leak in CANN backend (#16549) |
| 143 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 | 2025-10-13T10:55:32+02:00 | Pascal | | fix: add remark plugin to render raw HTML as literal text (#16505) |
| 144 | c515fc577166042234241c6bd0da9b08dcbe2bb9 | f9bc66c3ebcfddb5f09e4b21253623caeb8e414a | 2025-10-13T11:22:27+03:00 | Georgi Gerganov | | ggml : fix scalar path for computing norm (#16558) |
| 145 | f9bc66c3ebcfddb5f09e4b21253623caeb8e414a | a31cf36ad946a13b3a646bf0dadf2a481e89f944 | 2025-10-13T08:52:22+08:00 | hipudding | | CANN: Update several operators to support FP16 data format (#16251) |
| 146 | a31cf36ad946a13b3a646bf0dadf2a481e89f944 | 81d54bbfd599811b354c39f04550888168be7780 | 2025-10-13T02:43:14+08:00 | Sam/Samuel | | metal : add opt_step_adamw and op_sum (#16529) |
| 147 | 81d54bbfd599811b354c39f04550888168be7780 | c7be9febcbafa9af7d1b9443f86475c59c9c5f87 | 2025-10-12T18:06:41+02:00 | Pascal | | webui: remove client-side context pre-check and rely on backend for limits (#16506) |
| 148 | c7be9febcbafa9af7d1b9443f86475c59c9c5f87 | 8415f61e23d04427cd0d912fbb9d33b85f849456 | 2025-10-12T21:53:35+08:00 | Neo Zhang Jianyu | | [SYCL] fix UT fault cases: count-equal, argsort, pad OPs (#16521) |
| 149 | 8415f61e23d04427cd0d912fbb9d33b85f849456 | 2c301e91abb92d03c1a682b4b540ba835562a74b | 2025-10-12T15:48:03+02:00 | Mathieu Baudier | | ci : add Vulkan on Ubuntu with default packages build (#16532) |
| 150 | 4b2dae383df708e2afc49c4859a81cd074f5ac10 | 41aac5c69b5fb281bc1f486afb053f78101bb39e | 2025-10-12T09:29:13+03:00 | Georgi Gerganov | | common : update presets (#16504) |
| 151 | 41aac5c69b5fb281bc1f486afb053f78101bb39e | a2fba89a426ff8005d303c73f0436e7e67368b70 | 2025-10-12T00:25:37-05:00 | sirus20x6 | | ggml : Fix FP16 ELU positive branch (#16519) |
| 152 | a2fba89a426ff8005d303c73f0436e7e67368b70 | 20cc625edc2264aae2779e71bef1593e6a4e8c43 | 2025-10-12T07:19:06+02:00 | Daniel Bevenius | | hparams : add check for layer index in is_recurrent (#16511) |
| 153 | 20cc625edc2264aae2779e71bef1593e6a4e8c43 | 11f0af5504252e453d57406a935480c909e3ff37 | 2025-10-12T00:15:00-05:00 | sirus20x6 | | ggml: Correct SVE implementation in ggml_vec_dot_f16_unroll (#16518) |
| 154 | a3cb04744fb5c591985f53b749fef5407d07a145 | 4a8fbe0a5eb75f339782ebcf29c17848122184d3 | 2025-10-11T16:54:10+03:00 | Georgi Gerganov | | metal : fix mul-mm condition + fix mul-mv permuted kernels (#16494) |
| 155 | 4a8fbe0a5eb75f339782ebcf29c17848122184d3 | 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b | 2025-10-11T15:50:49+02:00 | Pascal | | feat: render user content as markdown option (#16358) |
| 156 | 31d0ff1869aa2ea31f4e96d5877d0343e9a2171b | 97870e64975b26c5e06a3540a8dc0ff601351e86 | 2025-10-11T21:39:04+08:00 | Yann Follet | | server / ranking : add sorting and management of top_n (#16403) |
| 157 | 477a66b03501cf3bd067f8968b77ca4d053ff1bd | e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e | 2025-10-11T11:33:41+03:00 | amirai21 | | convert : correctly handle LLaMA tokenizer for Jamba (#16470) |
| 158 | e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e | 81086cd6a3ca1252f0dc0f938171648399179c53 | 2025-10-10T22:15:05+03:00 | Georgi Gerganov | | server : fix division by zero when reporting stats (#16501) |
| 159 | 68ee98ae181a5c83a5cc6261daeee69a1f588c15 | cdb6da468cc33323955a523738d2e1675aeb5e9a | 2025-10-10T17:11:07+03:00 | Radoslav Gerganov | | server : return HTTP 400 if prompt exceeds context length (#16486) |
| 160 | 1faa13a1187051af66b0fd9f0d6effe4c77f0b3e | 1deee0f8d494981c32597dca8b5f8696d399b0f2 | 2025-10-09T22:54:57+02:00 | Pascal | | webui: updated the chat service to only include max_tokens in the req… (#16489) |
| 161 | d00cbea63c671cd85a57adaa50abf60b3b87d86f | 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f | 2025-10-09T18:54:51+03:00 | Georgi Gerganov | | server : host-memory prompt caching (#16391) |
| 162 | 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f | 56b4795842d852152222ca7a2d4304008facf1b9 | 2025-10-09T17:36:29+02:00 | Pascal | | No markdown in cot (#16483) |
| 163 | 56b4795842d852152222ca7a2d4304008facf1b9 | 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 | 2025-10-09T14:35:22+02:00 | Daniel Bevenius | | model-conversion : add support for SentenceTransformers (#16387) |
| 164 | b2602137557b2b28a39e03612717d85ead9a6f5a | e08db4259521de493b7aeb49dadf29ebd1ee966a | 2025-10-09T15:25:11+08:00 | Neo Zhang Jianyu | | [SYCL] refactor soft_max, add soft_max_back (#16472) |
| 165 | e08db4259521de493b7aeb49dadf29ebd1ee966a | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 2025-10-09T08:39:18+02:00 | Saba Fallah | | model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367) |
| 166 | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 9d0882840e6c3fb62965d03af0e22880ea90e012 | 2025-10-08T22:18:41+02:00 | Pascal | | refactor: centralize CoT parsing in backend for streaming mode (#16394) |
| 167 | d2ee056e1df0fdf646270fb5621e9f92084b59a7 | b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e | 2025-10-08T17:20:18+09:00 | issixx | | server : fix cancel pending task (#16467) |
| 168 | b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e | 7fdd16b432d247121fe5fe7b21f8805f85266c85 | 2025-10-08T10:57:53+03:00 | Georgi Gerganov | | metal : mark FA blocks (#16372) |
| 169 | 74b8fc17f92ada295a648e3c5eb28f46bca7d892 | aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e | 2025-10-07T13:48:56-07:00 | Reese Levine | | ggml webgpu: profiling, CI updates, reworking of command submission (#16452) |
| 170 | aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e | df1b612e29ba97a2e67db339b1e8c7465702b7e8 | 2025-10-07T20:03:35+02:00 | Tarek Dakhran | | llama : support LiquidAI LFM2-MoE hybrid model (#16464) |
| 171 | 4e0388aa8a1f4ef1065701dc9c3947aea0a1b9a5 | ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 | 2025-10-07T11:11:08+02:00 | Sascha Rogmann | | webui : added download action (#13552) (#16282) |
| 172 | ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 | c61ae20d05bd4fdd8551311325a2845336449426 | 2025-10-07T10:32:32+03:00 | Georgi Gerganov | | presets : fix pooling param for embedding models (#16455) |
| 173 | 3df2244df40c67dfd6ad548b40ccc507a066af2b | c08002a1988348403a5fd59b1fa3de3a10a6f92f | 2025-10-06T12:55:53-05:00 | Gadflyii | | llama : add --no-host to disable host buffers (#16310) |
| 174 | c08002a1988348403a5fd59b1fa3de3a10a6f92f | 3a002afafa8e06555f11aed88b02d055d8a166f3 | 2025-10-06T10:59:40-06:00 | Gabe Goodhart | | chat : Granite Docling stopping (#16438) |
| 175 | a23b9bdbd3b64ce172f9962249f432d01aea7437 | 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 | 2025-10-06T16:05:27+03:00 | Georgi Gerganov | | ggml : fix unaligned access in AMX code (#16315) |
| 176 | 04e632a4aab8e6bfff0f8bc216b36ceb1e199ff9 | a80ff183abe4e5a76316257ffa597da41b3b6fa0 | 2025-10-06T14:56:59+02:00 | Daniel Bevenius | | ci : remove missing reranker model files (#16444) |
| 177 | a80ff183abe4e5a76316257ffa597da41b3b6fa0 | 1d49ca37594fb49db6aa9518ba7c512e5ccd0108 | 2025-10-06T14:17:12+02:00 | Daniel Bevenius | | ggml-cpu : fix leftover handling in ggml_vec_scale_f32 for SVE (#16443) |
| 178 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 2025-10-05T06:57:47-06:00 | Gabe Goodhart | | model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) |
| 179 | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 86df2c9ae4f2f1ee63d2558a9dc797b98524639b | 2025-10-04T20:59:31-07:00 | Reese Levine | | ggml webgpu: actually add softmax, fix rms_norm offset (#16400) |
| 180 | 86df2c9ae4f2f1ee63d2558a9dc797b98524639b | f39283960b58a92ecc0c72567711318b20e22b55 | 2025-10-04T20:04:27Z | Eve | | vulkan: use a more appropriate amount of threads when generating shaders (#16418) |
| 181 | 898acba6816ad23b6a9491347d30e7570bffadfd | e29acf74fea996014380d59d31aa504ae8964258 | 2025-10-04T12:49:16+03:00 | Radoslav Gerganov | | rpc : add support for multiple devices (#16276) |
| 182 | e29acf74fea996014380d59d31aa504ae8964258 | 128d522c04286e019666bd6ee4d18e3fbf8772e2 | 2025-10-04T11:42:56+02:00 | Acly | | vulkan : incremental shader builds (#16341) |
| 183 | f6dcda390004b627ef30af378d0c01ad2519289e | 606a73f53175077429484b23dcf799f69a31d0bd | 2025-10-03T13:34:51-05:00 | ddh0 | | server : context checkpointing for hybrid and recurrent models (#16382) |
| 184 | 606a73f53175077429484b23dcf799f69a31d0bd | 946f71ed9ade07e319859b5ce656144140e066fb | 2025-10-03T19:18:56+03:00 | Georgi Gerganov | | metal : fix loop bound in ggml_mem_ranges (#16412) |
| 185 | 946f71ed9ade07e319859b5ce656144140e066fb | 638d330246954e88dffc22ce01fec15e6894e544 | 2025-10-03T14:40:25+02:00 | Sigbjørn Skjæret | | llama : fix shapes for bert/mpt q/k norm (#16409) |
| 186 | 638d330246954e88dffc22ce01fec15e6894e544 | 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 | 2025-10-03T13:49:08+02:00 | Acly | | ggml : fix graph reallocation with multiple chunks (#16396) |
| 187 | 84c8e305e8010a1a3d43bdd0a25f737ac67809a4 | 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 | 2025-10-03T12:51:40+02:00 | Aleksander Grygier | | Fix missing messages on sibling navigation (#16408) |
| 188 | 2aaf0a2a2056d75d0dd53ab8a181473760e6ab22 | 0e1f83855609d73beaf05d818640b6cfd39d287b | 2025-10-03T05:50:46-05:00 | Jeff Bolz | | vulkan: Replace uses of maxMemoryAllocationSize and VK_WHOLE_SIZE (#16354) |
| 189 | 0e1f83855609d73beaf05d818640b6cfd39d287b | ad126479c25cf983a0f994a08ba0911cf49ed62b | 2025-10-03T04:52:46-05:00 | Jeff Bolz | | vulkan: Fix FA coopmat1 invalid array indexing (#16365) |
| 190 | ad126479c25cf983a0f994a08ba0911cf49ed62b | 77233277c912d495d1069543ca540c21a2f9e5b4 | 2025-10-03T11:45:16+02:00 | Daniel Bevenius | | ci : change macos-13 to macos-15-intel (#16401) |
| 191 | 136bda78c5679b266362b39c58338fff46fd2592 | 5113efd34ceda709292de26c72716c49e024fb32 | 2025-10-03T09:11:34+02:00 | Aleksander Grygier | | webui : Fix messages payload sent to chat completions (#16402) |
| 192 | 5113efd34ceda709292de26c72716c49e024fb32 | d64c8104f090b27b1f99e8da5995ffcfa6b726e2 | 2025-10-03T08:01:31+02:00 | Pascal | | fix: track viewportHeight via window.innerHeight to avoid unwanted scrolling (#16356) |
| 193 | ef07a4090672a3438d7f64f197795d7dc1c18957 | 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 | 2025-10-02T11:00:31-07:00 | Reese Levine | | ggml webgpu: add support for soft_max, optimize rms_norm (#16357) |
| 194 | 34fcc5a4ace8c69476ef2ea3857f39a60334acc4 | 91a2a5655658bb9ab77894716b82fae7ecb4b4d1 | 2025-10-02T19:43:22+02:00 | Piotr Wilkin (ilintar) | | model : Apertus model implementation (#15852) |
| 195 | 72ee736c447be4ededb51ab97904b4d33c90c261 | f09aefaa84d7f4d5df3f400f67944b94fef5b795 | 2025-10-02T13:51:36+02:00 | Sigbjørn Skjæret | | ci : fix ubuntu-latest-cmake-rpc (disable ccache) (#16388) |
| 196 | bbd32bc0384fbfcf07369617de58856b1e0e95a3 | 2be72c2b121ee99f33927149265ce6073ade9e59 | 2025-10-02T10:35:43+03:00 | Georgi Gerganov | | ci : fix clean-up of old logs (#16381) |
| 197 | 2be72c2b121ee99f33927149265ce6073ade9e59 | 95ce0985449c52fb9d6849b95563f7cf933ea0e3 | 2025-10-02T15:16:25+08:00 | Neo Zhang Jianyu | | SYCL: Update to oneAPI 2025.2 (#16371) |
| 198 | e95fec640f43623911a2cd5bda8b19b1898c530c | ded67b94446ef4f7fd988dbde7a12deef9870c13 | 2025-10-01T23:09:25+02:00 | uvos | | HIP: Disable ROCWMMA fattn on CDNA when compiled against ROCWMMA 2.0.0 (#16221) |
| 199 | ded67b94446ef4f7fd988dbde7a12deef9870c13 | 1fe4e38cc20af058ed320bd46cac934991190056 | 2025-10-02T06:08:15+09:00 | Shunta Saito | | llama : parameter conversion and loading fixes for PLaMo2 variants (#16075) |
| 200 | 4201deae9c2ae4732db8957b6ce0808d02ec597c | 764799279f801c696503bacca490b4358587d94c | 2025-10-01T19:22:18+02:00 | Adrien Gallouët | | common: introduce http.h for httplib-based client (#16373) |
| 201 | 764799279f801c696503bacca490b4358587d94c | 2a9b63383a448ec18c754dfdc6e95cb853940a52 | 2025-10-01T18:18:10+02:00 | Aleksander Grygier | | Conversation action dialogs as singletons from Chat Sidebar + apply conditional rendering for Actions Dropdown for Chat Conversation Items (#16369) |
| 202 | 132d673554e65282e92505f4f77401ab971528bb | aa9538a63aef35f0224b2502f13b19d650a8ce04 | 2025-10-01T07:56:36Z | Eve | | vulkan: make ggml_vk_default_dispatcher support older vulkan headers (#16345) |
| 203 | b2ba81dbe07b6dbea9c96b13346c66973dede32c | bf6f3b3a1965d70e07ca94aab7b01268fe483e96 | 2025-09-30T21:41:42+02:00 | Sigbjørn Skjæret | | ci : fix ccache key for ubuntu-cpu-cmake (#16355) |
| 204 | 16b0ca0d2e63fc1a0a43795f8552f9cb61d9f7a5 | 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed | 2025-09-30T19:18:54+02:00 | Pascal | | Chatapi ignore empty sampling (#16330) |
| 205 | 8d78cd2613ccdeb3cc86f59bc8f9ddd31cfbd3ed | d1c84a662daa91be975863913a59975b11458141 | 2025-09-30T09:57:51-07:00 | Reese Levine | | ggml webgpu: support for rope,div,sub,glu,scale,cont operators (#16187) |
| 206 | a014310374a16f9204f2bcc1b458fc1eda67e469 | 35fb82497ec6c5904b0adb7e1c881a76c1c692db | 2025-09-30T08:13:22Z | anavp-nvidia | | cuda : Enable CUDA Graph usage for Nemotron Nano v2 (NemotronH) (#16328) |
| 207 | f1eb1cb1eba042b2d583234e80f65e2e225d8995 | de41f2b7bffab7582944b213ce12b605f8cf6e0f | 2025-09-30T09:07:20+02:00 | Charles Xu | | kleidiai : fix work size and threads sync for fp16 (#16246) |
| 208 | a74a0d69f34f52fa10d4f0a7ce749fb3490d0774 | 5f7e166cbf7b9ca928c7fad990098ef32358ac75 | 2025-09-29T19:26:34-05:00 | Jeff Bolz | | tests: override test_set_rows::max_nmse_err to allow for occasional rounding differences (#16295) |
| 209 | 5f7e166cbf7b9ca928c7fad990098ef32358ac75 | d72f5f7ba260b546190338b0b76f2f152581424f | 2025-09-29T18:49:47+02:00 | Pascal | | Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326) |
| 210 | d72f5f7ba260b546190338b0b76f2f152581424f | b77e6c18e1a6fac5705ed95f03af5436d67484c1 | 2025-09-29T17:51:48+03:00 | Georgi Gerganov | | ci : add AMD runners and workflows (#16249) |
| 211 | b77e6c18e1a6fac5705ed95f03af5436d67484c1 | 2ddd3f2356c313385fafc19a9f0ce678c8fe03ee | 2025-09-29T22:50:44+08:00 | alex-spacemit | | ggml: riscv: add riscv spacemit backend (#15288) |
| 212 | 4d3d455d3c8719eb8f206de328d1b9ba191efd7c | c9b1c06467aca8d30fafcab51292bcb285df5b0d | 2025-09-29T16:49:11+03:00 | Georgi Gerganov | | sync : whisper.cpp (ggml/1359) |
| 213 | c9b1c06467aca8d30fafcab51292bcb285df5b0d | b6ae75afb49b23db3dfbc2b01e8aabfb047e6880 | 2025-09-26T17:34:42+02:00 | Daniel Bevenius | | ggml : remove -dev suffix from release version (ggml/1355) |
| 214 | 02463ab27b1379ff5e3d936ce8b3bfd356872ea6 | adc76347d73b3d915e946efa5de8d0ad9f3904c2 | 2025-09-29T13:17:09+02:00 | Rafal Lewczuk | | ggml-backend : add root cause in error message if loading backend library fails (#16172) |
| 215 | 3a2bdcda0b31e51db954551e0cd49424133a84f3 | 66bb7985c3fcefda7a74aae9f8321f70eb1646c4 | 2025-09-29T10:37:20+02:00 | Aleksander Grygier | | Improve Mobile UI for dialogs and action dropdowns (#16222) |
| 216 | 66bb7985c3fcefda7a74aae9f8321f70eb1646c4 | 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 | 2025-09-29T09:08:41+02:00 | Pascal | | fix: preserved zero values in chat settings inputs and textareas by switching to nullish coalescing for field values and default placeholders (#16312) |
| 217 | 2f61c0f5bf8a620ca4c3872408803ab38cfb9613 | 3ffd0fae473c954bb3e67526b31262048fb508d4 | 2025-09-29T12:33:12+05:30 | Vinkal | | llama-cli: prevent spurious assistant token (#16202) |
| 218 | a4a0aa5ea2a88e4858996199fefd5439f17b481c | 92cd103f627015a95f2107f1c27dc218c7b8ec64 | 2025-09-29T08:41:28+03:00 | Georgi Gerganov | | ggml : fix dependencies for ggml_set_rows (#16318) |
| 219 | 92cd103f627015a95f2107f1c27dc218c7b8ec64 | b887d2f3413ac231e3cb5925260c39902af4a70c | 2025-09-28T23:50:37-05:00 | Jeff Bolz | | vulkan: Fix validation failure in quantized flash attention (#16292) |
| 220 | b887d2f3413ac231e3cb5925260c39902af4a70c | bd0af02fc96c2057726f33c0f0daf7bb8f3e462a | 2025-09-28T23:15:03+02:00 | Sigbjørn Skjæret | | ggml : fix GGML_F32_VEC_FMA argument order in ggml_vec_mad1_f32 (#16307) |
| 221 | bd0af02fc96c2057726f33c0f0daf7bb8f3e462a | d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 | 2025-09-28T14:13:50-04:00 | crat0z | | common : fix reasoning before forced tool call via tool_choice = required (#16264) |
| 222 | d9e0e7c8194dfd7d23bf3a86608c9ece68d77c93 | 0124ac989f7e7bf08803788f66dbe4106bdcdd58 | 2025-09-28T22:38:15+08:00 | R0CKSTAR | | ci : fix musa docker build (#16306) |
| 223 | 2811c65286ae954bec87049f75b86dc022006dcc | d8359f5fde480da030bf75c7711573c7c4d993ba | 2025-09-28T12:04:46+01:00 | Imad Saddik | | Fixed a few typos in the README of the LLaMA.cpp HTTP Server [no ci] (#16297) |
| 224 | d8359f5fde480da030bf75c7711573c7c4d993ba | 6a2c6145a0b91b40eb3c3dba7b20ccc4b270490f | 2025-09-28T01:38:37-05:00 | Jeff Bolz | | vulkan: 64-bit im2col (#16135) |
| 225 | 1384abf8b8d5894d32fada453ccf4d196ffba7de | e6d65fb02d553bd79cad94e517cdca18b687788d | 2025-09-27T20:36:34-05:00 | Jeff Bolz | | vulkan: handle mat_mul with A matrix > 4GB (#16176) |
| 226 | e6d65fb02d553bd79cad94e517cdca18b687788d | 8656f5de688cddcaea1d6174535eb60ee23ef6a0 | 2025-09-27T16:43:39-04:00 | Jeff Bolz | | vulkan: support arbitrary KV dimension in flash attention (#16160) |
| 227 | 8656f5de688cddcaea1d6174535eb60ee23ef6a0 | 4807e8f96a61b2adccebd5e57444c94d18de7264 | 2025-09-27T22:41:03+02:00 | Acly | | vulkan : make the vulkan.hpp dynamic dispatcher instance private (#16224) |
| 228 | 4807e8f96a61b2adccebd5e57444c94d18de7264 | c0bfc57af421f8fd63c946c13b7666aed82560e2 | 2025-09-27T19:56:40+02:00 | Aleksander Grygier | | Show message actions by default (#16289) |
| 229 | 0499b29c6f64c705faaf5860dc4600fca23671f4 | 234e2ff8ed09716fb553437596779399bee31b11 | 2025-09-27T19:26:46+03:00 | Dmytro Minochkin | | vulkan: throw system error instead of SIGABRT during init on older devices (#16156) |
| 230 | 3f81b4e91c1d5f098148af117e3f13cf4b077f52 | ace6a54565444b6377bee8e7ac693238e7766279 | 2025-09-27T06:36:11-04:00 | Jeff Bolz | | vulkan: support GET_ROWS for k-quants (#16235) |
| 231 | ace6a54565444b6377bee8e7ac693238e7766279 | 72b24d96c6888c609d562779a23787304ae4609c | 2025-09-27T11:12:46+02:00 | Adrien Gallouët | | build : add LLAMA_OPENSSL option (#16287) |
| 232 | 72b24d96c6888c609d562779a23787304ae4609c | 624207e676ab5eb3ce7af631902bb45fb73a8359 | 2025-09-27T02:58:29+05:30 | Vinkal | | model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273) |
| 233 | 624207e676ab5eb3ce7af631902bb45fb73a8359 | 807e8c6d310952f2f5656afc63dab9d7083dcb5c | 2025-09-27T02:03:33+08:00 | Aaron Teo | | devops: add s390x & ppc64le CI (#15925) |
| 234 | 1a189278944d030211f336e103e96b65f976c361 | e0539eb6aed346d4b25a6ea019044e88771e7690 | 2025-09-26T18:35:42+02:00 | Aleksander Grygier | | Allow viewing conversations even when llama server is down (#16255) |
| 235 | e0539eb6aed346d4b25a6ea019044e88771e7690 | 5d0a40f390732cbf85d8a3b7b0fc3cbebffe780a | 2025-09-26T11:36:48-04:00 | Isaac McFadyen | | webui: switch to hash-based routing (alternative of #16079) (#16157) |
| 236 | cc1cfa277b3aae1f6cc9180472072336597a78d4 | 54dbc37053f7d75ea5b0631d5ee88f19391e4314 | 2025-09-26T15:00:44+02:00 | Aleksei Nikiforov | | mtmd : fix uninitialized variable in bicubic_resize (#16275) |
| 237 | 54dbc37053f7d75ea5b0631d5ee88f19391e4314 | b995a10760cb93d23d617d76ecb82a5f95b5e0d3 | 2025-09-26T14:14:28+03:00 | Georgi Gerganov | | metal : report OOM errors (#16274) |
| 238 | 4710dd31bbcef79d04f85a3a6a8c7d9439c5c79a | 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e | 2025-09-26T12:39:35+02:00 | Adrien Gallouët | | build : fix build-ios-device (#16257) |
| 239 | 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e | 00217cd41388328c93e9e9644921c4319bb03bcc | 2025-09-26T18:27:25+08:00 | Aaron Teo | | ggml-cpu: implement MXFP4 SIMD for s390x (#16193) |
| 240 | 0f7c69689f4e681948a6005adea9bee9c08ff903 | 835b2b915c52bcabcd688d025eacff9a07b65f52 | 2025-09-26T08:56:10+08:00 | R0CKSTAR | | musa: fix build warnings (#15611) |
| 241 | 835b2b915c52bcabcd688d025eacff9a07b65f52 | b05a9d650f4da1e70e7e2cbe8fe44e61b39656db | 2025-09-25T19:50:28+02:00 | Sigbjørn Skjæret | | model : add GroveMoE support (#15510) |
| 242 | 077c94d0caf87fbd3cf3288dbb5c0fd9670294cf | aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 | 2025-09-25T22:35:05+08:00 | Aman Gupta | | CUDA: add a fused top-K MoE kernel (#16130) |
| 243 | d0991da39d3c39b3980c24cdfccb9a4c95a46870 | aa719c2f886c445b78113bf1e5849f1fce4124a7 | 2025-09-25T11:36:47+02:00 | Daniel Bevenius | | server : add support for external server for tests (#16243) |
| 244 | aa719c2f886c445b78113bf1e5849f1fce4124a7 | 4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 | 2025-09-25T17:22:55+08:00 | junchao-zhao | | ggml : fix loongarch lsx compilation error (#15864) |
| 245 | 4cdd0bb4537f9617e9efcfef6b9454fcefe2ff08 | b5bd037832bcb8ed3086dfe26ce9090bea989af1 | 2025-09-25T11:12:27+02:00 | Johannes Gäßler | | docs: fix typo [no ci] (#16244) |
| 246 | dfcd53f7ecb9bb897a9d752d09c59d10be47237a | 4ea00794b8c995b6deaf4bac159c1778dc27419a | 2025-09-25T11:30:16+03:00 | Georgi Gerganov | | metal : fuse NORM + MUL + ADD, support non-multiples of 4 (#16220) |
| 247 | c498fc82fe5b83fc8c6e1627286bdc1f93caddbf | e7a5130a20cf45a3358308356c249734ca982143 | 2025-09-25T10:20:02+03:00 | Radoslav Gerganov | | rpc : use ggml logging facilities |
| 248 | bee378e0988b44bbe93b0768208080951b312363 | 5fb557653b8756ac2b6c6a102b1e44abcadf552f | 2025-09-25T05:06:06Z | Eve | | ci: run the x64 and arm ci on the github machines instead (#16183) |
| 249 | 5fb557653b8756ac2b6c6a102b1e44abcadf552f | 4ae88d07d026e66b41e85afece74e88af54f4e66 | 2025-09-25T11:36:30+08:00 | Aaron Teo | | devops: fix s390x docker release failure (#16231) |
| 250 | f2a789e33490deb483a2694b066b37e45524bb79 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 2025-09-24T16:17:49+02:00 | Acly | | ggml : split graph allocations according to backend max buffer size (#15815) |
| 251 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 63b54c81a620981be020184ab99e63a8e50e47cb | 2025-09-24T13:42:26+02:00 | Tarek Dakhran | | model : add label for LiquidAI LFM2-2.6B model (#16204) |
| 252 | 7735706b939847df2c6c00b44c36f95a20137c61 | 4d9ea03d170cf504a40bf3a85788af84cccaee80 | 2025-09-24T14:46:52+08:00 | Jie Fu (傅杰) | | model-conversion : run-org-model.py fails to run on mac m1 (#16213) |
| 253 | 4d9ea03d170cf504a40bf3a85788af84cccaee80 | 8ba548dae251f8f2e3834ed5226b76b6e4f4a485 | 2025-09-24T08:10:09+02:00 | Daniel Bevenius | | codeowners : use slash prefix for root files [no ci] (#16210) |
| 254 | 8ba548dae251f8f2e3834ed5226b76b6e4f4a485 | f505bd83ca7a43c4585ff3d59135e77eae9c793b | 2025-09-24T12:19:23+08:00 | Jie Fu (傅杰) | | model-conversion : fix the make targets in the README.md (#16209) |
| 255 | f505bd83ca7a43c4585ff3d59135e77eae9c793b | 0889589dbe8c67dd518c58a57afbb02dde2dccbe | 2025-09-23T20:41:40+03:00 | Georgi Gerganov | | ci : disable AMD workflows + update NVIDIA workflows (#16200) |
| 256 | f6b4af3d04763b1e0130f5b5fce19c4bc6f83f1c | 264f1b51872c125e23fa0ac1da5e2a1170de9a08 | 2025-09-23T10:25:20+02:00 | Sigbjørn Skjæret | | ggml : fix uninitialized is_on_grid in quantize_row_iq3_xxs_impl (#15928) |
| 257 | 264f1b51872c125e23fa0ac1da5e2a1170de9a08 | 0bc7cc715472fe28822e57f036f0746592ed2c04 | 2025-09-23T14:53:05+08:00 | Aaron Teo | | zdnn: refactor codebase + add docs (#16178) |
| 258 | 4b9f4cb0f89a88de4bdf97727d0457b0c648804c | 85e72271ba1ce78adf34fd8997803c991e617ca6 | 2025-09-23T13:59:34+08:00 | Aaron Teo | | devops: add s390x containers (#15915) |
| 259 | 85e72271ba1ce78adf34fd8997803c991e617ca6 | 1d0125bcf1cbd7195ad0faf826a20bc7cec7d3f4 | 2025-09-23T05:59:03+02:00 | Daniel Bevenius | | ggml-cpu : fix typo in gemm comments [no ci] (#16189) |
| 260 | 3ecb2f671a2f49d56357f99d135a94e841759178 | 432cf4304c5379bfbd1f3feed65ec205955b2f4b | 2025-09-22T19:13:00+02:00 | Sigbjørn Skjæret | | ggml : implement set_rows with i32 index (#16159) |
| 261 | 37a23c17bdc9c99c9c6ad41168e4ced3724b72cd | 138c87ce8bd558b2cc134ada7316a3dad8eb67ac | 2025-09-22T14:13:51+02:00 | Adrien Gallouët | | common : enable `--offline` mode without curl support (#16137) |
| 262 | 138c87ce8bd558b2cc134ada7316a3dad8eb67ac | c6db9a10278f40b4b8d3f6931728f2cce2356daa | 2025-09-22T10:53:13+02:00 | Quentin Bramas | | webui : fix handling incomplete chunks (#16107) |
| 263 | c6db9a10278f40b4b8d3f6931728f2cce2356daa | d05affbab7d1364fa7ac06c03cd33f03235ae840 | 2025-09-22T10:49:58+02:00 | GideonSerf | | embedding : fix typos in README (#16171) |
| 264 | d05affbab7d1364fa7ac06c03cd33f03235ae840 | 4f324a556caa5be0be2261604ef4aab0faf36eb8 | 2025-09-22T16:48:42+08:00 | Haiyue Wang | | common : remove unused local variables (#16140) |
| 265 | 4f324a556caa5be0be2261604ef4aab0faf36eb8 | a71ae3ba7a857394103f12e30b387c48242c84f2 | 2025-09-22T11:12:37+03:00 | Georgi Gerganov | | ggml : extend ggml_can_fuse to work with non-sequential nodes (#16123) |
| 266 | 96fdca043be8fa733bbd59868a75517f92633376 | b2d980fce063fa3591c59ad50b946c8da66c294f | 2025-09-22T17:04:01+09:00 | Shin-myoung-serp | | Vulkan: add conv_transpose_2d operation (#16022) |
| 267 | a20d810d79adfbf82e0eb703af6f27a0e2d1a539 | 4d0a7cbc617e384fc355077a304c883b5c7d4fb6 | 2025-09-22T00:37:17-05:00 | Jeff Bolz | | vulkan: add RTE variants of exp shader (#16165) |
| 268 | 9073a73d82a916cea0809de225ef5175c3a86e91 | 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a | 2025-09-22T07:22:43+02:00 | Ruben Ortlam | | vulkan: vec dot matrix multiplication fix (#16151) |
| 269 | 51f5a45fbe575dcd54bdd2a339ef8e8424d1c12a | c4510dc9374e17dcb8726902ab5216067a92b3d3 | 2025-09-21T16:42:10-07:00 | lhez | | opencl: fix concat crash on win arm64 with Adreno (#15944) |
| 270 | 28baac9c9f491c872e2c37762d3bd90446b005e9 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 2025-09-21T16:50:45+03:00 | Georgi Gerganov | | ci : migrate ggml ci to self-hosted runners (#16116) |
| 271 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 2025-09-21T08:31:55+02:00 | Giuseppe Scrivano | | vulkan: optimize UMA buffer operations and fix driver hangs (#16059) |
| 272 | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 7f766929ca8e8e01dcceb1c526ee584f7e5e1408 | 2025-09-21T01:23:37-05:00 | Jeff Bolz | | vulkan: fix validation error about VK_PIPELINE_CREATE_CAPTURE_STATISTICS_BIT_KHR (#16086) |
| 273 | 405921dcefdd4e90ed948a4bf179007c2fa92b2d | fa6383ca7e7ccb8ca3bdfeb37e348ddc4113aa26 | 2025-09-16T06:16:52+02:00 | Daniel Bevenius | | ggml : introduce semantic versioning (ggml/1336) |
| 274 | 803dac2e48ef3ba26a504eb27c4e77ec2d21f7d0 | 459c0c2c1a400f960d7b8e8d94d31a8426f80986 | 2025-09-20T10:42:56+02:00 | Ruben Ortlam | | vulkan: use vec dot for matrix matrix multiplications (#16056) |
| 275 | 459c0c2c1a400f960d7b8e8d94d31a8426f80986 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | 2025-09-20T07:56:30+02:00 | Benni | | server: fix SSE and OpenAI compatibility for error messages when streaming (#16109) |
| 276 | be79d9fdd95ab8955527c4aaa67b90e8b9516718 | f432d8d83e7407073634c5e4fd81a3d23a10827f | 2025-09-19T15:15:21-07:00 | ssweens | | llama-bench: add --devices and --list-devices support (#16039) |
| 277 | f432d8d83e7407073634c5e4fd81a3d23a10827f | 4067f07fc5aa5722b87db303b561597004696f6c | 2025-09-20T00:57:30+09:00 | shun095 | | chat: Fix streaming parser for granite models (#15682) |
| 278 | 4067f07fc5aa5722b87db303b561597004696f6c | 4b8560ab56fdd9819358b47c338bbc8ec357c57e | 2025-09-19T09:52:27+02:00 | Aleksander Grygier | | feat: Improve mobile UI for Settings Dialog (#16084) |
| 279 | 4b8560ab56fdd9819358b47c338bbc8ec357c57e | 0dd58b6877f3dc106593d6bc68d98305f553c566 | 2025-09-19T13:02:51+07:00 | Xuan-Son Nguyen | | chat : fix build on arm64 (#16101) |
| 280 | 69ffd891631befa9e6b485fd646a16dab4f2c007 | 246c0d9c795fb25da8268625d597580155a3672f | 2025-09-18T23:07:26+02:00 | Adrien Gallouët | | ggml-amx : fix ggml_amx_init() on generic Linux (#16049) |
| 281 | 246c0d9c795fb25da8268625d597580155a3672f | 3edd87cd055a45d885fa914d879d36d33ecfc3e1 | 2025-09-18T23:07:18+02:00 | Adrien Gallouët | | cmake : fix static linking for OpenMP on Unix-like systems (#16031) |
| 282 | 368560a1e3b9a3bc83af741b0b2bc9e46fb420d2 | 4ca088b036313c2d8e682f4cfeb7c29edd85d0b9 | 2025-09-18T19:28:32+02:00 | Johannes Gäßler | | CUDA: fix compilation on CC 6.0 (#16091) |
| 283 | d304f459d8619399eb232b1e3689379306f439d3 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | 2025-09-17T13:09:40-07:00 | Reese Levine | | GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018) |
| 284 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | a7a98e0fffed794396b3fbad4dcdbbc184963645 | 2025-09-17T20:38:12+03:00 | Georgi Gerganov | | metal : refactor + optimize v2 (#15995) |
| 285 | 8f8f2274ee3601fecf6e2d57b52f701c81bede21 | c959b676be29e93f8dbc3bd6056ceba812a9eb72 | 2025-09-18T00:18:21+07:00 | Xuan-Son Nguyen | | convert : add Llama4ForCausalLM (#16042) |
| 286 | c959b676be29e93f8dbc3bd6056ceba812a9eb72 | cd08fc3ecc0264b4414b68af3874a6c689ed60c1 | 2025-09-17T15:32:42+02:00 | Johannes Gäßler | | CUDA: fix FA occupancy, optimize tile kernel (#15982) |
| 287 | cd08fc3ecc0264b4414b68af3874a6c689ed60c1 | cb5bb6cc05119c24e7711ca2956cd0e6d409d396 | 2025-09-17T01:08:02-07:00 | David Ribeiro Alves | | common : Fix corrupted memory error on json grammar initialization (#16038) |
| 288 | a91d035b901e8a9edf810f63d130ee49adf27be2 | 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 | 2025-09-17T09:34:09+02:00 | Daniel Bevenius | | ci : revert back to macos-13 for macOS-latest-cmake-x64 (#16040) |
| 289 | 745cbcf2fe1eb88f8db615ac622f0b944d924ad6 | 1cbd80f8cf80a817715b1ccc5680fe2a3c5172c8 | 2025-09-17T15:30:55+08:00 | Jie Fu (傅杰) | | llama-quant : fix the verification of attention layers for encoder-decoder models (#16023) |
| 290 | 85286f354813056f6c835046c0acfa3bf6ba9432 | d5fabe3682de515fd09d6c981f7a0d1b75614455 | 2025-09-17T00:01:58-07:00 | Shane A | | model : add OLMo3 support (#16015) |
| 291 | d5fabe3682de515fd09d6c981f7a0d1b75614455 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 2025-09-17T14:33:08+08:00 | Chenguang Li | | CANN: Optimize ggml_cann_set_device (#15935) |
| 292 | 77475530b8bbea3bf578632507e1284cdfe2c8c0 | 3913f8730ec6d6245480affc30ae3049107956f4 | 2025-09-16T15:27:52+02:00 | Daniel Bevenius | | ci : use macos-latest for arm64 webgpu build (#16029) |
| 293 | 3913f8730ec6d6245480affc30ae3049107956f4 | 76888d202ed2b835ae19ea9f9db6baf39e419297 | 2025-09-16T15:25:57+02:00 | Daniel Bevenius | | ggml : fix padding in timestep embedding kernels (#15932) |
| 294 | 76888d202ed2b835ae19ea9f9db6baf39e419297 | f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c | 2025-09-16T13:41:38+02:00 | Daniel Bevenius | | ci : upload xcframework artifact from ios-xcode-build job (#16010) |
| 295 | f1fbffb5c0b34b2a68febb7da3fd0f8333f1ed4c | 51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 | 2025-09-15T23:59:19-07:00 | Bowen Han | | fix: apply clang-format to CUDA macros (#16017) |
| 296 | 51abc96bdc52ba8cd6ad78dcf12ed9a041d7b442 | 07808ebb07e2b1aa19032705e332679ddf967614 | 2025-09-16T05:57:16+02:00 | Daniel Bevenius | | ci : update macos-latest* jobs to use macos-latest (#15938) |
| 297 | 3d4053f77f0f78ee2b791088c02af653ebee42dd | dc381aa9a6dc45f00673471d34b8bddd30e77570 | 2025-09-15T16:28:31-06:00 | Jake Karnes | | CUDA: fix im2col_3d to respect non-contiguous inputs (views) (#15956) |
| 298 | 28c39da7c645185ade5436767929d7ec33006033 | 106220562aca42b6738b8f51acfce0db1b8a2fb6 | 2025-09-15T13:08:30+03:00 | Nikolay Popov | | llama-run: Fix model download on Windows (#15988) |
| 299 | a68f31edd71cc39141113f05f7133a3e9ece8c61 | b8e09f08b9a91c0401bc67d17a17c90756420346 | 2025-09-15T02:54:57-05:00 | ddh0 | | fix KLD percentile output (#15999) |
| 300 | b8e09f08b9a91c0401bc67d17a17c90756420346 | 6c019cb04e86e2dacfe62ce7666c64e9717dde1f | 2025-09-14T23:00:59+02:00 | Sigbjørn Skjæret | | model : add grok-2 support (#15539) |
| 301 | 0fa154e3502e940df914f03b41475a2b80b985b0 | 261e6a20ffdb79c4875e674b4f6b514bc73cff8f | 2025-09-15T04:43:54+10:00 | Adam | | rocm.Dockerfile: added gfx1200,gfx1201 architectures to support AMD Radeon RX 9000 series (#15994) |
| 302 | 261e6a20ffdb79c4875e674b4f6b514bc73cff8f | a0e13dcbe5bae7025660349ef3e4ead060e507f2 | 2025-09-14T16:56:28+02:00 | Ruben Ortlam | | Vulkan: Clean up mul_mm shader (#15987) |
| 303 | a0e13dcbe5bae7025660349ef3e4ead060e507f2 | a14bd350141fb42b8bf2dd2342cebc27bfdce399 | 2025-09-14T22:20:35+08:00 | lcy | | build: fix the build failures of Windows HIP release job (#15984) |
| 304 | a14bd350141fb42b8bf2dd2342cebc27bfdce399 | 918b26f197f55d5d562446dfc876d0e637929d07 | 2025-09-14T15:33:22+03:00 | Georgi Gerganov | | metal : fix kernel requirements (#15983) |
| 305 | 918b26f197f55d5d562446dfc876d0e637929d07 | 9ecb88434644c865232bb665d2f6f05049fc6456 | 2025-09-14T12:28:18+03:00 | Radoslav Gerganov | | rpc : fix regression when --device is used (#15981) |
| 306 | 6380d6a3e709cb02a8695afdd96b40e674477332 | aa0c461efe3603639af1a1defed2438d9c16ca0f | 2025-09-14T13:37:03+08:00 | Aaron Teo | | ggml-zdnn: rm user mapped buffers (#15965) |
| 307 | aa0c461efe3603639af1a1defed2438d9c16ca0f | b9c9c9f789cd57fb0b28b25223305613cd90fa10 | 2025-09-13T16:29:43+01:00 | Jeff Bolz | | vulkan: fix failing dequant shaders (#15862) |
| 308 | b9c9c9f789cd57fb0b28b25223305613cd90fa10 | 50f4281a6f5c3a5d68bdeb12f904fa01e0e2ba91 | 2025-09-13T16:23:30+01:00 | Jeff Bolz | | vulkan: initialize vulkan-hpp to allow using extension function pointers (#15705) |
| 309 | f161463a54d9f93d41246286aa4a9569a91d804d | 84d7b2fca11d1be118ce776f6d72a486c4883b74 | 2025-09-13T13:54:28+03:00 | Georgi Gerganov | | metal : allow ops to run concurrently (#15929) |
| 310 | 84d7b2fca11d1be118ce776f6d72a486c4883b74 | 40be51152d4dc2d47444a4ed378285139859895b | 2025-09-13T12:45:04+03:00 | Georgi Gerganov | | metal : fix memory leaks (#15962) |
| 311 | 40be51152d4dc2d47444a4ed378285139859895b | 4bf5549269d99bac936a65892da2312cc71b2421 | 2025-09-13T02:39:52+08:00 | Aaron Teo | | ggml-zdnn: fix #15414, activate FP16 and BF16 acceleration and incorrect zTensor free (#15839) |
| 312 | 304ac5693d1e2124f83e0584bc5eea6311d3d3b4 | 6c88ad8fa741a2182a2dcf8c5353ae4b5c66e656 | 2025-09-12T13:24:21+02:00 | Ruben Ortlam | | Vulkan iGPU device selection overhaul and PCI ID API support (#15947) |
| 313 | 0e6ff0046f4a2983b2c77950aa75960fe4b4f0e2 | df082f56309073ecf885eceaa21b86e8a487e61b | 2025-09-11T21:19:58+02:00 | Johannes Gäßler | | CUDA: larger SRAM reads for tile FA, AMD FP16 dot (#15927) |
| 314 | 24a6734daf6932ff29ba8c1ff0245c51d76f783e | 2b3efea9a4d91216850856fbb77075db26f6a6eb | 2025-09-11T15:39:12+02:00 | Daniel Bevenius | | ggml-cpu : add check for ARM MATMUL_INT8/i8mm support (#15922) |
| 315 | 2b3efea9a4d91216850856fbb77075db26f6a6eb | c0389dba43d50695f9d3f57dd1f1a14cbefc100c | 2025-09-11T12:45:40+02:00 | Charles Xu | | kleidiai: fix GGML_ASSERT(*cur_backend_id != -1) failed (#15614) |
| 316 | c0389dba43d50695f9d3f57dd1f1a14cbefc100c | 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 | 2025-09-11T15:59:37+08:00 | hipudding | | CANN: Disable acl_graph for prefill stage (#15933) |
| 317 | 00681dfc16ba4cebb9c7fbd2cf2656e06a0692a4 | 4f658855fa8f2e42b7ed9a5b298fa39a2e39b096 | 2025-09-10T22:04:03+02:00 | Oliver Simons | | CUDA: Add `fastdiv` to `k_bin_bcast*`, giving 1-3% E2E performance (#15872) |
| 318 | 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c | 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 | 2025-09-10T17:31:40+02:00 | Daniel Bevenius | | ggml-cpu : fix padding in ggml_timestep_embedding (#15917) |
| 319 | 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 | 33daece86b65607451d0d4378d2d04ba6a20ad55 | 2025-09-10T17:52:35+03:00 | Georgi Gerganov | | metal : make the backend async (#15906) |
| 320 | 10d8b2b6b0ac2cae252a80b4daea5da55ab63c2f | 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 | 2025-09-10T18:42:00+08:00 | Chenguang Li | | CANN: Add ROPE sin/cos cache for reuse (#15912) |
| 321 | 28b5f190ef1dbea5edf82dbc8b4407b721fadd13 | 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 | 2025-09-10T15:29:12+08:00 | Chenguang Li | | CANN: implement LRU cache for ACL graphs (#15814) |
| 322 | 86587da03bd78df8f4e7d8b111a0c1d2494d6ed0 | ff02caf9eed261423289d1531a56536fbf57bfc2 | 2025-09-10T05:33:58+02:00 | Daniel Bevenius | | llama : check returned fn ptrs from ggml_backend_reg_get_proc_address (#15893) |
| 323 | ff02caf9eed261423289d1531a56536fbf57bfc2 | ae355f6f7108540297d8b7f7ae71d20fe610a0b7 | 2025-09-10T05:23:19+02:00 | Daniel Bevenius | | ci : cache ROCm installation in windows-latest-cmake-hip (#15887) |
| 324 | ae355f6f7108540297d8b7f7ae71d20fe610a0b7 | 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b | 2025-09-09T22:26:03+02:00 | Ruben Ortlam | | vulkan: throw the oom error instead of no memory type found (#15905) |
| 325 | 4f63cd705c7b6f457f36c63fdc053e07f6f3cc6b | 17bc5a815f0bebc1844c99796760cd7df5e9b8d9 | 2025-09-09T07:41:15-05:00 | Jeff Bolz | | vulkan: Fix OOB accesses in soft_max_back (#15861) |
| 326 | ed54e32558ffe0f2c3b1d31f3227211fae05bd49 | a972faebed5fdc4a3d2a844d92d476058c02e02d | 2025-09-09T15:01:15+03:00 | lksj92hs | | Workaround for subgroup arithmetic failing on MoltenVK with AMD GPUs (issue 15846) (#15886) |
| 327 | a972faebed5fdc4a3d2a844d92d476058c02e02d | 550cf726e133fd0a069d991287fd3a2a3e3e1cbd | 2025-09-09T14:38:02+08:00 | Aman Gupta | | CUDA: Add mul_mat_id support for the mmf kernel (#15767) |
| 328 | 550cf726e133fd0a069d991287fd3a2a3e3e1cbd | c252ce67c4b99f056eeb18d42a289e28fee03475 | 2025-09-09T08:11:01+02:00 | Johannes Gäßler | | CUDA: fix GET_ROWS for large tensors (#15882) |
| 329 | 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 | acc1b008cfd95e63d5f99a370dbffb98e5a99d2c | 2025-09-09T06:06:52+02:00 | Daniel Bevenius | | requirements : update transformers/torch for Embedding Gemma (#15828) |
| 330 | acc1b008cfd95e63d5f99a370dbffb98e5a99d2c | 7057faf64b514e991e2f70147f82bb13d544b1c0 | 2025-09-09T06:05:55+02:00 | Piotr Wilkin (ilintar) | | model-conversion : add extra debugging support for model conversion (#15877) |
| 331 | e68aa10d8f3d26fdad5b912540362d79de5460e3 | 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 | 2025-09-08T13:10:07-05:00 | Jeff Bolz | | vulkan: sort graph to allow more parallel execution (#15850) |
| 332 | 88021565f08e0b7c4e07ac089a15ec16fae9166c | 56920f56651908d5cce7a310dabf54ac4f6fbb7f | 2025-09-08T10:59:48-04:00 | Jesse | | chat : Deepseek V3.1 reasoning and tool calling support (OpenAI Style) (#15533) |
| 333 | b0d52998b962bd2681c34bf52af993af79f178b8 | f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf | 2025-09-08T13:56:51+03:00 | Georgi Gerganov | | cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868) |
| 334 | f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf | 9fcb29f22f5c33c04c7f0daebb24057899d67a1a | 2025-09-08T13:34:56+03:00 | Georgi Gerganov | | metal : refactor + optimize (#15857) |
| 335 | 9fcb29f22f5c33c04c7f0daebb24057899d67a1a | 5ef22d281de9c5eaaf616874bc490b89241128cb | 2025-09-08T17:33:01+07:00 | Xuan-Son Nguyen | | ggml: allow casting between f32 and i32 (#15783) |
| 336 | 233d773d02c37982badddf3994e9953a175f34da | a885dcff11a7b73f9377812d6151f6b15d307de0 | 2025-09-08T09:44:34+02:00 | Daniel Bevenius | | convert : force setting sliding_window from original config (#15867) |
| 337 | a885dcff11a7b73f9377812d6151f6b15d307de0 | 663027fd5490438ce9c27ea866a560e1e268d11f | 2025-09-08T10:27:07+03:00 | Georgi Gerganov | | batched-bench : fix llama_synchronize usage during prompt processing (#15835) |
| 338 | 663027fd5490438ce9c27ea866a560e1e268d11f | cf0e3ba1500bd23635b444f64ba23cbdb56c92ef | 2025-09-08T10:26:36+03:00 | Georgi Gerganov | | context : fix n_outputs during reserve (#15858) |
| 339 | cf0e3ba1500bd23635b444f64ba23cbdb56c92ef | d413dca00360a7e4cb71441dacecfa32556fcc31 | 2025-09-08T10:25:33+03:00 | Georgi Gerganov | | model : avoid ggml_cont_3d for fused QKV weights (#15662) |
| 340 | d36e61c580bf7fc7879c443c542312a42b718e11 | c97b5e5854b47b18a248d77edb693c63018a0865 | 2025-09-08T02:18:28+08:00 | Aaron Teo | | ggml-cpu: clean up s390x SIMD (#15855) |
| 341 | 267e99867f09bec8bcc2e424ad9bcddd6cccf9d0 | 3b15924d71237a43bb5ad71f5b885ee66a821342 | 2025-09-07T11:53:07-05:00 | Jeff Bolz | | vulkan: Use larger loads in scalar/coopmat1 matmul (#15729) |
| 342 | 3b15924d71237a43bb5ad71f5b885ee66a821342 | 79bc429262268ad2ac8a364cfe6c2d6b9c5f008a | 2025-09-07T10:19:45+02:00 | Daniel Bevenius | | ggml WebGPU: remove userdata from request adapter callback (#15527) |
| 343 | 61bdfd5298a78593be649a1035ee2a120b13c4f0 | 01806e77714ae8a78130d432945b959a0956c56f | 2025-09-06T18:35:04+07:00 | Xuan-Son Nguyen | | server : implement prompt processing progress report in stream mode (#15827) |
| 344 | fd621880f3fd908424e675a41715a2dc760247a2 | 4281c7b315f8a904549fe527039b976e08098d1a | 2025-09-05T17:32:39-06:00 | Gabe Goodhart | | aLoRA Support (#15327) |
| 345 | 5fac79cbc77b6d12c9feb5f34fc63586b35fd561 | 408ff524b40baf4f51a81d42a9828200dd4fcb6b | 2025-09-05T14:31:24-06:00 | Gabe Goodhart | | Thinking model disabled assistant prefill (#15404) |
| 346 | 408ff524b40baf4f51a81d42a9828200dd4fcb6b | 5143fa895e7725c5bd2135daf7d8f793d98fa91c | 2025-09-05T19:43:59+01:00 | Eric Curtin | | Implement --log-colors with always/never/auto (#15792) |
| 347 | a81283820a466f2ace06ce4d4bc9512761f9365f | c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 | 2025-09-05T11:34:28+02:00 | Erik Scholz | | gguf: gguf_writer refactor (#15691) |
| 348 | c610b6c11b1ef7d678671dcf15acd7187a7ad8f3 | 5d6688de08e73acc2532d668380801ed79d704eb | 2025-09-05T10:39:22+03:00 | Georgi Gerganov | | kv-cache : fix SWA checks + disable cacheless iSWA (#15811) |
| 349 | 5d6688de08e73acc2532d668380801ed79d704eb | 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 | 2025-09-05T04:36:23+02:00 | Daniel Bevenius | | model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801) |
| 350 | 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 | b2426e469e2fdb6c44216d56baa4cfff4f39ae00 | 2025-09-05T01:24:08+02:00 | ExtReMLapin | | chat : fixed crash when Hermes 2 <tool_call> had a newline before it (#15639) |
| 351 | b2426e469e2fdb6c44216d56baa4cfff4f39ae00 | 9e2b1e83c68a38ea0c64f726dd979439bd02189b | 2025-09-05T01:22:22+02:00 | Piotr Wilkin (ilintar) | | chat : nemotron thinking & toolcalling support (#15676) |
| 352 | 9e2b1e83c68a38ea0c64f726dd979439bd02189b | fb15d649ed14ab447eeab911e0c9d21e35fb243e | 2025-09-05T01:05:12+02:00 | Piotr Wilkin (ilintar) | | scripts : add Jinja tester PySide6 simple app (#15756) |
| 353 | d1e2adba65208d6de3d7f6f23b00c562ff5bb777 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | 2025-09-04T15:40:44+02:00 | Daniel Bevenius | | llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791) |
| 354 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | 2025-09-04T20:20:14+08:00 | Chenguang Li | | CANN: Refactor ND to NZ workspace to be per-device (#15763) |
| 355 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | badb80cadbc40e047b30c43611aba575fc8d6845 | 2025-09-04T11:50:23+02:00 | Xuan-Son Nguyen | | server: add exceed_context_size_error type (#15780) |
| 356 | badb80cadbc40e047b30c43611aba575fc8d6845 | 0a1b3982cd0bd18730d50a693053b88c13fd04a6 | 2025-09-04T10:49:44+01:00 | Eric Curtin | | Document the new max GPU layers default in help (#15771) |
| 357 | 0a1b3982cd0bd18730d50a693053b88c13fd04a6 | 5421f63ab08ca1e1a093662a5ccd0117e461185f | 2025-09-04T16:38:49+08:00 | leejet | | ggml: add ops for WAN video model (cuda && cpu) (#15669) |
| 358 | 5421f63ab08ca1e1a093662a5ccd0117e461185f | 820bc9853100708011036e10f40b923968dd9b66 | 2025-09-04T15:12:30+08:00 | hipudding | | CANN: Fix precision issue on 310I DUO multi-devices (#15784) |
| 359 | 239b60e8986bbcb944f57311a02ac994431bf652 | dff7551bfdbdd6e57c13e523d7dcca317640e907 | 2025-09-04T11:03:02+08:00 | Chenguang Li | | CANN: fix acl_rstd allocation size in ggml_cann_rms_norm (#15760) |
| 360 | dff7551bfdbdd6e57c13e523d7dcca317640e907 | 0fce7a1248b74148c1eb0d368b7e18e8bcb96809 | 2025-09-03T22:55:10+02:00 | Ruben Ortlam | | vulkan: fix mmv subgroup16 selection (#15775) |
| 361 | 661ae31c9c68201577e70278285b349a5a662caf | 407c23786dd0d3a503e9429eead96e611d3950c9 | 2025-09-03T19:59:16+02:00 | Oliver Simons | | CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715) |
| 362 | 407c23786dd0d3a503e9429eead96e611d3950c9 | cdedb70a998cea7052560fe0b0615a839443564d | 2025-09-03T18:28:36+02:00 | Daniel Bevenius | | model-conversion : fix pyright errors (#15770) |
| 363 | 2c8dac72eb6acd4e20c0da251535dfc46d35178b | 40a751ea9a94364da73537b86502a808ebe1fc3a | 2025-09-03T13:35:49+02:00 | Daniel Bevenius | | llama : fix incorrect model type for Gemma 270M (#15764) |
| 364 | 05c0380f2ae5c7193445e03ebc7b6de9ce49f1a6 | 8c3fdf44ecf08335942f2ba558955f55e88c7991 | 2025-09-03T16:16:21+08:00 | xctan | | ggml-cpu : optimize RVV kernels (#15720) |
| 365 | f6da8cb86a28f0319b40d9d2a957a26a7d875f8c | 8a2234ea0c89f212190c176d741b7742f0082582 | 2025-09-03T14:08:22+08:00 | hipudding | | CANN: Mask unsupported TRANSPOSE_1D operator (#15733) |
| 366 | 8a2234ea0c89f212190c176d741b7742f0082582 | 3de008208b9b8a33f49f979097a99b4d59e6e521 | 2025-09-03T10:43:53+08:00 | Chenguang Li | | CANN: Fix type float_t to float (#15736) |
| 367 | 3de008208b9b8a33f49f979097a99b4d59e6e521 | 69db8a52e6dd0db81ec05c581150cc1e43b8ac46 | 2025-09-03T03:27:30+08:00 | SnA1lGo | | fix: resolve unsigned int initialization warning for n_dims/size in gguf.cpp (#15754) |
| 368 | 0a2a3841e8ebc570da343e8cf58a21c1010b41e7 | 9961d244f2df6baf40af2f1ddc0927f8d91578c8 | 2025-09-02T16:02:26+02:00 | Ruben Ortlam | | vulkan: fix shaders gen when no integer dot is available (#15740) |
| 369 | 9961d244f2df6baf40af2f1ddc0927f8d91578c8 | 25f1045f07cf0daf667d63e35618842e3174a8c7 | 2025-09-02T17:12:37+08:00 | hipudding | | CANN: Resolve soft_max precision issue (#15730) |
| 370 | 25f1045f07cf0daf667d63e35618842e3174a8c7 | 97669e40735d08db65ef094a8faae8e8411a97db | 2025-09-02T01:37:01-05:00 | Jeff Bolz | | vulkan: Fix macro parameter order for f32 matmul shaders (#15716) |
| 371 | 2f853687b3bce15e143a22f678d1715060fd606c | ef2af57ddf04ab367f6ba6e8ed100fc56785e4b7 | 2025-09-02T14:07:48+08:00 | Chenguang Li | | CANN: Support eager execution mode under ACL graph compilation (#15712) |
| 372 | d4d8dbe383e8b9600cbe8b42016e3a4529b51219 | 35a42edac84690990a75726898d975cd08d220c0 | 2025-09-01T22:17:42+03:00 | Gilad S. | | vulkan: use memory budget extension to read memory usage (#15545) |
| 373 | a0c2b207c596d1092a08615de61ab56a7d63515f | 4b20d8b7e31718d3fe8b4f12d220a9d19e4f1997 | 2025-09-01T23:43:16+05:30 | Prashant Vithule | | ggml: aarch64: Implement SVE F16 kernels for vector functions (#15115) |
| 374 | 02c1813517412f3e00aa6ca7c0273fea64edb492 | 77dee9de97be75b7143a213bc48893e0c0b29af7 | 2025-09-01T16:19:07+02:00 | Ruben Ortlam | | Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903) |
| 375 | b66df9d9c942254d03209186ef24ed7c994a576e | b9382c3877c6067feccf182efe9449a2d1cb24c7 | 2025-09-01T06:55:06+05:30 | Akarshan Biswas | | CUDA: fix build error from ambiguous __half conversions in conv2d (#15690) |
| 376 | 3dc7397a2799bdc07bccf637ab7ae5a1e786d1a4 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 2025-09-01T08:57:00+08:00 | hipudding | | CANN: fix RoPE cache issue on multi-device (#15629) |
| 377 | e92d53b29e393fc4c0f9f1f7c3fe651be8d36faa | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 2025-08-31T20:41:02+03:00 | Georgi Gerganov | | sampling : optimize samplers by reusing bucket sort (#15665) |
| 378 | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 4efd5a83163ff383285b3a4c2106feabf5c69557 | 2025-08-31T20:11:58+03:00 | Georgi Gerganov | | server : enable /slots by default and make it secure (#15630) |
| 379 | 4efd5a83163ff383285b3a4c2106feabf5c69557 | 274966226f87f301ac132da898280ca3142b60e5 | 2025-08-31T19:43:30+03:00 | Georgi Gerganov | | metal : fix checks for available FA kernels (#15700) |
| 380 | 274966226f87f301ac132da898280ca3142b60e5 | 9777032dccd67bdc7785aeab7497014a8be8dacc | 2025-08-31T08:47:05-07:00 | Diego Devesa | | llama : fix fattn reserve call n_seqs parameter (#15699) |
| 381 | e81b8e4b7f5ab870836fad26d154a7507b341b36 | 38ad381f9f5d4dd368a96d844fb19cf501ed9d22 | 2025-08-30T16:32:10+02:00 | Johannes Gäßler | | llama: use FA + max. GPU layers by default (#15434) |
| 382 | ef476916bba4b44f44be0c98babc1cb025968e75 | d82f6aa34a216f5df1945cdfe121ba5e6cd80be0 | 2025-08-30T10:18:35+08:00 | Chenguang Li | | CANN: FIx compiler warnings (#15661) |
| 383 | 81017865ee444cf49ce0136f2be1e41a0270ff91 | 60e5eee31f1af9bb579ac45380e3857d610020b9 | 2025-08-29T21:30:06+08:00 | Aman Gupta | | CUDA: fix bug in rms_norm fusion (#15660) |
| 384 | 60e5eee31f1af9bb579ac45380e3857d610020b9 | 009b709d6efd24820ac67765ed339a72dc797814 | 2025-08-29T14:53:41+02:00 | Piotr Wilkin (ilintar) | | chat : Seed OSS thinking + tool call support (#15552) |
| 385 | e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 | a8bca68f727844e7dcf24a956003b3c2039ea563 | 2025-08-28T18:39:31-06:00 | Gabe Goodhart | | nvidia nemotron nano v2 (nemotronh) (#15507) |
| 386 | a8bca68f727844e7dcf24a956003b3c2039ea563 | c97dc093912ad014f6d22743ede0d4d7fd82365a | 2025-08-28T15:27:36-05:00 | Gabe Goodhart | | fix: Compute the full sum in llama-eval-callback, not just the sum of printed values (#15637) |
| 387 | 6c442f42ff25564a0cd6b1435d9abc1b0178eac5 | 73804145ab6c06888e314046abf08f66a0133679 | 2025-08-28T22:39:27+08:00 | Aaron Teo | | ggml-cpu: fix invalid hsum build in debug s390x (#15634) |
| 388 | 73804145ab6c06888e314046abf08f66a0133679 | c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a | 2025-08-28T10:11:36-04:00 | compilade | | ggml : fix SSM_SCAN for n_groups > 1 (#15625) |
| 389 | c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 2025-08-28T17:09:05+03:00 | Georgi Gerganov | | kv-cache : fix find_slot to not search for continuous slot (#15638) |
| 390 | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 | 2025-08-28T15:49:50+02:00 | Sigbjørn Skjæret | | model : jina-embeddings-v3 support (#13693) |
| 391 | d35a1e8c41f747548775225973a99507896a8c61 | 46d9caa27a0281150e8cf082308c0f9e7576ebe5 | 2025-08-28T01:48:20-06:00 | Joshua Cogliati | | cli : change log to warning to explain reason for stopping (#15604) |
| 392 | 46d9caa27a0281150e8cf082308c0f9e7576ebe5 | 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec | 2025-08-28T09:26:48+02:00 | Daniel Bevenius | | model-conversion : add mmproj conversion target (#15628) |
| 393 | 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec | fbef0fad7a7c765939f6c9e322fa05cd52cf0c15 | 2025-08-27T17:32:36-07:00 | matiaslin | | cuda: Add cublasLt_static linking when GGML_STATIC is enabled (#15622) |
| 394 | 1e7489745a74996fc36e8fd05b73aa16bc184e0c | 1cf123a343ab7ca5586aacb9e0a1d2de7fe33be4 | 2025-08-27T17:21:41+08:00 | Chenguang Li | | CANN: refactor mask handling and improve performance in FA (#15561) |
| 395 | 86076f92de1a547ef87c304facca3b4b9fae6c21 | bcbddcd54f0d5c22eab180831fdea6484107112f | 2025-08-27T08:36:05+02:00 | rmatif | | OpenCL: add fused group_norm/norm, mul, add (#15314) |
| 396 | 87932ec016f0ec81e98a13ce5212851f8c12458a | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 2025-08-27T14:29:18+08:00 | Yunzhe Jia | | fix merge problem |
| 397 | bcbddcd54f0d5c22eab180831fdea6484107112f | 8b696861364360770e9f61a3422d32941a477824 | 2025-08-26T13:14:38-07:00 | Diego Devesa | | tests : fix test-opt with GGML_BACKEND_DL (#15599) |
| 398 | 8b696861364360770e9f61a3422d32941a477824 | 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 | 2025-08-27T00:27:49+05:30 | Akarshan Biswas | | SYCL: fix rms_norm_mul_add for tensor dim not a multiple of sg_size (#15592) |
| 399 | 8ce3ff1d91245e158d98d8062cd64b0dd98dcfe3 | 44b1efa41acd4df3f56ee0e46f898135ecd1a054 | 2025-08-26T20:05:50+02:00 | fidoriel | | mtmd : fix mtmd ios build (#15579) |
| 400 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 2025-08-26T21:05:25+05:30 | shalinib-ibm | | llamafile: PowerPC Sgemm Optimization (#15558) |
| 401 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 62cef26ac5b6b7acb635d3dc963813b43952dc2b | 2025-08-26T17:45:17+03:00 | Georgi Gerganov | | graph : fix assert in memory-less build_attn (#15590) |
| 402 | 62cef26ac5b6b7acb635d3dc963813b43952dc2b | 8f5afa94c4f929da71f560db7c9f38ef6a783d95 | 2025-08-26T16:12:29+02:00 | Daniel Bevenius | | model-conversion : add qat-q4 quantization targets (#15588) |
| 403 | b3964c1e890ef8c947afb36a5124ce6fcb2136d4 | 79a546220c719e6a70627b243a478ab8d84dc9e1 | 2025-08-26T14:22:14+03:00 | Georgi Gerganov | | metal : optimize FA vec for large sequences and BS <= 8 (#15566) |
| 404 | 79a546220c719e6a70627b243a478ab8d84dc9e1 | 85cc1ae998e4898d9fa992cb9b8620338cee97bf | 2025-08-26T12:54:19+02:00 | Xuan-Son Nguyen | | mtmd : support Kimi VL model (#15458) |
| 405 | 4c37636b3ea96f2574eeb7668b93fcc0e64b05dd | 34bdbbd7c2b70b848718e95bc48010f6aecd2816 | 2025-08-26T13:15:33+07:00 | Yoshi_likes_e4 | | Add a warning for special devices (#15563) |
| 406 | f7207b0415986dd7f48447149da7de3a82338276 | 4d917cd4f64cc37744e76d084659475819fb0728 | 2025-08-25T14:18:09-07:00 | lhez | | opencl: fix support ops condition for `rms_norm` (#15560) |
| 407 | 4d917cd4f64cc37744e76d084659475819fb0728 | 886b97a5d693550c2da470c091d9d27bf38398f8 | 2025-08-25T17:56:59+02:00 | Ruben Ortlam | | vulkan: fix min subgroup 16 condition for mmid subgroup optimization (#15565) |
| 408 | 886b97a5d693550c2da470c091d9d27bf38398f8 | 111f8d06f0b9169059779a35f655b343242ccbb6 | 2025-08-25T10:47:16-05:00 | Jeff Bolz | | tests: Generate unique input values for count_equal (#15487) |
| 409 | 111f8d06f0b9169059779a35f655b343242ccbb6 | 5eff6ec9b1220b599a43b594b1110487ab6aca08 | 2025-08-25T11:27:34-04:00 | Ihar Hrachyshka | | metal: fix regression when no metal devices are present (#15531) |
| 410 | 5a6bc6b1a6cb665a944426c2055794950e524bf5 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 2025-08-25T14:25:25+02:00 | Daniel Bevenius | | model-conversion : add model card template for embeddings [no ci] (#15557) |
| 411 | 6b64f74b55628e4193f4fb00313f07dbd8556528 | 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-25T13:56:43+03:00 | Georgi Gerganov | | batched-bench : fix unified KV cache handling + pp timing (#15562) |
| 412 | 7da9fed0d6f1750a8783436f6f313b87e76e6378 | c247d06f38fc09059c9607a28aa44f5ff6be208d | 2025-08-25T14:32:16+08:00 | RunningLeon | | convert : support interns1-mini (#15412) |
| 413 | 043fb27d3808766d8ea8195bbd12359727264402 | b730706a49e576fb882dc34d9966345778b3ab0b | 2025-08-24T19:36:36+02:00 | Ruben Ortlam | | vulkan: apply MUL_MAT_ID subgroup optimization to non-coopmat devices (#15524) |
| 414 | a9c6ffcbfacee092bfaaa400306fceda18199737 | e78cf0d4b1bdbbc2479f11d58ce0c8f51f755875 | 2025-08-24T10:48:53+02:00 | Ruben Ortlam | | vulkan: enable Conv2D for Apple after MoltenVK fixed the bug (#15526) |
| 415 | e78cf0d4b1bdbbc2479f11d58ce0c8f51f755875 | 710dfc465a68f7443b87d9f792cffba00ed739fe | 2025-08-24T03:48:21-05:00 | Jeff Bolz | | vulkan: workaround MoltenVK compile failure in multi_add (#15506) |
| 416 | 710dfc465a68f7443b87d9f792cffba00ed739fe | 611f419cff11e4952228162a1c44cb35dff2274a | 2025-08-23T21:37:06+02:00 | Johannes Gäßler | | CUDA: fix half2 -> half conversion for HIP (#15529) |
| 417 | 611f419cff11e4952228162a1c44cb35dff2274a | b1afcab804e3281867a5471fbd701e32eb32e512 | 2025-08-23T13:16:17-05:00 | Jeff Bolz | | vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) |
| 418 | b1afcab804e3281867a5471fbd701e32eb32e512 | 9ef536907de1b50c30e0369284898d30472a755a | 2025-08-23T15:21:52+02:00 | Piotr Wilkin (ilintar) | | model : add support for Seed-OSS (#15490) |
| 419 | 9ef536907de1b50c30e0369284898d30472a755a | 21dc4ddaf21b8ed551d717e7606abd2cffbacdbf | 2025-08-23T12:58:58+02:00 | Johannes Gäßler | | scripts: fix compare-llama-bench.py (#15521) |
| 420 | 21dc4ddaf21b8ed551d717e7606abd2cffbacdbf | 289bf4113ef5c02d8f5eb0cf2d86683d8b8bc4d9 | 2025-08-23T16:38:30+08:00 | LaffeyNyaa | | chat : fix debug build assertion in trim function (#15520) |
| 421 | 0a9b43e507a359ca392c037cf341f55137ad0b69 | 330c3d2d21b55bca5517db7d2eea2ea8f131df4a | 2025-08-23T08:35:21+02:00 | Acly | | vulkan : support ggml_mean (#15393) |
| 422 | 45363632cbd593537d541e81b600242e0b3d47fc | 32732f2459a598606055f0403f0e4ec148d06d68 | 2025-08-22T11:28:03-07:00 | Reese Levine | | ggml WebGPU: add support for quantization types (#15440) |
| 423 | ad5c975c2d0297124fad210776ef8eed6b90d578 | 4afb0a746f22abaa545b3ebdb76a400d7da3a713 | 2025-08-22T16:11:04+08:00 | Aaron Teo | | ggml-cpu: Support Q5_0 and Q5_1 on s390x (#15486) |
| 424 | a0f98dd604d34826eb5ea2560d1e23fe726921df | 54a241f505d515d625767b993bfd573ecee306b9 | 2025-08-22T14:12:07+08:00 | Chenguang Li | | CANN: Optimize RMS_NORM using cache (#15419) |
| 425 | 54a241f505d515d625767b993bfd573ecee306b9 | cd36b5e5c7fed2a3ac671dd542d579ca40b48b54 | 2025-08-21T14:09:32-07:00 | Diego Devesa | | sched : fix possible use of wrong ids tensor when offloading moe prompt processing (#15488) |
| 426 | 9ad5e60dba38a6718366b7ac43e7d8e8abdc36c9 | 715a6db02ccb16284837885f2c6fab05d8f7a6ee | 2025-08-21T22:53:13+08:00 | Jie Fu (傅杰) | | examples : fix some typos in examples/model-conversion/README.md (#15477) |
| 427 | 029bb39eb1e7ae0e5df817ce97931abcd5fa52a9 | 30649cab657d87ac46692332a76e1b75d5d22e00 | 2025-08-21T17:52:16+05:00 | Ali Tariq | | ci : enable RVV1.0 native build (#15386) |
| 428 | b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 | 245be739df942861ddc52331b095b40f18e2a3f1 | 2025-08-21T05:06:46-05:00 | Michael Giba | | ci : fix -Werror=return-type in clip.cpp so ci/run.sh can run without issue (#15221) |
| 429 | 245be739df942861ddc52331b095b40f18e2a3f1 | b2caf67db1208fd38a0570785c39f7370d906d8a | 2025-08-21T11:47:52+02:00 | Copilot | | ci : add copilot-instructions.md (#15286) |
| 430 | b2caf67db1208fd38a0570785c39f7370d906d8a | 2f3dbffb17ef782edfd50e5a130cec6e8a7e47f8 | 2025-08-21T11:19:50+02:00 | Julien Denize | | convert : make Mistral community chat templates optional via parameter (#15420) |
| 431 | 2f3dbffb17ef782edfd50e5a130cec6e8a7e47f8 | 945e1f12a6b586ebf82fa4fd7f347225e58174c5 | 2025-08-21T16:54:34+08:00 | Jie Fu (傅杰) | | common : fix incorrect print of non-ascii characters in the logging (#15466) |
| 432 | 945e1f12a6b586ebf82fa4fd7f347225e58174c5 | 1b0db8f6e08951969e2447c2d18bf638effb8f75 | 2025-08-21T07:32:26+02:00 | Xuan-Son Nguyen | | ggml : fix condition of im2col on Metal backend (#15460) |
| 433 | 1b0db8f6e08951969e2447c2d18bf638effb8f75 | 29f538ac630d6544406a0702476e36808a6bd1b3 | 2025-08-21T07:19:22+02:00 | stduhpf | | server : fix webui (#15462) |
| 434 | 29f538ac630d6544406a0702476e36808a6bd1b3 | 8ad038c0fdc719ced9fbf921a02cbae9ad79287f | 2025-08-21T06:12:28+02:00 | Daniel Bevenius | | examples : remove references to `make` in examples [no ci] (#15457) |
| 435 | 1bc664a26a1d93a48baf2483a7ff95291ca8bcb8 | 13aeb7aef284daed4ad07dc14b4b3e2a42b5ea97 | 2025-08-21T07:10:08+09:00 | teo | | server: fix OpenAI API compatibility for usage statistics in chat streams (#15444) |
| 436 | 657b8a77bd01854f99d37a47318fa24f2e7e298f | ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3 | 2025-08-20T14:26:01+02:00 | Daniel Bevenius | | chat: handle gpt-oss return/end token inconsistency (#15421) |
| 437 | ec5ab1a36c11dd3efcf4ec8d1ac89a13a8117bc3 | 1a99c2d948209d9ea5eac8b6dc0a297107244540 | 2025-08-20T18:33:30+08:00 | Jie Fu (傅杰) | | common : fix context shift help message (#15448) |
| 438 | 1a99c2d948209d9ea5eac8b6dc0a297107244540 | 37f10f955f70e0158d50343d0b9a3f92d194daae | 2025-08-20T18:32:05+08:00 | xiaobing318 | | cmake : fix target include directories (#15450) |
| 439 | 37f10f955f70e0158d50343d0b9a3f92d194daae | 2f37014073f4c6ddc8f241c927db87337c71aa52 | 2025-08-20T12:31:16+02:00 | Daniel Bevenius | | make : remove make in favor of CMake (#15449) |
| 440 | a094f381432d92c4bf92d2d6167284316ba73a62 | fb22dd07a639e81c7415e30b146f545f1a2f2caf | 2025-08-20T10:17:37+08:00 | R0CKSTAR | | musa: fix build warnings (#15258) |
| 441 | 1e19f5d462b6df490a13103ca555d851f47e5fa5 | d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 | 2025-08-19T18:58:14+02:00 | Gian-Carlo Pascutto | | common : Add top-nsigma sampler to help globally (#15428) |
| 442 | d2fcd91cf96b46f4485ce46b4e3a32bf0df37715 | a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 | 2025-08-19T16:46:37+03:00 | Georgi Gerganov | | server : disable context shift by default (#15416) |
| 443 | a6d3cfe7fa6ea1fb0e1ba8243b731db22ddc0b49 | 67f09a3a27db443f9870aac87e163dba0d08131e | 2025-08-19T21:28:22+08:00 | SHUAI YANG | | CANN: optimize rope operator (#15335) |
| 444 | d1d82416006e7ff41780cb0e9b5f28d30a267497 | 618575c5825d7d4f170e686e772178d2aae148ae | 2025-08-18T16:51:42+02:00 | davidef | | server : fix incoming tasks not process in order (#15395) |
| 445 | 618575c5825d7d4f170e686e772178d2aae148ae | f44f7931729022c57319a0124931120a169e0da9 | 2025-08-18T05:50:48-05:00 | Dobri Danchev | | Fix broken build: require updated pip to support --break-system-packages (#15357) |
| 446 | f44f7931729022c57319a0124931120a169e0da9 | ae532eac2c1df1d8edc3d2719145895b966de1bf | 2025-08-18T03:23:56-04:00 | compilade | | ggml-quants : fix make_qp_quants NANs and IQ1 assertion errors (#15379) |
| 447 | b143fbc87af0324aa49e16cd91faf3ba8bb22231 | de5627910df74298c998e6bb36ee3217375a5719 | 2025-08-17T13:30:23+02:00 | Sigbjørn Skjæret | | ci : fix hang in windows-hip build/release (#15365) |
| 448 | 65349f26f2299e06477ec8e85e46243046801358 | 1fe00296f587dfca0957e006d146f5875b61e43d | 2025-08-16T23:33:54+02:00 | Tarek Dakhran | | model : support vision LiquidAI LFM2-VL family (#15347) |
| 449 | 1fe00296f587dfca0957e006d146f5875b61e43d | de2192794f4e8e04f2e8167ef2424905145e88fc | 2025-08-16T11:48:22-05:00 | Jeff Bolz | | vulkan: fuse adds (#15252) |
| 450 | de2192794f4e8e04f2e8167ef2424905145e88fc | 2e2b22ba6607414a5d619ac6d2f034b5b02214e5 | 2025-08-16T04:18:31-05:00 | Jeff Bolz | | vulkan: Support mul_mat_id with f32 accumulators (#15337) |
| 451 | 912ff8c119f01ae029543c7fdf7a84f91a0437a3 | 5e6229a8409ac786e62cb133d09f1679a9aec13e | 2025-08-16T10:05:55+02:00 | rmatif | | OpenCL: add initial FA support (#14987) |
| 452 | 5e6229a8409ac786e62cb133d09f1679a9aec13e | e2c1bfff5305c661ac53e9d57cb732ff626a2242 | 2025-08-15T19:50:52+02:00 | Daniel Bevenius | | common : fix double bos, use common_chat_templates for add_bos and add_eos (#15326) |
| 453 | e2c1bfff5305c661ac53e9d57cb732ff626a2242 | 5edf1592fdb9131d01321aeef4241c6a34969e27 | 2025-08-16T00:52:14+08:00 | lhez | | opencl: add initial mxfp4 support via mv (#15270) |
| 454 | 5edf1592fdb9131d01321aeef4241c6a34969e27 | db3010bd23980bad5f5d93ec3e6757ec531a413b | 2025-08-15T17:16:36+03:00 | Georgi Gerganov | | vulkan : fix out-of-bounds access in argmax kernel (#15342) |
| 455 | db3010bd23980bad5f5d93ec3e6757ec531a413b | ff27f80a74bbe5303acd511a6781a1de6d619b3c | 2025-08-15T16:28:28+03:00 | Georgi Gerganov | | vulkan : fix compile warnings on macos (#15340) |
| 456 | ff27f80a74bbe5303acd511a6781a1de6d619b3c | d3248d9b6557c75d59954c594bb53cf517591e91 | 2025-08-15T21:11:22+08:00 | Aaron Teo | | ggml: initial IBM zDNN backend (#14975) |
| 457 | d3248d9b6557c75d59954c594bb53cf517591e91 | 7aeee88cfe9c0434eac722b0f7c21404f48758a5 | 2025-08-15T14:02:39+02:00 | Sigbjørn Skjæret | | ci : fix ios-xcode-build (#15324) |
| 458 | b07791aa1d4831a08ad54ca19aa206c0c5c0f34a | 4227c9be4268ac844921b90f31595f81236bd317 | 2025-08-15T11:23:17+02:00 | Johannes Gäßler | | test-opt: fix backend support check (#15317) |
| 459 | 4227c9be4268ac844921b90f31595f81236bd317 | df36bce667bf14f8e538645547754386f9516326 | 2025-08-14T23:21:24+02:00 | Johannes Gäßler | | CUDA: fix negative KV_max values in FA (#15321) |
| 460 | df36bce667bf14f8e538645547754386f9516326 | f75b8306472811ecc4e4457d5573a09201f02183 | 2025-08-14T22:10:51+03:00 | Georgi Gerganov | | eval-callback : stop on first NaN (#15320) |
| 461 | 7a0de960452f9a57de7f1d167e57b6f3ee5ac1b6 | e4e915912cfd2ee15c5a4a0074813232134892f6 | 2025-08-14T17:56:26+02:00 | Daniel Bevenius | | llama : add 18-layer model type for Gemma 3-270m (#15319) |
| 462 | e4e915912cfd2ee15c5a4a0074813232134892f6 | 5ba36f61033d2819be27e2abb70e9a3bd20c0fde | 2025-08-14T17:45:27+02:00 | simevo | | devops : fix compile bug when the BASE_CUDA_DEV_CONTAINER is based on Ubuntu 24.04 (#15005) |
| 463 | b204a5a234f4cf0b3f449476da639a5510c6d157 | 646944cfa8961afd914dd6637739b3cda9a72e11 | 2025-08-14T09:23:11-05:00 | Aldehir Rojas | | gpt-oss: implement harmony parsing (#15181) |
| 464 | 863d341eeb81db104902b14b6f9413daa515e957 | d32e03f4495d3efa1c5126f53b449f1d429c5664 | 2025-08-14T08:38:10-05:00 | Jeff Bolz | | vulkan: perf_logger improvements (#15246) |
| 465 | d32e03f4495d3efa1c5126f53b449f1d429c5664 | 3973163bff40f7f5161b0f08a0011729e2b0406a | 2025-08-14T14:59:50+03:00 | Georgi Gerganov | | server : add SWA checkpoints (#15293) |
| 466 | 5ade3000bd6040bf6878eafd6c77168552f73c47 | 8b2483730f90d6f23e2b188a54a210498bba937f | 2025-08-14T19:17:51+08:00 | Jason Ni | | ggml: fix ggml_conv_1d_dw bug (ggml/1323) |
| 467 | 810b9fc8b99dd55517a3e94c6dee29748d482559 | 4ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c4 | 2025-08-14T20:03:30+09:00 | kallewoof | | perplexity : provide a helpful hint for has_cpl case in split_equal error. (#15304) |
| 468 | 4ebd0c125b24a0d7a78b0ffc1d9567530ed8f0c4 | 5cdb27e0917479d2d742cea7beee089574bb09fa | 2025-08-14T12:22:07+02:00 | Sigbjørn Skjæret | | cuda : fix GGML_CUDA_GRAPHS=OFF (#15300) |
| 469 | 5cdb27e0917479d2d742cea7beee089574bb09fa | 3ea913f1ce9567289aedd866a569dbab8fb8e419 | 2025-08-14T03:03:57-07:00 | Jonathan Graehl | | finetune: SGD optimizer, more CLI args (#13873) |
| 470 | 3ea913f1ce9567289aedd866a569dbab8fb8e419 | 29c8fbe4e05fd23c44950d0958299e25fbeabc5c | 2025-08-14T15:16:32+09:00 | kallewoof | | perplexity: give more information about constraints on failure (#15303) |
| 471 | 1adc9812bd33dc85489bf093528d61c22917d54f | b3e16665e14032d1276f9d0263acef8321b6f518 | 2025-08-13T11:21:31-07:00 | Bas Nijholt | | fix(nix): remove non-functional llama-cpp cachix cache from flake.nix (#15295) |
| 472 | d8914fc47e8a69b28c670325cb1c8ce33e3a2960 | e885445bc1719d2e289a9b2e11714e0f994e68be | 2025-08-13T12:44:40+02:00 | Copilot | | common : add --override-tensor-draft, --cpu-moe-draft and --n-cpu-moe-draft parameters (#15191) |
| 473 | 648ebcdb739abfb5a9be14f4c5c0fd19ff268ef0 | 07aa869a91837d95fcb5612c65a188763ac38647 | 2025-08-13T15:14:44+05:00 | Ali Tariq | | ci : Added CI with RISC-V RVV1.0 Hardware (#14439) |
| 474 | 6028bf74351d35a06bd98498624f8c2f029f7d1a | bc5182272c373267352bc689e5fca276934bea2d | 2025-08-13T10:04:46+02:00 | Oliver Simons | | CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) |
| 475 | e71d48e3265027351e44a8e198f933c98f242c2e | b0493156fa8622694f21f42460a84da3eded0bc0 | 2025-08-13T14:54:30+09:00 | Tak-RS | | ggml-rpc: chunk send()/recv() to avoid EINVAL for very large tensors over RPC (macOS & others) (#15188) |
| 476 | f4586ee5986d6f965becb37876d6f3666478a961 | 60a76588106d22ccacd6b1a0d15d8545861d0a0d | 2025-08-12T13:58:22+02:00 | Romain Biessy | | sycl: Fix and disable more configurations of mul_mat (#15151) |
| 477 | efe3a90996ca6e67ca90f337fc03ad551082c408 | bbd57b7eafb3b32e3f7f3a2175bce0b35abc7de8 | 2025-08-12T17:21:45+08:00 | Aman Gupta | | CUDA cmake: add `-lineinfo` for easier debug (#15260) |
| 478 | 25ff6f7659f6a5c47d6a73eada5813f0495331f0 | be48528b068111304e4a0bb82c028558b5705f05 | 2025-08-12T10:02:51+08:00 | R0CKSTAR | | musa: fix failures in test-backend-ops for mul_mat_id op (#15236) |
| 479 | be48528b068111304e4a0bb82c028558b5705f05 | cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f | 2025-08-11T22:50:31+08:00 | hipudding | | CANN: Add broadcast for softmax and FA (#15208) |
| 480 | cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f | fba5c0d680b555cbac563fef57b33bc5c9621e08 | 2025-08-11T22:12:12+08:00 | rainred | | mtmd : Fix MinicpmV model converter and clip to avoid using hardcode. (#14750) |
| 481 | fba5c0d680b555cbac563fef57b33bc5c9621e08 | 53d0a1265826f40c5dbc01d06aeab9e14fcbd69b | 2025-08-11T15:31:35+02:00 | Xuan-Son Nguyen | | chat : hotfix gpt-oss jinja raising an exception (#15243) |
| 482 | 228f724d9ce6c56e8cec75bfdabab4dd013def7f | cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a | 2025-08-11T13:58:24+03:00 | Georgi Gerganov | | kv-cache : fix seq_rm with seq_id == -1 (#15226) |
| 483 | cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a | 50e81bdf5db563ab57a9a722b08f96fa8a76c927 | 2025-08-11T11:21:19+02:00 | Daniel Bevenius | | kv-cache : log (debug) all streams in find_slot (#15176) |
| 484 | 50e81bdf5db563ab57a9a722b08f96fa8a76c927 | 1ebbaddff2a44b0599df659175d3274bd5bbeb81 | 2025-08-11T11:15:44+02:00 | Sigbjørn Skjæret | | convert : fix merge conflicts (#15229) |
| 485 | 1ebbaddff2a44b0599df659175d3274bd5bbeb81 | a3a7874272e5a060079658eb5cca4617b7f99062 | 2025-08-11T10:21:24+02:00 | Daniel Bevenius | | perplexity : update comments/error msg to use decode [no ci] (#15227) |
| 486 | a3a7874272e5a060079658eb5cca4617b7f99062 | 002cb1bb3345967fbe0fa7766c2d94c2da31ef45 | 2025-08-11T10:07:49+02:00 | Julien Denize | | convert : improve Mistral models integration (#14737) |
| 487 | 002cb1bb3345967fbe0fa7766c2d94c2da31ef45 | 79c1160b073b8148a404f3dd2584be1606dccc66 | 2025-08-11T09:59:26+02:00 | Charles Xu | | kleidiai: fix unsigned overflow bug (#15150) |
| 488 | 79c1160b073b8148a404f3dd2584be1606dccc66 | 34c9d765bf173c551398f1e7fa4595019bc53bab | 2025-08-09T13:29:43-05:00 | David Zhao | | cuda: refactored ssm_scan and use CUB (#13291) |
| 489 | 34c9d765bf173c551398f1e7fa4595019bc53bab | e54d41befcc1575f4c898c5ff4ef43970cead75f | 2025-08-09T20:00:24+08:00 | Aman Gupta | | CUDA: add attention sinks for tile and wmma (#15178) |
| 490 | cd6983d56d2cce94ecb86bb114ae8379a609073c | 6c7e9a54406dbba5e53754a8f70a285414717b06 | 2025-08-08T21:37:22+09:00 | AN Long | | ggml : fix field name when new ggml_backend (#14944) |
| 491 | 50aa9389014bba2dd12234132aa6b8ca3601a17f | c4f53563df4575196ea13f5ed669ea8ea659a6be | 2025-08-07T23:26:03+02:00 | Xuan-Son Nguyen | | convert : support non-mxfp4 HF model (#15153) |
| 492 | 99acbc9921b119aa7ed929eb5780a66a8f06e6d9 | 7ad67ba9fe2b909e271dd31b99c5fce3aba35899 | 2025-08-08T00:20:40+08:00 | RunningLeon | | llama : Support intern-s1 (#14875) |
| 493 | 20638e4f16fcc21f836c7556e83bbf532bb5a0f0 | 36d3f00e142696f708ab297b9f8f1c825594712d | 2025-08-07T08:50:30+02:00 | Johannes Gäßler | | scripts: fix crash when --tool is not set (#15133) |
| 494 | 36d3f00e142696f708ab297b9f8f1c825594712d | 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 | 2025-08-07T05:31:48+02:00 | Daniel Bevenius | | requirements : fix PyTorch uint64 compatibility (#15134) |
| 495 | 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 | 756cfea82608911bbfcbf45164b8fdaddbafaa31 | 2025-08-06T15:14:40-07:00 | Reese Levine | | ggml: Add basic SET_ROWS support in WebGPU (#15137) |
| 496 | 756cfea82608911bbfcbf45164b8fdaddbafaa31 | e725a1a982ca870404a9c4935df52466327bbd02 | 2025-08-06T23:17:51+02:00 | rmatif | | fix profiling crash (#15072) |
| 497 | 476aa3fd5779b32d06cd84338f777da82341195c | 0d8831543cdc368fb248bae6f1b4aa5516684edc | 2025-08-06T17:28:48+01:00 | Juk Armstrong | | Fixed name `-override-tensors` to `-override-tensor` (#15129) |
| 498 | 0d8831543cdc368fb248bae6f1b4aa5516684edc | 65c797c4fad4d9966695ac4b4a1560be44109267 | 2025-08-06T05:37:35-07:00 | Diego Devesa | | ggml : fix fallback to CPU for ununsupported ops (#15118) |
| 499 | 65c797c4fad4d9966695ac4b4a1560be44109267 | 25726898e855ec6dffba227f2233a63c57184036 | 2025-08-06T13:26:49+02:00 | Sigbjørn Skjæret | | chat : fix yandex chat template (#15116) |
| 500 | 25726898e855ec6dffba227f2233a63c57184036 | 2241453252147bb7362a286977ee9f9a92130062 | 2025-08-06T17:48:30+08:00 | stevenkuang | | chat : fix hunyuan auto-detection (#15114) |
| 501 | 2241453252147bb7362a286977ee9f9a92130062 | 9515c6131aecaccc955fdedcfe16c3e030aaefcb | 2025-08-06T14:12:42+08:00 | Chenguang Li | | CANN: add support for ACL Graph (#15065) |
| 502 | 9515c6131aecaccc955fdedcfe16c3e030aaefcb | fd1234cb468935ea087d6929b2487926c3afff4b | 2025-08-05T16:26:38-07:00 | Reese Levine | | ggml: WebGPU disable SET_ROWS for now (#15078) |
| 503 | fd1234cb468935ea087d6929b2487926c3afff4b | f324a3b715d5c1081c110ce459f8a8486fb1ee89 | 2025-08-05T22:10:36+03:00 | Georgi Gerganov | | llama : add gpt-oss (#15091) |
| 504 | f324a3b715d5c1081c110ce459f8a8486fb1ee89 | be426425817bc3e6a2d91dae476dba6fa85894be | 2025-08-05T20:43:36+02:00 | Sigbjørn Skjæret | | chat : only remove double bos/eos if added (#15086) |
| 505 | 3306ceabf02e3df66666e5851800e843c7ca207e | c81de6e107ef51ef76aadcb8a6f008711c462517 | 2025-08-05T18:39:55+02:00 | Romain Biessy | | sycl: fix mul_mat selection (#15092) |
| 506 | c81de6e107ef51ef76aadcb8a6f008711c462517 | 22f060c9c4b5ef49a83a20eda25fcb792419580b | 2025-08-05T13:56:44+01:00 | Juk Armstrong | | Fix `glm4moe` bug (#15088) |
| 507 | 22f060c9c4b5ef49a83a20eda25fcb792419580b | ee3a9fcf88fe5b5e1213711e05861b83cd4fdfe6 | 2025-08-05T19:56:44+08:00 | Alex Wu | | webui: fix markdown table (#15081) |
| 508 | ee3a9fcf88fe5b5e1213711e05861b83cd4fdfe6 | ec428b02c347767f24c78111309e3f30d2ada289 | 2025-08-05T05:27:45-04:00 | compilade | | context : fix index overflow on huge outputs (#15080) |
| 509 | 19f68fa5a4c3bf796de52a6db9008e77d29f423a | 41613437ffee0dbccad684fc744788bc504ec213 | 2025-08-04T17:26:52-04:00 | compilade | | imatrix : warn when GGUF imatrix is saved without .gguf suffix (#15076) |
| 510 | 41613437ffee0dbccad684fc744788bc504ec213 | e5bebe5251cee2678e8531aa1598ca21b3c6ce1d | 2025-08-04T21:29:14+02:00 | Christian Kastner | | cmake: Add GGML_BACKEND_DIR option (#15074) |
| 511 | ef0144c087b33e5b8da42d529ac71aaf05cb49df | 2721257e3e2c4c944ac8a08221113ee7cb503f1b | 2025-08-05T04:29:25+10:00 | Sam | | model: support GLM 4.5 family of models (#14939) |
| 512 | 2721257e3e2c4c944ac8a08221113ee7cb503f1b | 587d0118f50b7e8f4bafbcdd218aefd9da0272e1 | 2025-08-04T18:11:02+02:00 | Sigbjørn Skjæret | | quantize : fix confusing error message if ftype is invalid (#15071) |
| 513 | 587d0118f50b7e8f4bafbcdd218aefd9da0272e1 | 5aa1105da24a8dd1661cea3db0582c9b2c2f54d3 | 2025-08-04T08:52:43-07:00 | Reese Levine | | ggml: WebGPU backend host improvements and style fixing (#14978) |
| 514 | 5aa1105da24a8dd1661cea3db0582c9b2c2f54d3 | d31192b4ee1441bbbecd3cbf9e02633368bdc4f5 | 2025-08-04T00:09:19-05:00 | Jeff Bolz | | vulkan: fix build when using glslang that does not support coopmat2 (#15062) |
| 515 | d31192b4ee1441bbbecd3cbf9e02633368bdc4f5 | 0a2f5496bef9e54e5f42d6c2c3ad9eb7b379aed0 | 2025-08-03T16:00:05-04:00 | compilade | | imatrix : use GGUF by default (#14842) |
| 516 | 0a2f5496bef9e54e5f42d6c2c3ad9eb7b379aed0 | 11a3811164ef2d75393c6b0a632f4c608e3e3dd2 | 2025-08-03T15:49:13-04:00 | compilade | | imatrix : fix 3d activation handling for hybrid and recurrent models (#14994) |
| 517 | 5c0eb5ef544aeefd81c303e03208f768e158d93c | 03d46982180c2fb624bd2a233e46426ab22be5d1 | 2025-08-02T10:51:18-07:00 | lhez | | opencl: fix adreno compiler detection logic (#15029) |
| 518 | 4fdea540bda4648f98b85e8ee9dc66db4bfb5945 | a4569c41fd2253c89ef52fc2378687bdbf42f61a | 2025-08-02T16:14:57+02:00 | Daniel Bevenius | | kv-cache : skip alignment of n_stream in kv-cache log msg [no ci] (#15040) |
| 519 | a4569c41fd2253c89ef52fc2378687bdbf42f61a | 15e92fd33791e60a4ddb5970b47242a855c27117 | 2025-08-02T17:14:21+03:00 | Georgi Gerganov | | llama : enable LLAMA_SET_ROWS=1 by default (#14959) |
| 520 | 15e92fd33791e60a4ddb5970b47242a855c27117 | 2bf3fbf0b54f97aef2b388b76d222789e1c170f1 | 2025-08-02T17:13:05+03:00 | Georgi Gerganov | | cuda, sycl : fix batched gemm when ne02 == 1 && ne03 > 1 (#15038) |
| 521 | 711d5e6fe66eb6cd7a10d71cec4567321848be08 | f738989dcb9ccbe468c945553eafbeef7b869675 | 2025-08-02T05:51:02-05:00 | Douglas Hanley | | convert : fix Qwen3-Embedding pre-tokenizer hash (#15030) |
| 522 | f738989dcb9ccbe468c945553eafbeef7b869675 | 4cb208c93c1c938591a5b40354e2a6f9b94489bc | 2025-08-02T18:04:48+08:00 | Jhen-Jie Hong | | chat : fix multiple tool_calls on hermes-2-pro (#14962) |
| 523 | a9f7541ec25c4c8547daf5ff48700ad2836e2b7d | 9c35706b98ea271858acef4194f526a71b24cdc9 | 2025-08-02T02:57:04-05:00 | Jeff Bolz | | vulkan: optimizations for direct convolution (#14933) |
| 524 | 9c35706b98ea271858acef4194f526a71b24cdc9 | c76b420e4ce06f7b7cdfbb0b85d02c90e5cc5a3a | 2025-08-01T20:47:32+02:00 | Johannes Gäßler | | CUDA: fix MMQ nwarps for AMD with warp_size==32 (#15014) |
| 525 | 0f5ccd6fd1a1f709010312933db0316867cc30b6 | 1c872f71fb8a25589efa3ee9b6bf8b517cb8caa4 | 2025-08-01T21:31:12+08:00 | stevenkuang | | model : add hunyuan dense (#14878) |
| 526 | baad94885df512bb24ab01e2b22d1998fce4d00e | ba42794c9ead96ad52311ba1b23eefcbf3d6f63d | 2025-08-01T11:50:33+05:30 | Srihari-mcw | | ggml : Q2k interleaving implementation - x86/x64 SIMD (#14373) |
| 527 | ba42794c9ead96ad52311ba1b23eefcbf3d6f63d | 2860d479b456e1caa026b40b829d5b13c42a8ed7 | 2025-08-01T06:38:12+03:00 | Georgi Gerganov | | graph : fix equal_seq() check (#14986) |
| 528 | 2860d479b456e1caa026b40b829d5b13c42a8ed7 | 484b2091ce5017901483b5204c07878f171d1441 | 2025-08-01T10:02:34+08:00 | diannao | | docker : add cann build pipline (#14591) |
| 529 | 784524053d986255e383dae45235e4f76c6792a7 | d6818d06a6237631523bc0f45d42e79482667948 | 2025-08-01T01:22:58+08:00 | Aman Gupta | | Fix params bug in diffusion example (#14993) |
| 530 | e08a98826bcce70a3377592c51d0efed99eafe07 | 952a47f455fbd92e2659b98b9b6317a2dafeb532 | 2025-07-31T17:46:54+02:00 | Ruben Ortlam | | Vulkan: Fix minor debug mode issues (#14899) |
| 531 | 952a47f455fbd92e2659b98b9b6317a2dafeb532 | 36e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce | 2025-07-31T23:22:17+08:00 | tc-mb | | mtmd : support MiniCPM-V 4.0 (#14983) |
| 532 | 94933c8c2eeaa9a7983e3f6c08af76bd86724094 | c1dacaa99b4ead6edbac928cd2da59436573f6b0 | 2025-07-31T05:25:23-07:00 | g2mt | | server : implement universal assisted decoding (#12635) |
| 533 | 8a4a85627702b569d7d2810f2de06a4321656e9d | 11490b36723d511d75fb601995c79b5c363ba3a2 | 2025-07-31T19:49:09+08:00 | Aman Gupta | | Add LLaDA 8b Diffusion model (#14771) |
| 534 | 11490b36723d511d75fb601995c79b5c363ba3a2 | 66625a59a54d0a7504eda4c4e83abfcd83ba1cf8 | 2025-07-31T19:47:20+08:00 | hipudding | | CANN: Improve loading efficiency after converting weights to NZ format. (#14985) |
| 535 | e9192bec564780bd4313ad6524d20a0ab92797db | 41e78c567e9a8c652e405f4f909deb598deecd31 | 2025-07-30T20:11:56+01:00 | Ed Addario | | quantize : fix using combined imatrix GGUFs (multiple datasets) (#14973) |
| 536 | e228de94496636681b36690247d96f97d5f76c0d | 73a8e5ca0372f4dcaf1aed4e42261723da0914aa | 2025-07-30T14:53:16+02:00 | Kai Pastor | | cmake : Fix BLAS link interface (ggml/1316) |
| 537 | 73a8e5ca0372f4dcaf1aed4e42261723da0914aa | 92b8810ec7aa6d778bc287cc918443cf67b962e2 | 2025-07-30T14:52:26+02:00 | Kai Pastor | | vulkan : fix 32-bit builds (ggml/1313) |
| 538 | 1e15bfd42c3938506e0da5939bf7f42780965f01 | a118d80233d3bf92569c051346fd2638f87bf202 | 2025-07-30T13:52:11+03:00 | Georgi Gerganov | | graph : fix stack-use-after-return (#14960) |
| 539 | a118d80233d3bf92569c051346fd2638f87bf202 | 61550f8231dc0aa478e2f537c5009ede6878ce22 | 2025-07-30T00:25:05-05:00 | Douglas Hanley | | embeddings: fix extraction of CLS pooling results (#14927) |
| 540 | 1a67fcc30677e96dda76bb1b290788e7d8852b51 | 204f2cf168dc01ca7b200b1510e0ff585ca9a92e | 2025-07-30T00:05:38+09:00 | kallewoof | | common : avoid logging partial messages (which can contain broken UTF-8 sequences) (#14937) |
| 541 | bbd0f917797e9d524680f1b30d34a46eb06d7651 | 0a5036bee9cfb946870689db4400e9e0d17844c9 | 2025-07-29T10:40:50+02:00 | Johannes Gäßler | | server-bench: make seed choice configurable (#14929) |
| 542 | bda62193b2a6bebbf515c3c389303094a44458c1 | c556418b600ad5792440942079d93e393595688b | 2025-07-28T09:04:27-07:00 | Leonard Mosescu | | test-backend-ops : extend test case filtering (#14865) |
| 543 | db16e2831c0f344f041af3d067db81c42b16eb22 | cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc | 2025-07-28T23:40:24+08:00 | xctan | | ggml-cpu : deduplicate scalar implementations (#14897) |
| 544 | cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc | 00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 | 2025-07-28T20:32:15+05:30 | Akarshan Biswas | | SYCL: Add set_rows support for quantized types (#14883) |
| 545 | 00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 | 946b1f685909c8c9c044f145bce819c02f327eaa | 2025-07-28T15:01:48+02:00 | Xuan-Son Nguyen | | mtmd : add support for Voxtral (#14862) |
| 546 | 946b1f685909c8c9c044f145bce819c02f327eaa | 6c6e397affc4fac717e718364fb4b635cec6433a | 2025-07-28T14:30:22+02:00 | Johannes Gäßler | | CUDA: fix pointer incrementation in FA (#14916) |
| 547 | 6c6e397affc4fac717e718364fb4b635cec6433a | afc0e8969896ada62238da07b98731e5a4b12ba4 | 2025-07-28T19:47:00+08:00 | Dongliang Wei | | model : add support for SmallThinker series (#14898) |
| 548 | 7f97599581fcf0c37432dd3b1f503b91bed97695 | bf78f5439ee8e82e367674043303ebf8e92b4805 | 2025-07-27T22:31:11+01:00 | Ed Addario | | quantize : update README.md (#14905) |
| 549 | ca0ef2dddb022cb1337d775cd05cd27d7808aff4 | 89d1029559bd2968f76db854f9f113d73e34527c | 2025-07-27T12:10:51+02:00 | Daniel Bevenius | | llama : clarify comment about pp and tg graphs [no ci] (#14895) |
| 550 | 89d1029559bd2968f76db854f9f113d73e34527c | f1a4e72de5950ab7136aeadddd675caf30dd6b3f | 2025-07-27T12:04:33+02:00 | Erik Scholz | | vulkan : add fp16 support for the conv_2d kernel (#14872) |
| 551 | f1a4e72de5950ab7136aeadddd675caf30dd6b3f | 4762ad7316dcdec20016ab5985fb46a27902204d | 2025-07-27T04:05:34-05:00 | Jeff Bolz | | vulkan: skip empty set_rows to avoid invalid API usage (#14860) |
| 552 | 4762ad7316dcdec20016ab5985fb46a27902204d | 1dc9614e0673e794d2e2bf88ba04f7d57b63a57b | 2025-07-27T03:18:37-05:00 | Gabriel Larson | | model : make rope_yarn_log_mul optional for deepseek2 (#14896) |
| 553 | 1dc9614e0673e794d2e2bf88ba04f7d57b63a57b | 446595b9b3a113d9ba10506922c3a156cca9d477 | 2025-07-27T16:38:44+09:00 | Shunta Saito | | llama : fix kq_scale for the attention layers of PLaMo2 (#14892) |
| 554 | 66906cd82a4a1fd10151707cee3f66cb61fc4055 | 11dd5a44eb180e1d69fac24d3852b5222d66fb7f | 2025-07-26T18:28:14-04:00 | deepsek | | HIP: Enable Matrix cores for MMQ Kernels, Enable stream-K for CDNA 3 (#14624) |
| 555 | 9b8f3c6c776d77045ee4f7f13fdf7863dfe59e5b | c7f3169cd523140a288095f2d79befb20a0b73f4 | 2025-07-26T10:36:02+08:00 | R0CKSTAR | | musa: fix build warnings (unused variable) (#14869) |
| 556 | c7f3169cd523140a288095f2d79befb20a0b73f4 | 793c0d7f46384001738c337d7afa46b45ae32745 | 2025-07-26T01:09:03+08:00 | Aaron Teo | | ggml-cpu : disable GGML_NNPA by default due to instability (#14880) |
| 557 | 793c0d7f46384001738c337d7afa46b45ae32745 | ce111d39d666f4a3b6a561ad020f6feb8cc67790 | 2025-07-25T10:47:39-06:00 | Gabe Goodhart | | metal: SSM_SCAN performance (#14743) |
| 558 | e7fecba93416c8aaf343932b5e36dd5e208a815e | e2b7621e7c265a6739225125cf9c534f471b3472 | 2025-07-25T23:25:05+09:00 | wooksong | | docs : update HOWTO‑add‑model.md for ModelBase and new model classes (#14874) |
| 559 | e2b7621e7c265a6739225125cf9c534f471b3472 | c1dbea752a630169c104118fd0c82f3ffcb19c91 | 2025-07-25T13:29:57+02:00 | Oliver Simons | | ggml : remove invalid portPos specifiers from dot files (#14838) |
| 560 | 749e0d27f0247337869f4698f59dd7fafba94326 | 64bf1c3744053cf7def10aeed21ff48883ee755b | 2025-07-25T19:08:04+08:00 | kiwi | | mtmd : fix 32-bit narrowing issue in export-lora and mtmd clip (#14503) |
| 561 | 64bf1c3744053cf7def10aeed21ff48883ee755b | c12bbde37258c6d053322d1cedd4a9672109ae58 | 2025-07-25T06:17:02-04:00 | Chris Rohlf | | rpc : check for null buffers in get/set/copy tensor endpoints (#14868) |
| 562 | c12bbde37258c6d053322d1cedd4a9672109ae58 | 3f4fc97f1d745f1d5d3c853949503136d419e6de | 2025-07-25T01:07:26-07:00 | Diego Devesa | | sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855) |
| 563 | 3f4fc97f1d745f1d5d3c853949503136d419e6de | 2df255da3cea108de0ae9b302ffdd31674b6d88d | 2025-07-25T03:05:37+08:00 | R0CKSTAR | | musa: upgrade musa sdk to rc4.2.0 (#14498) |
| 564 | 60f816a79dd74007158745530e71738aa6caa67e | 5592f278b6ec6aa4a1793e89e8c61838a12ebc9d | 2025-07-22T20:13:21+02:00 | Kai Pastor | | cmake : fix usage issues (ggml/1257) |
| 565 | 5592f278b6ec6aa4a1793e89e8c61838a12ebc9d | e4868d16d24dec55e61bcaadaca28feed8f98b13 | 2025-07-21T15:53:12+02:00 | Daniel Bevenius | | ggml-cpu : remove stdlib include from repack.cpp (ggml/1276) |
| 566 | 820de57d4faa427a3d0bfb14e48057247fae036e | cb4a63aad6650c2b536a7578403935388cb2920e | 2025-07-24T13:59:56+02:00 | Xuan-Son Nguyen | | chat : fix kimi-k2 chat template (#14852) |
| 567 | cb4a63aad6650c2b536a7578403935388cb2920e | 86f5623d904cfd392fdeb14a143097b4074660f6 | 2025-07-24T11:09:57+01:00 | Alberto Cabrera Pérez | | sycl: fixed semantics of block offset calculation (#14814) |
| 568 | 86f5623d904cfd392fdeb14a143097b4074660f6 | 39cffdf18855e0d2beba62572542251d87421e73 | 2025-07-24T17:50:51+08:00 | yummy | | llama : fix MiniCPM inference after Granite Four changes (#14850) |
| 569 | 065908cb09adff8b2a5f1173f80050d5d9a6790b | 4ec6291a2407404de52239c1f9ca66c07e7fb28b | 2025-07-24T10:24:05+03:00 | Georgi Gerganov | | metal : fix fusion across different encoders (#14849) |
| 570 | 4ec6291a2407404de52239c1f9ca66c07e7fb28b | a12363bbf0ca11f787dee9756861043136edc0df | 2025-07-24T13:50:41+09:00 | Donghyeon Jeong | | sycl: fix undefined variable in work group size check (#14843) |
| 571 | a12363bbf0ca11f787dee9756861043136edc0df | a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6 | 2025-07-23T23:23:57+02:00 | jacekpoplawski | | convert : text-only support for GLM-4.1V-9B-Thinking (#14823) |
| 572 | a86f52b2859dae4db5a7a0bbc0f1ad9de6b43ec6 | b284197df426fb189cdcfe56a43c863a788ac756 | 2025-07-23T21:43:25+02:00 | Johannes Gäßler | | CUDA: fix overflow in FA, tune performance (#14840) |
| 573 | b284197df426fb189cdcfe56a43c863a788ac756 | 221c0e0c5841a814e95b9bfd549de9d6ae00ac6e | 2025-07-23T18:22:30+02:00 | Johannes Gäßler | | CUDA: fix compilation with GGML_CUDA_F16 (#14837) |
| 574 | 07a19e27a26f76d34be62da53807f93131fb3cab | 18f3b5ff9e5eda4e7d04bceff8ffdccb0a696ed8 | 2025-07-23T12:35:53+02:00 | Johannes Gäßler | | CUDA: fix quantized KV cache + multiple sequences (#14822) |
| 575 | 7233358d29df3dfbf80693f2de7e5865401ad724 | 6c88b3bb2509d980e6a64c50fdf8dd304929f770 | 2025-07-23T16:16:41+08:00 | l3utterfly | | memory : handle saving/loading null layers in recurrent memory (#14675) |
| 576 | 6c88b3bb2509d980e6a64c50fdf8dd304929f770 | 14c28dfc50a2e3915e697122cd3c5343224009be | 2025-07-23T14:39:51+08:00 | lixing-star | | ggml: fix loongarch quantize_row_q8_1 error (#14827) |
| 577 | 14c28dfc50a2e3915e697122cd3c5343224009be | 8c988fa41db4d9dbc05abfd666c04def1259c645 | 2025-07-23T11:58:00+08:00 | chen fan | | CANN: weight format to NZ for Ascend310P3 (#14407) |
| 578 | 84712b60439453fb393c2ca753cee682a4ad41f5 | d4d1522b20809a350ffb094db20f40f17d3ab80f | 2025-07-22T10:35:21-05:00 | Jeff Bolz | | vulkan: fix rms_norm_mul to handle broadcasting dim0 (#14817) |
| 579 | d1aa0cc5d13ec3fa553de5d298f9166679e58479 | c8ade30036139e32108fee53d8b7164dbfda4bee | 2025-07-22T13:33:37+01:00 | Ed Addario | | imatrix: add option to display importance score statistics for a given imatrix file (#12718) |
| 580 | c8ade30036139e32108fee53d8b7164dbfda4bee | e28c0b80c249b5618c3a0d5e960f63929f380ac9 | 2025-07-22T12:51:03+02:00 | stduhpf | | Mtmd: add a way to select device for vision encoder (#14236) |
| 581 | 38d3af1b73302377111e88ddd725257638339286 | 6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 | 2025-07-21T22:55:10+02:00 | Sigbjørn Skjæret | | opencl: fix `im2col` when `KW!=KH` (#14803) |
| 582 | 6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 | cd465d823c378853f1f6570eebfb77f69c7e1d39 | 2025-07-21T19:03:19+02:00 | rmatif | | opencl: add conv2d kernel (#14403) |
| 583 | cd465d823c378853f1f6570eebfb77f69c7e1d39 | 922042601b8a16877ccb1c2afaa2071f76734f10 | 2025-07-21T18:39:29+02:00 | Romain Biessy | | sycl: Fix im2col (#14797) |
| 584 | 922042601b8a16877ccb1c2afaa2071f76734f10 | 2ba1333b35e471b344974dde553db11bf1c2836f | 2025-07-21T15:49:52+02:00 | Charles Xu | | kleidiai: add support for get_rows (#14676) |
| 585 | 2ba1333b35e471b344974dde553db11bf1c2836f | c2e058f1b4e799f1be085560c1bcef95b7b5ed02 | 2025-07-21T15:03:49+03:00 | Radoslav Gerganov | | docs : fix backends table in README.md (#14796) |
| 586 | c2e058f1b4e799f1be085560c1bcef95b7b5ed02 | c82d48ec23fb8749c341d0838f6891fd5f6b6da0 | 2025-07-21T06:35:40-05:00 | Jeff Bolz | | vulkan/cuda: Fix im2col when KW!=KH (#14789) |
| 587 | c82d48ec23fb8749c341d0838f6891fd5f6b6da0 | b4efd77f8ab407836ca73a5176f041650c5b2411 | 2025-07-21T17:38:36+08:00 | Molly Sophia | | llama : fix `--reverse-prompt` crashing issue (#14794) |
| 588 | 2be60cbc2707359241c2784f9d2e30d8fc7cdabb | b526ad2668944a7b2b1721f60679153646313831 | 2025-07-21T02:13:47+08:00 | Aman Gupta | | docs : fix link for tools/perplexity in README.md (#14780) |
| 589 | 938b785764683c298e7805e712f8728489cc2f18 | 36c153248faf969af1b62ab231348694b2047b8b | 2025-07-20T19:42:34+08:00 | Aman Gupta | | Clang-format: local files first + fix BinPacking (#14779) |
| 590 | a979ca22db0d737af1e548a73291193655c6be99 | 90083283ec254fa8d33897746dea229aee401b37 | 2025-07-19T21:59:08+02:00 | Ervin Áron Tasnádi | | ggml: adds CONV_2D op and direct GEMM Vulkan implementation (#14316) |
| 591 | 90083283ec254fa8d33897746dea229aee401b37 | d4b91ea7b2da253e1355b503f0fcb7b428ce005d | 2025-07-19T12:51:22-04:00 | compilade | | imatrix : use GGUF to store importance matrices (#9400) |
| 592 | 83f5872404baa39d826af2ef66351e63c64205a8 | f0d4d176df72734a543c29eef9f942850c13311e | 2025-07-19T17:47:53+02:00 | 0cc4m | | Vulkan: Fix fprintf format-security warning (#14770) |
| 593 | 9fb1042ce6719bc46dbe88ab013148aabe3105f1 | 2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b | 2025-07-18T20:08:33+03:00 | Georgi Gerganov | | graph : fix graph reuse reset of params (#14760) |
| 594 | 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 | d498af3d5a00f96bdd37b534860f03a6d9e98d39 | 2025-07-18T13:35:32+02:00 | Oliver Simons | | cuda : Fix Gemma3n not executed as CUDA_GRAPH on NVGPUs (#14741) |
| 595 | eacdeb5bfcb6c6cd54461fd0e9f04cab78bf975b | e0cb5c5cb8a61ac232130cf6bf878035f93824d9 | 2025-07-18T11:53:55+03:00 | Georgi Gerganov | | model : fix build after merge conflict (#14754) |
| 596 | 09651d09ffc1e941bd1be23163abf5495c416547 | 349ea79fcebc75b0c55bf61594a47736966d4f95 | 2025-07-18T06:25:54+02:00 | Nexes the Elder | | graph : Pass the graph placeholder message in debug mode (#14748) |
| 597 | 670e1360cd40f242ae76ba0966542fae6cb59392 | 760b4484e3c192a2649a6ffd0d90086c5558f849 | 2025-07-18T01:17:16+02:00 | Piotr Wilkin (ilintar) | | convert : fix Ernie4.5 MoE without shared experts (#14746) |
| 598 | cb887f1bc1001c92f7b4a595b9014f3a454a07ab | d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af | 2025-07-17T23:15:32+02:00 | Piotr Wilkin (ilintar) | | model: add Ernie 4.5 MoE support (#14658) |
| 599 | d6fb3f6b49b27ef1c0f4cf5128e041f7e7dc03af | 01612b74090df592663cfa01f661c9628f403b59 | 2025-07-17T20:52:33+03:00 | Georgi Gerganov | | kv-cache : fix k-shift for multiple streams (#14742) |
| 600 | 01612b74090df592663cfa01f661c9628f403b59 | 086cf81e88fb75287b71ff19c08a206b7bc2e02f | 2025-07-17T19:08:33+03:00 | Georgi Gerganov | | llama : reuse compute graphs (#14482) |
| 601 | 086cf81e88fb75287b71ff19c08a206b7bc2e02f | d9b691081c04ec5fb0daa9d2b979f915c142963d | 2025-07-17T09:22:11+02:00 | Tarek Dakhran | | llama : fix parallel processing for lfm2 (#14705) |
| 602 | ad57d3edd2f48cf6dc41a98fd9b303435ecb4fb0 | 1ba45d49822c39ca9a552c7b75efe0495ff400c3 | 2025-07-17T09:45:54+03:00 | Georgi Gerganov | | batch : fix uninitialized has_cpl flag (#14733) |
| 603 | 1ba45d49822c39ca9a552c7b75efe0495ff400c3 | 19e5943d9e976b59ccd5a0a87ae3d2ff3da44390 | 2025-07-17T01:52:08+02:00 | Sigbjørn Skjæret | | ci : disable failing vulkan crossbuilds (#14723) |
| 604 | 19e5943d9e976b59ccd5a0a87ae3d2ff3da44390 | 496957e1cbcb522abc63aa18521036e40efce985 | 2025-07-16T23:17:43+02:00 | Sigbjørn Skjæret | | convert : make hf token optional (#14717) |
| 605 | 496957e1cbcb522abc63aa18521036e40efce985 | 21c021745d781edf9c44b4972ef6cbbf53b0ecff | 2025-07-16T15:17:25-04:00 | Diner Burger | | llama : fix parameter order for hybrid memory initialization (#14725) |
| 606 | 21c021745d781edf9c44b4972ef6cbbf53b0ecff | b0f0ecc3dce806c68609d375a2b3edc430d8db18 | 2025-07-16T08:18:51-07:00 | Reese Levine | | ggml: Add initial WebGPU backend (#14521) |
| 607 | 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 | ab140198211385b85eeeb0abd549a4bbe259e10d | 2025-07-16T16:35:42+03:00 | Georgi Gerganov | | llama : add high-throughput mode (#14363) |
| 608 | ab140198211385b85eeeb0abd549a4bbe259e10d | 64978340b0b4a0a6e2fb74270c1509383d2eff32 | 2025-07-16T20:03:51+08:00 | Aman Gupta | | Support diffusion models: Add Dream 7B (#14644) |
| 609 | 64978340b0b4a0a6e2fb74270c1509383d2eff32 | 6ffd4e9c442e99afac3d138543ebf86d5fc5ee03 | 2025-07-16T14:43:32+03:00 | Georgi Gerganov | | ggml : add asserts (#14720) |
| 610 | e4841d24d3485ea4af54f8b65a19ec3123f0ff3c | 538cc77f7f44dfa047dba6a06d90c86dda69cf1d | 2025-07-16T19:12:22+09:00 | Shunta Saito | | llama : fix parallel processing for plamo2 (#14716) |
| 611 | 538cc77f7f44dfa047dba6a06d90c86dda69cf1d | 5cae76654113160f691f581930b69fc5535e8159 | 2025-07-16T12:13:57+03:00 | Georgi Gerganov | | server : fix handling of the ignore_eos flag (#14710) |
| 612 | 79e0b68c178656bb0632cb8602d2940b755077f8 | c81f4192f91a1e209c1eec7a84fe5371ef9175da | 2025-07-16T12:00:42+08:00 | Min-Hua | | llama: add LLAMA_API to deprecated llama_kv_self_seq_div (#14708) |
| 613 | 4a4f426944e79b79e389f9ed7b34831cb9b637ad | ba1ceb34566c889a1fc500efa79799ffed25d9b0 | 2025-07-15T14:54:22-05:00 | Gabriel Larson | | model : add Kimi-K2 support (#14654) |
| 614 | ba1ceb34566c889a1fc500efa79799ffed25d9b0 | 10a0351a97c25471aea0bbde9cca54d32d163eec | 2025-07-15T14:51:09-05:00 | Jeff Bolz | | vulkan: fix noncontig check for mat_mul_id splitting (#14683) |
| 615 | 68e37a61a7b24863f67541db65b4f6195962a268 | cbc68be51d88b1d5531643b926a4b359c3cff131 | 2025-07-16T01:11:42+09:00 | Shunta Saito | | model : add PLaMo-2 support (#14560) |
| 616 | cbc68be51d88b1d5531643b926a4b359c3cff131 | bdca38376f7e8dd928defe01ce6a16218a64b040 | 2025-07-15T15:28:53+08:00 | R0CKSTAR | | cuda: fix build warnings in set-rows.cu (unused variable) (#14687) |
| 617 | bdca38376f7e8dd928defe01ce6a16218a64b040 | 55c509daf51d25bfaee9c8b8ce6abff103d4473b | 2025-07-14T18:12:42+01:00 | Anton Mitkov | | sycl: Hotfix for non dnnl codepath (#14677) |
| 618 | 494c5899cb76859f32ddd913534f2685fd684a3d | 0f4c6ec0f1a9607ba67071f8a02c69b0afc2f91e | 2025-07-14T13:14:30+02:00 | Johannes Gäßler | | scripts: benchmark for HTTP server throughput (#14668) |
| 619 | 982e347255723fe6d02e60ee30cfdd0559c884c5 | 923e3ea2e3c96a0b4c208f53bc3bc90cdcdf13c0 | 2025-07-13T17:02:17+01:00 | Ed Addario | | quantize : fix minor logic flaw in --tensor-type (#14572) |
| 620 | 67eade1bf93f40e7c4975e5bd0782f426c89cff4 | 7de5c7cab61d4da4387ed9b216f88b96297bcc2d | 2025-07-12T19:07:08+02:00 | Tarek Dakhran | | docs : add LFM2 to models section (#14650) |
| 621 | 7de5c7cab61d4da4387ed9b216f88b96297bcc2d | 8eff95544e817704d44bec20f9fc956ce76a33be | 2025-07-12T21:31:38+08:00 | Aman Gupta | | CUDA: add set rows for f32 and f16 (#14551) |
| 622 | 0c1df14b5f8d992805cb22d0b77b44092a18aeab | b3ad3a0191994d6c47b2bd389d5c7431526ecd2c | 2025-07-12T06:21:02-04:00 | Douglas Hanley | | server : fix pooled embedding output (#14645) |
| 623 | b3ad3a0191994d6c47b2bd389d5c7431526ecd2c | 98197e5c98388470030d908f355ec5937dcccaaa | 2025-07-12T05:12:26-05:00 | Jeff Bolz | | vulkan: support SET_ROWS (#14587) |
| 624 | 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 | 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 | 2025-07-10T18:20:13-06:00 | Gabe Goodhart | | model : Granite Four (#13550) |
| 625 | 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 | 0b8855775c6b873931d40b77a5e42558aacbde52 | 2025-07-10T23:58:12+02:00 | rmatif | | opencl: add tiled mul_mat_f16_f32 (#14535) |
| 626 | 4bb625b713fd9b294b4f7af87eaa752b710c7cc1 | 11ee0fea2a24da1d3206eeba8fc52b759d9dfb24 | 2025-07-10T13:41:00-04:00 | Ryan Mangeno | | Smoldocling support (#14597) |
| 627 | 11ee0fea2a24da1d3206eeba8fc52b759d9dfb24 | a457551332853ef19d0796fec12b62c538126ea5 | 2025-07-10T23:29:01+08:00 | Aman Gupta | | Docs: script to auto-generate ggml operations docs (#14598) |
| 628 | 704bb7a71c01dc07c1478b85f6322bf5dfde1eaf | 435a6d10d618a015060e45a38c7e9f27f4243316 | 2025-07-10T13:59:38+05:30 | Akarshan Biswas | | SYCL: Initial set_rows kernel implementation (#14562) |
| 629 | 435a6d10d618a015060e45a38c7e9f27f4243316 | f9a867f5921a85f3fa64d7b067f4c8ffc5f62eb4 | 2025-07-10T09:00:20+02:00 | Xuan-Son Nguyen | | llama : minor coding style fix for smollm3 (#14605) |
| 630 | 4a5686da22057867c23bd4a6be941ddc8c51e585 | 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a | 2025-07-09T14:59:57-04:00 | compilade | | llama : support Jamba hybrid Transformer-Mamba models (#7531) |
| 631 | 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a | 26a48ad699d50b6268900062661bd22f3e792579 | 2025-07-09T18:16:12+02:00 | Xuan-Son Nguyen | | ggml : add ggml_scale_bias (#14417) |
| 632 | 04655063c47af6cbced295c8c7ad369402b15300 | 20b7bf8a32259ad9189a4797fd3e3a859c537b99 | 2025-07-09T12:03:49+04:00 | ibrahim khadraoui | | model : add support for Falcon-H1 family (#14534) |
| 633 | 20b7bf8a32259ad9189a4797fd3e3a859c537b99 | 6efcd65945a98cf6883cdd9de4c8ccd8c79d219a | 2025-07-09T08:26:13+02:00 | Xuan-Son Nguyen | | convert : fix smollm3 jinja template (#14586) |
| 634 | 699f4392a33f57c3352cf8d60bdc53db7ca235e7 | 08382869a2d6dca5d84710f2f82cc17a9696585a | 2025-07-09T00:29:29+08:00 | stevenkuang | | model : fix hunyuan moe chat template (#14584) |
| 635 | 08382869a2d6dca5d84710f2f82cc17a9696585a | bb4f7a9e4eec171fecf0f640b1337a1c24485560 | 2025-07-08T18:07:01+02:00 | Xuan-Son Nguyen | | model : add SmolLM3 (#14581) |
| 636 | bb4f7a9e4eec171fecf0f640b1337a1c24485560 | b8eeb8741d4483daf576498cf90537b4de71633c | 2025-07-08T11:37:47-04:00 | compilade | | memory : fix broken batch splits for recurrent cache (#14575) |
| 637 | b8eeb8741d4483daf576498cf90537b4de71633c | 17a1f0d2d407040ee242e18dd79be8bb212cfcef | 2025-07-08T08:21:21-05:00 | Jeff Bolz | | vulkan : fix rope with partial rotation and non-cont src (#14582) |
| 638 | 17a1f0d2d407040ee242e18dd79be8bb212cfcef | 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 | 2025-07-08T11:47:33+03:00 | Alawode Oluwandabira | | server: Add ability to mount server at prefix (#14544) |
| 639 | 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 | 53903ae6fa5f1caf187889c839cdd1ad25da4018 | 2025-07-08T10:24:06+02:00 | Xuan-Son Nguyen | | model : add hunyuan moe (#14425) |
| 640 | 4d0dcd4a06080e796e6742a88f2ffa7fc41b28b8 | 75c91de6e955d5b8f3f28173f5040593e1964eb3 | 2025-07-08T10:15:21+03:00 | Georgi Gerganov | | cuda : fix rope with partial rotation and non-cont src (#14580) |
| 641 | 68155c66f0e76680f34442247e589a090add22d3 | e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e | 2025-07-08T07:58:30+08:00 | R0CKSTAR | | musa: fix build warnings (unused variable) (#14561) |
| 642 | e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e | 12f55c302b35cfe900b84c5fe67c262026af9c44 | 2025-07-07T23:35:35+02:00 | Sigbjørn Skjæret | | llama : fix incorrect minicpm3 v_states shape (#14571) |
| 643 | e592be15756ae546ba87bb5a5250b71248121971 | a0374a67e2924f2e845cdc59dd67d9a44065a89c | 2025-07-06T03:08:16-05:00 | Jeff Bolz | | vulkan: fix rms_norm+mul fusion (#14545) |
| 644 | a0374a67e2924f2e845cdc59dd67d9a44065a89c | ddef99522d1ba74193b7394e803fab8db5c78bae | 2025-07-05T02:26:04-05:00 | Jeff Bolz | | vulkan: Handle updated FA dim2/3 definition (#14518) |
| 645 | ddef99522d1ba74193b7394e803fab8db5c78bae | 668168814601d2aef6161ce49ab186bc74177ae7 | 2025-07-05T09:17:14+02:00 | Sigbjørn Skjæret | | server : fix assistant prefilling when content is an array (#14360) |
| 646 | b81510a7b78f7c5a6f069c4f3d0e569b9d287913 | ef797db357e44ecb7437fa9d22f4e1614104b342 | 2025-07-05T12:10:53+08:00 | R0CKSTAR | | test-backend-ops: add support for specifying output format (#14368) |
| 647 | 7b63a71a6b0f54effe9b94073d4d0519dcf53676 | 0c2ee38ab729f3f6a7c28dc4c5dcd8d5f0cbf8fc | 2025-07-03T11:00:03+02:00 | Nicolò Scipione | | Fix conditional enabling following arch checks for ggml-sycl (#14504) |
| 648 | 9067487c4411efb20400103fcccfdd389c80d428 | d4cdd9c1c3cebdafca735958597de4ff7b7c0f54 | 2025-07-03T10:46:57+03:00 | Georgi Gerganov | | ggml : fix FA mask dim 2 and 3 (#14505) |
| 649 | 5d46babdc2d4675d96ebcf23cac098a02f0d30cc | e17991c466ac835b2c71bd813c1ca7ff8dd97b94 | 2025-07-02T13:10:24-04:00 | compilade | | llama : initial Mamba-2 support (#9126) |
| 650 | 307e79d33d4cdd9f1d6c42fc861724e6ba12b98f | d7f5f4e578d1f60b0835d1734a50438c309b3e5c | 2025-07-02T20:38:10+08:00 | zhouwg | | opencl : fix possible buffer overflow in dump_tensor (#14490) |
| 651 | d7f5f4e578d1f60b0835d1734a50438c309b3e5c | c8a4e470f65c3a932e18eddc5fba1844876d7463 | 2025-07-02T14:12:07+03:00 | Georgi Gerganov | | simple-chat : fix context-exceeded condition (#14494) |
| 652 | 85841e121db5b96ae4d277a3cd3995eef66b98ec | 68b3cd65141586ef13a698baa9029627f038f102 | 2025-07-02T13:41:35+08:00 | Eric Zhang | | github : add OpenCL backend to issue templates (#14492) |
| 653 | 68b3cd65141586ef13a698baa9029627f038f102 | de569441470332ff922c23fb0413cc957be75b25 | 2025-07-02T07:19:31+02:00 | Björn Ganster | | ggml : Callback before abort (#14481) |
| 654 | 343b6e94b61674ac94e64ede7b7ea3365793f7ed | 6a746cf9c40f8d93d13eb8a6c2b989a15e7fa61a | 2025-07-01T16:47:30+08:00 | Chenguang Li | | CANN: update aclnnGroupedMatmulV2 to aclnnGroupedMatmulV3 (#14411) |
| 655 | 497be7c01dab243100f9c42e0a763a746e42d038 | 79b33b231774d5c39c8df018e9a276becae6d41a | 2025-06-24T06:10:16+02:00 | Daniel Bevenius | | ggml-quants : rename best_mad to best_error (ggml/1283) |
| 656 | 0a5a3b5cdfd887cf0f8e09d9ff89dee130cfcdde | 745f11fed09ba2303f3f494efb12286d382608e5 | 2025-06-30T23:57:04+08:00 | Aman Gupta | | Add Conv2d for CPU (#14388) |
| 657 | 745f11fed09ba2303f3f494efb12286d382608e5 | 5dd942de5922a22ec8446a4ad2203738dbcb9389 | 2025-06-30T18:03:03+03:00 | Georgi Gerganov | | memory : correctly handle failure in apply() (#14438) |
| 658 | caf5681fcb47dfe9bafee94ef9aa8f669ac986c7 | 83790b0e7e09ab17238b16452a33053a71dbdfad | 2025-06-29T20:02:53+02:00 | matteo | | server : support jinja extra template kwargs (Qwen3 enable_thinking feature), from command line and from client (#13196) |
| 659 | 83790b0e7e09ab17238b16452a33053a71dbdfad | f47c1d7106e49062279bcc57fc1077c0db61e278 | 2025-06-29T19:29:57+02:00 | Renat | | server : fix appearance of the chats list context menu for Safari (#14322) |
| 660 | f47c1d7106e49062279bcc57fc1077c0db61e278 | a5d1fb6212298db1be1639db4c03adb2c522ee13 | 2025-06-29T21:07:58+05:30 | Akarshan Biswas | | SYCL: disable faulty fp16 exp kernel (#14395) |
| 661 | a5d1fb6212298db1be1639db4c03adb2c522ee13 | a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 | 2025-06-29T14:38:10+02:00 | Sigbjørn Skjæret | | ggml : fix unmerged GGML_FPxx_TO_FPxx refactoring (#14443) |
| 662 | a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 | bd9c981d7226107f18deb8344c3301450311bb8b | 2025-06-29T11:04:10+02:00 | Sigbjørn Skjæret | | ggml : implement REGLU/GEGLU/SWIGLU ops (#14158) |
| 663 | bd9c981d7226107f18deb8344c3301450311bb8b | 27208bf657cfe7262791df473927225e48efe482 | 2025-06-29T02:43:36-05:00 | Jeff Bolz | | vulkan: Add fusion support for RMS_NORM+MUL (#14366) |
| 664 | 27208bf657cfe7262791df473927225e48efe482 | 63a7bb3c7e1c6b0a92d03b0a594d3cd501d6ed3e | 2025-06-29T01:30:53+08:00 | Aman Gupta | | CUDA: add bf16 and f32 support to cublas_mul_mat_batched (#14361) |
| 665 | b25e92774e2fa4ee3820e458d5cf43f40190f8d2 | 6609507a910aa7437aaa53fd999447de3947d998 | 2025-06-28T17:35:41+08:00 | Xinpeng Dou | | fix async_mode bug (#14432) |
| 666 | 6609507a910aa7437aaa53fd999447de3947d998 | ceb1bf5a34d5e66e28b23dcc7a3cd83fe1e27481 | 2025-06-28T09:57:07+02:00 | Sigbjørn Skjæret | | ci : fix windows build and release (#14431) |
| 667 | ceb1bf5a34d5e66e28b23dcc7a3cd83fe1e27481 | 72babea5dea56c8a8e8420ccf731b12a5cf37854 | 2025-06-27T22:35:30-05:00 | Jeff Bolz | | vulkan: Fix GGML_VULKAN_SHADER_DEBUG_INFO (#14427) |
| 668 | 8d94219a4a7f2da72ee542019ca01f36af93d1d6 | f667f1e6244e1f420512fa66692b7096ff17f366 | 2025-06-27T16:41:40+03:00 | Radoslav Gerganov | | ggml : add ggml_set_rows (#14274) |
| 669 | f667f1e6244e1f420512fa66692b7096ff17f366 | 8846aace4934ad29651ea61b8c7e3f6b0556e3d2 | 2025-06-27T10:42:19+02:00 | Sigbjørn Skjæret | | convert : fix broken sentencepiece vocab (#14416) |
| 670 | a01047b041aa04aeea351933658433ed004516ab | b25346221dadb9101aa9dda55431dde4d3596943 | 2025-06-26T13:46:53-03:00 | bandoti | | cmake: regen vulkan shaders when shaders-gen sources change (#14398) |
| 671 | b25346221dadb9101aa9dda55431dde4d3596943 | e8215dbb96b8fb94a24c29cdd228166fb972dbfc | 2025-06-26T15:01:14+02:00 | Sigbjørn Skjæret | | llama : return mistral-v7-tekken as default template only (#14390) |
| 672 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 2025-06-26T15:10:45+08:00 | Yunzhe Jia | | Squashed commit of the following: |
| 673 | 716301d1b03c31875ec3b24526c48c8b1bd0fd8c | 60ef23d6c14d325d83eae5752e5de39ad268e9b0 | 2025-06-26T12:11:59+08:00 | R0CKSTAR | | musa: enable fp16 mma (all) and cublas on qy2 (#13842) |
| 674 | 60ef23d6c14d325d83eae5752e5de39ad268e9b0 | b193d5306912a2adae0fde7481819f6ee0941bc6 | 2025-06-26T05:49:04+08:00 | Aaron Teo | | ggml-cpu: enable IBM NNPA Vector Intrinsics (#14317) |
| 675 | b193d5306912a2adae0fde7481819f6ee0941bc6 | 2bf9d539dd158345e3a3b096e16474af535265b4 | 2025-06-25T23:26:51+02:00 | Sigbjørn Skjæret | | ggml : do not output unprintable characters on GGUF load failure (#14381) |
| 676 | 2bf9d539dd158345e3a3b096e16474af535265b4 | 73e53dc834c0a2336cd104473af6897197b96277 | 2025-06-25T17:09:55+01:00 | Anton Mitkov | | sycl: GGML_SYCL_DISABLE_OPT on by default for all Intel Devices (#13973) |
| 677 | 62af464227dafa1c55e0535bcb24346326748f46 | c148cf1946275952a79ad50b6199725f12a70411 | 2025-06-24T18:26:30+03:00 | Georgi Gerganov | | batch : fix check for empty sequences in memory (#14364) |
| 678 | 7b50d589a863c7631135c1226f6eab65cb406212 | 3a9457df962b5883f2773f1c295e8c19df60d89f | 2025-06-23T12:27:35+03:00 | Georgi Gerganov | | kv-cells : fix tracking of seq_pos (#14339) |
| 679 | 238005c2dc67426cf678baa2d54c881701693288 | 66aba7aca9a245d71f1ddf02c7a97223529752a8 | 2025-06-22T19:46:17+02:00 | Sigbjørn Skjæret | | gguf-py : fix SpecialVocab parsing when post_processor is null (#14330) |
| 680 | 66aba7aca9a245d71f1ddf02c7a97223529752a8 | f1f5e82df6222dcbaca6396c0de44df259a1694f | 2025-06-23T01:28:06+08:00 | Ruikai Peng | | run : avoid double tokenization (#14327) |
| 681 | f1f5e82df6222dcbaca6396c0de44df259a1694f | af3373f1adfca56119f3e4de0e6a0a8df8edf3d9 | 2025-06-22T20:10:07+03:00 | Georgi Gerganov | | examples : fix is_first logic for tokenization (#14329) |
| 682 | 5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3 | 40bfa04c95c19fb42bafd4e21b5c2a7771846801 | 2025-06-22T21:44:57+09:00 | yuiseki | | mtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326) |
| 683 | aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26 | bb16041caef45cd4348cd6f84906b5dfec7a1f6a | 2025-06-21T18:12:05+02:00 | Sigbjørn Skjæret | | gguf-py : fix Qwen3-Embedding eos token (#14314) |
| 684 | bb16041caef45cd4348cd6f84906b5dfec7a1f6a | 58cba76a9aab728717509d62b67c13afd8dc227a | 2025-06-21T08:17:12+02:00 | Markus Tavenrath | | Add support for VK_EXT_debug_utils to add labels to Vulkan objects. (#13792) |
| 685 | 58cba76a9aab728717509d62b67c13afd8dc227a | 67ae5312e255ae97852a4a216e2245580bfafd72 | 2025-06-21T07:33:21+02:00 | Sigbjørn Skjæret | | gguf-py : fix TemplateProcessing pair when bos/eos is missing (#14312) |
| 686 | 67ae5312e255ae97852a4a216e2245580bfafd72 | 692e3cdd0a069ab56411b64506a67537d767683e | 2025-06-21T08:04:18+03:00 | Georgi Gerganov | | metal : fix thread-safety (#14300) |
| 687 | 692e3cdd0a069ab56411b64506a67537d767683e | b23fa0b3f40165ca3aae8ad4ee756e72f9a130dd | 2025-06-21T08:03:46+03:00 | Georgi Gerganov | | memory : rename interface to llama_memory_context_i (#14296) |
| 688 | b23fa0b3f40165ca3aae8ad4ee756e72f9a130dd | 06cbedfca1587473df9b537f1dd4d6bfa2e3de13 | 2025-06-20T21:32:01-07:00 | Daniel Han | | convert : fix Llama 4 conversion (#14311) |
| 689 | d860dd99a4178f58d1d1fa64eebc2aabc95392a7 | c959f462a0b4d42eaf930ffd72df0e435c97d5d5 | 2025-06-21T01:43:35+08:00 | David Chiu | | docs : fix the link to llama.h (#14293) |
| 690 | dd6e6d0b6a4bbe3ebfc931d1eb14db2f2b1d70af | 8308f98c7fb778e54bf75538f5234d8bd20915e9 | 2025-06-20T22:13:06+08:00 | Ruikai Peng | | vocab : prevent tokenizer overflow (#14301) |
| 691 | e28c1b93fd7d3f8faf9551d962e8a65fe2122e38 | d27b3ca1758dfb1718e333d497ef4b68ad109bc2 | 2025-06-20T04:57:36-07:00 | Diego Devesa | | cuda : synchronize graph capture and cublas handle destruction (#14288) |
| 692 | d27b3ca1758dfb1718e333d497ef4b68ad109bc2 | 9230dbe2c757e2d5071329095727d0fa9d4b85c4 | 2025-06-20T11:19:15+03:00 | Georgi Gerganov | | ggml : fix repack work size for mul_mat_id (#14292) |
| 693 | 812939a9e90f99d1bd5bb1bc6b99d12600671d50 | 4c9fdfbe1580a66fd7d77c77418ce2c606a29fdd | 2025-06-20T10:50:27+03:00 | Georgi Gerganov | | model : more uniform output id handling (#14275) |
| 694 | 9eaa51e7f08593f123f00136591179a8f5956ecd | 8f71d0f3e86ccbba059350058af8758cafed73e6 | 2025-06-20T09:50:24+08:00 | Aman Gupta | | CUDA: add conv_2d_dw (#14265) |
| 695 | 456af35eb70177b8dd5779b6d4c21bb020f9cebd | 600e3e9b50c1f0c9fc4a70356241fd87f00e8e14 | 2025-06-19T20:49:48+08:00 | fanyang | | build : suppress gcc15 compile warnings (#14261) |
| 696 | fffcce535ebbdc25f81966a15b758658788e7466 | 5fc7856815920f828f9e90cb759ac82c7f0c1ea5 | 2025-06-19T13:24:12+03:00 | bashayer hijji | | llama-bench : add --no-warmup flag (#14224) (#14270) |
| 697 | 5fc7856815920f828f9e90cb759ac82c7f0c1ea5 | faed5a5f5dde4d816adecdccb4f4682a04126f92 | 2025-06-19T12:21:40+02:00 | pqnet | | convert : fix remote option in Windows (#14100) |
| 698 | edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 | ed3290ab34493fd3d2e0f925f816a401da4f2dfd | 2025-06-19T00:08:14-05:00 | Gabe Goodhart | | memory : Hybrid recurrent cache (#13979) |
| 699 | 8d947136546773f6410756f37fcc5d3e65b8135d | 50d2227953ca9024f04255b4f116d06fcc0db74c | 2025-06-19T01:10:26+08:00 | Aaron Teo | | docs: add s390x build documentation (#14264) |
| 700 | 6231c5cd6d49d61511f328b5f43322407df90a91 | ef035803eb9dbc306ea9a8ff82e30af12b567cf7 | 2025-06-19T01:06:49+08:00 | Aaron Teo | | ggml-cpu: fix uncaught underscore terminators (#14023) |
| 701 | 413977de32e90712ecec84d0b9c738847da8dc02 | 95402553a5effc61ddc9e29c7bcb56f71311dd4a | 2025-06-18T10:43:57+02:00 | Xuan-Son Nguyen | | mtmd : refactor llava-uhd preprocessing logic (#14247) |
| 702 | 95402553a5effc61ddc9e29c7bcb56f71311dd4a | 3865cff4f5b84c16119590efd6ce537789a27715 | 2025-06-18T09:58:43+02:00 | Xuan-Son Nguyen | | llama-chat : fix multiple system message for gemma, orion (#14246) |
| 703 | 3865cff4f5b84c16119590efd6ce537789a27715 | d03172cc797b6adbbc00bfc09caf614fb0f895a0 | 2025-06-18T09:52:07+02:00 | Sigbjørn Skjæret | | convert : fix null head_dim AutoConfig regression (#14248) |
| 704 | dd8e59f4435342eda93c5b0cf4109e21c9c7d0eb | bbe98d27840453c8787d18470963530fdc27d89f | 2025-06-13T15:06:42+02:00 | Daniel Bevenius | | ggml : disable warnings for tests when using MSVC (ggml/1273) |
| 705 | bbe98d27840453c8787d18470963530fdc27d89f | c2056ed6d461e6d5432f04f221e221ab795dc652 | 2025-06-13T09:05:44+02:00 | Daniel Bevenius | | ggml : remove unused ggml_context_container (ggml/1272) |
| 706 | fe9d60e74a6cb71bcaed2029377bfa2872b4abb0 | e434e69183fd9e1031f4445002083178c331a28b | 2025-06-17T17:48:08+08:00 | R0CKSTAR | | musa: fix build warning (unused variable) (#14231) |
| 707 | e434e69183fd9e1031f4445002083178c331a28b | 89fea80d298184d1cd93564f48e060d9f541f4b4 | 2025-06-16T21:58:42+02:00 | Sigbjørn Skjæret | | common : suggest --jinja when autodetection fails (#14222) |
| 708 | 89fea80d298184d1cd93564f48e060d9f541f4b4 | 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 | 2025-06-16T22:33:27+03:00 | Georgi Gerganov | | server : fix incorrect usage of llama_get_embeddings() (#14225) |
| 709 | ad590be98c83217fcf1a101d78d9ab389fd5dc0b | 7d6d91babfa129906b39c9099eca4234c44f4f1e | 2025-06-16T21:53:41+09:00 | Đinh Trọng Huy | | model : add NeoBERT (#14164) |
| 710 | 7d6d91babfa129906b39c9099eca4234c44f4f1e | d3e64b9f490cee41b7b9aa275dae2f6568ae3054 | 2025-06-16T13:47:38+02:00 | uvos | | HIP: disable rocwmma on gfx12 by default until rocm 7.0 (#14202) |
| 711 | d3e64b9f490cee41b7b9aa275dae2f6568ae3054 | 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb | 2025-06-16T14:14:00+03:00 | Georgi Gerganov | | llama : rework embeddings logic (#14208) |
| 712 | 0bf49eb668bb95b50e41583e22aaf60ddade1fbe | 4ad243677bca6c97f14dbc187b2116b51fcb7ffd | 2025-06-16T09:16:06+01:00 | Bartowski | | convert : remove arcee change in convert_hf_to_gguf_update.py (#14207) |
| 713 | c89c2d1ab94b11845240b7d3313c87691ea18d88 | 3555b3004ba7687be3d734acade52a3345758aa4 | 2025-06-16T00:21:08-06:00 | Jeff Bolz | | vulkan: mutex around vkQueueSubmit (#14127) |
| 714 | 3555b3004ba7687be3d734acade52a3345758aa4 | d7da8dc83a03b30e1ec10317080082ea76840c38 | 2025-06-16T13:54:15+08:00 | xctan | | ggml-cpu : rework weak alias on apple targets (#14146) |
| 715 | d7da8dc83a03b30e1ec10317080082ea76840c38 | cd355eda7df1898d25d433b4bdaa4b4b479e0bad | 2025-06-16T00:04:06+01:00 | Bartowski | | model : Add support for Arcee AI's upcoming AFM model (#14185) |
| 716 | 30e5b01de2a0bcddc7c063c8ef0802703a958417 | e54b394082de242be4ee2e692b11fcc8d4eba371 | 2025-06-15T17:53:45+01:00 | Ed Addario | | quantize : change int to unsigned int for KV overrides (#14197) |
| 717 | e54b394082de242be4ee2e692b11fcc8d4eba371 | 2c2caa444341d99c87ff153f142c2d4762a776a2 | 2025-06-15T17:30:13+02:00 | uvos | | CUDA/HIP: fix ssm_scan on devices where warp size is not 32 (#14196) |
| 718 | 5fce5f948df8f189a5401a8ecaa9753106e75abb | 9ae4143bc6ecb4c2f0f0301578f619f6c201b857 | 2025-06-15T10:52:11+03:00 | Georgi Gerganov | | kv-cache : fix use-after-move of defrag info (#14189) |
| 719 | b9912ac570de8945ae9383c9ca8291027bf287dd | 00ba7726100d7e1941d9f5a06f56a7559945b33c | 2025-06-15T09:18:37+03:00 | Georgi Gerganov | | batch : auto-gen positions + verify multi-sequence input (#14177) |
| 720 | 3cb203c89f60483e349f841684173446ed23c28f | 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f | 2025-06-14T18:25:15+02:00 | Piotr | | llama-chat : Do not throw when tool parsing fails (#14012) |
| 721 | 2e42be42bd6bf1dcc643d6ac4e77419bfe5dd24f | fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab46 | 2025-06-14T16:34:20+08:00 | Aman Gupta | | compare-llama-bench: add option to plot (#14169) |
| 722 | fb85a288d72abbd5e5daa8de96e6f8bfa7b5ab46 | 40643edb86eb10b471b0f57d4f3f7eb0e06a0df7 | 2025-06-13T20:03:05+03:00 | Georgi Gerganov | | vocab : fix build (#14175) |
| 723 | 40643edb86eb10b471b0f57d4f3f7eb0e06a0df7 | 3cfbbdb44e08fd19429fed6cc85b982a91f0efd5 | 2025-06-13T17:32:56+01:00 | Svetlozar Georgiev | | sycl: fix docker image (#14144) |
| 724 | 80709b70a2f87c13ccaf1480b799393109996789 | 26ff3685bfbaa4c8838d7afd988b17dd5eb99f92 | 2025-06-13T18:35:00+03:00 | Georgi Gerganov | | batch : add LLAMA_BATCH_DEBUG environment variable (#14172) |
| 725 | ffad04397399ea1650fda6560c7c753059804876 | 0889eba570126f8a2f5a0e88fde776bbc91cca66 | 2025-06-13T11:18:25+03:00 | Georgi Gerganov | | server : fix SWA condition for full context reprocess (#14163) |
| 726 | c61285e7396c8e526fe7794c19e8d4f1c99bfc51 | 09cf2c7c655c90e53e100f29b830a788bab0653d | 2025-06-13T08:45:37+01:00 | Ewan Crawford | | SYCL: Bump oneMath commit (#14152) |
| 727 | 09cf2c7c655c90e53e100f29b830a788bab0653d | c33fe8b8c4427202706b1434e9fc8ab5752c9cac | 2025-06-13T06:51:34Z | Christian Kastner | | cmake : Improve build-info.cpp generation (#14156) |
| 728 | f6e1a7aa8787b5c00acba6370cb70a0beff48b1e | c3ee46fab49a765d2e32e171e9ed7a5fa121dd9c | 2025-06-12T11:50:01+03:00 | Georgi Gerganov | | context : simplify output counting logic during decode (#14142) |
| 729 | e2c0b6e46a5596665569ae765f0993cea2619af6 | 9596506965f65be5d802ecef6a315fe43d2391a8 | 2025-06-12T10:14:24+03:00 | Georgi Gerganov | | cmake : handle whitepsaces in path during metal build (#14126) |
| 730 | 9596506965f65be5d802ecef6a315fe43d2391a8 | a20b2b05bce6622c585459ebf46f142f113d021c | 2025-06-12T10:02:15+03:00 | Georgi Gerganov | | kv-cache : fix split_equal handling in unified implementation (#14130) |
| 731 | a20b2b05bce6622c585459ebf46f142f113d021c | 2e89f76b7af2c0b827be785e445f2e2b3e52e1ca | 2025-06-12T02:56:04-04:00 | compilade | | context : round n_tokens to next multiple of n_seqs when reserving (#14140) |
| 732 | 2e89f76b7af2c0b827be785e445f2e2b3e52e1ca | 532802f938c6a18cc6a704057ab571f253fd77ed | 2025-06-11T17:19:44-03:00 | bandoti | | common: fix issue with regex_escape routine on windows (#14133) |
| 733 | 532802f938c6a18cc6a704057ab571f253fd77ed | d4e0d95cf581f50c9a21d06eaecae2dd580076bd | 2025-06-11T19:07:44Z | Christian Kastner | | Implement GGML_CPU_ALL_VARIANTS for ARM (#14080) |
| 734 | bd248d4dc7265437e1918dc53ae3f49a0c592e5f | 7781e5fe99f2a4fc1c8af0a8488eedac4644cb72 | 2025-06-11T09:48:52-05:00 | Jeff Bolz | | vulkan: Better thread-safety for command pools/buffers (#14116) |
| 735 | 2baf07727f921d9a4a1b63a2eff941e95d0488ed | 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 | 2025-06-11T06:43:43-04:00 | Taylor | | server : pass default --keep argument (#14120) |
| 736 | 7ae2932116a4de3141cbc8c488f7f6e4e06d8171 | 1f7d50b2936023b26eb218e944e62834b80a2ce0 | 2025-06-11T12:52:45+03:00 | Georgi Gerganov | | kv-cache : add LLAMA_KV_CACHE_DEBUG environment variable (#14121) |
| 737 | dad5c44398b78467943ed0a603ea427fe9f6fc62 | 55f6b9fa6563f6ae49113f9abdc980c12348cc1c | 2025-06-10T18:20:14-04:00 | compilade | | kv-cache : avoid modifying recurrent cells when setting inputs (#13834) |
| 738 | 55f6b9fa6563f6ae49113f9abdc980c12348cc1c | 3678b838bb71eaccbaeb479ff38c2e12bfd2f960 | 2025-06-10T23:29:52+02:00 | Sigbjørn Skjæret | | convert : fix duplicate key DeepSeek-R1 conversion error (#14103) |
| 739 | 3a12db23b6918682ccb70ab15d897f11fe5fc320 | ae92c1855b1a5b604fa1bfcced19a556ab3e78c5 | 2025-06-10T16:48:07+01:00 | Juk Armstrong | | Fixed spec timings to: accepted/tested instead of accepted/drafted (#14104) |
| 740 | b7ce1ad1e332da5909772d173a7e6748fbd1887a | 97340b4c9924be86704dbf155e97c8319849ee19 | 2025-06-10T11:34:10+03:00 | Georgi Gerganov | | ggml : fix weak alias win32 (whisper/0) |
| 741 | 97340b4c9924be86704dbf155e97c8319849ee19 | 2bb0467043258bdc58dbaefb33786f1731b38937 | 2025-06-10T14:01:33+02:00 | 0cc4m | | Vulkan: Don't default to CPU device (like llvmpipe), even if no other device is available, to allow fallback to CPU backend (#14099) |
| 742 | 2bb0467043258bdc58dbaefb33786f1731b38937 | b8e2194efc529378be45ab9b27d6648a5b81458a | 2025-06-10T02:41:01-04:00 | Isaac McFadyen | | rpc : nicer error messages for RPC server crash (#14076) |
| 743 | 1f63e75f3b5dc7f44dbe63c8a41d23958fe95bc0 | 40cbf571c9210031340f022d104317e89a1a6bb2 | 2025-06-09T23:05:02+03:00 | Georgi Gerganov | | metal : use less stack memory in FA kernel (#14088) |
| 744 | 40cbf571c9210031340f022d104317e89a1a6bb2 | 7f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb7 | 2025-06-09T23:04:35+03:00 | Georgi Gerganov | | kv-cache : fix shift and defrag logic (#14081) |
| 745 | 7f4fbe5183b23b6b2e25fd1ccc5d1fa8bb010cb7 | f470bc36bed4d836b9de5a483fa0dfaee176d6f5 | 2025-06-09T11:03:09-07:00 | Diego Devesa | | llama : allow building all tests on windows when not using shared libs (#13980) |
| 746 | f470bc36bed4d836b9de5a483fa0dfaee176d6f5 | 8f47e25f56e9792093b7497c68e9f80bab82ed19 | 2025-06-09T22:47:13+08:00 | xctan | | ggml-cpu : split arch-specific implementations (#13892) |
| 747 | 8f47e25f56e9792093b7497c68e9f80bab82ed19 | 201b31dc2e6fef3de598280b53fd3b69420a4e49 | 2025-06-09T07:36:26-07:00 | Diego Devesa | | cuda : fix device sync on buffer clear (#14033) |
| 748 | 201b31dc2e6fef3de598280b53fd3b69420a4e49 | e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57 | 2025-06-09T17:17:31+03:00 | Georgi Gerganov | | graph : fix geglu (#14077) |
| 749 | e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57 | dc0623fddb661926e0998538895155e4f081ff09 | 2025-06-09T19:47:39+08:00 | Xinpeng Dou | | CANN: Simplify the environment variable setting(#13104) |
| 750 | dc0623fddb661926e0998538895155e4f081ff09 | 87d34b381d5868e75586210ec17b5ef5deddc276 | 2025-06-09T18:01:17+08:00 | R0CKSTAR | | webui: fix sidebar being covered by main content (#14082) |
| 751 | 87d34b381d5868e75586210ec17b5ef5deddc276 | b460d16ae858c6624fd37aec316622a4060ca325 | 2025-06-09T12:57:58+03:00 | Georgi Gerganov | | server : fix LRU check (#14079) |
| 752 | 247e5c6e447707bb4539bdf1913d206088a8fc69 | 5787b5da57e54dba760c2deeac1edf892e8fc450 | 2025-06-08T11:39:56-07:00 | Diego Devesa | | cuda : fix buffer type check with integrated GPUs (#14069) |
| 753 | 228f34c9ceefa3ea4f4d6933edd858121e8106cb | 0974ad7a7cd4bca846b15c484ff3be890135a52c | 2025-06-07T18:58:20+05:30 | Akarshan Biswas | | SYCL: Implement few same quantized type copy kernels (#13739) |
| 754 | 0974ad7a7cd4bca846b15c484ff3be890135a52c | 745aa5319b9930068aff5e87cf5e9eef7227339b | 2025-06-07T14:13:12+02:00 | Sigbjørn Skjæret | | llama : fix llama_model_chat_template with template name (LLM_KV with suffix) (#14050) |
| 755 | 745aa5319b9930068aff5e87cf5e9eef7227339b | 487a5e0401423bba02cd6e97e4d45131bb20b22b | 2025-06-06T14:11:15+03:00 | Georgi Gerganov | | llama : deprecate llama_kv_self_ API (#14030) |
| 756 | 487a5e0401423bba02cd6e97e4d45131bb20b22b | d17a809ef0af09b16625e991a76f6fe80d9c332e | 2025-06-06T13:29:18+03:00 | Georgi Gerganov | | context : fix SWA-related warning for multiple sequences (#14045) |
| 757 | 669c13e0f67edfba891c5bd7105eb4376bcf8626 | 146b88e8b3e16d22cea22f8be982a4d45e913b1e | 2025-06-05T23:00:29+09:00 | Masato Nakasaka | | vulkan: Enable VK_KHR_cooperative_matrix extension for Intel Xe2 GPUs (#14001) |
| 758 | 146b88e8b3e16d22cea22f8be982a4d45e913b1e | 7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 | 2025-06-05T06:25:29-07:00 | pockers21 | | ci: fix CUDA build failure on autodl cloud machines (#14005) |
| 759 | 7f37b6cf1e2c1b90bf0d9c8d91904b4b6c512748 | 3a077146a4761fdbd24bdd8eb098f46b8adc4dda | 2025-06-05T15:29:22+03:00 | Georgi Gerganov | | memory : migrate from llama_kv_cache to more generic llama_memory (#14006) |
| 760 | 9e31bec4fd53634c9e5b04650488a09a055f5dab | 5a8ae3053ced350ed300ba91600519fcad1c6ba7 | 2025-06-05T09:06:29+03:00 | Georgi Gerganov | | context : fix pos_min initialization upon error decode (#14008) |
| 761 | 0d3984424f2973c49c4bcabe4cc0153b4f90c601 | 3e63a58ef7addec35408e2eb67850d7cdc935dc3 | 2025-06-04T22:02:00+02:00 | Ervin Áron Tasnádi | | ggml-vulkan: adds support for op CONV_TRANSPOSE_1D (#13813) |
| 762 | 3e63a58ef7addec35408e2eb67850d7cdc935dc3 | 2589ad3704559f4dd860f5f303b19349c688a28a | 2025-06-04T18:58:20+03:00 | Georgi Gerganov | | kv-cache : refactor the update/defrag mechanism (#13988) |
| 763 | 0b4be4c435849b00dbd98b109cf7a22298d27b69 | e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a | 2025-06-04T08:57:05+02:00 | Johannes Gäßler | | CUDA: fix FTZ in FA for Gemma 3 (#13991) |
| 764 | e0e806f52ebcd0ee285c994fe8fd8b8787d2cb0a | 7e00e60ef86645a01fda738fef85b74afa016a34 | 2025-06-04T09:50:32+03:00 | Georgi Gerganov | | kv-cache : fix unified::seq_rm to work with seq_id < 0 (#13985) |
| 765 | 7e00e60ef86645a01fda738fef85b74afa016a34 | ea1431b0fa3a8108aac1e0a94a13ccc4a749963e | 2025-06-03T13:30:22-05:00 | Jeff Bolz | | vulkan: fix warnings in perf logger querypool code (#13937) |
| 766 | bfb1e012a0b7658e8f00ed4333d059943ea9d648 | 363757628848a27a435bbf22ff9476e9aeda5f40 | 2025-06-02T23:53:36Z | rmatif | | OpenCL: Add concat, tsembd, upscale, tanh, pad and repeat (#13840) |
| 767 | 5582c49c3961269eca96822abfb87528e942dd07 | c9bbc77931d223ed7e7cbcf1cb057bc02fd0db19 | 2025-06-02T20:54:26+03:00 | Georgi Gerganov | | gemma : more consistent attention scaling for v2 and v3 (#13951) |
| 768 | bfd322796cd838f906535ff3352624fc46338894 | 093e3f1feb16e25e58f7d61e01266c830dd424b8 | 2025-06-02T16:29:28+02:00 | Xuan-Son Nguyen | | mtmd : fix memory leak in mtmd_helper_eval_chunk_single (#13961) |
| 769 | 093e3f1feb16e25e58f7d61e01266c830dd424b8 | 663445b0deb21fb602176da030d4154197a4fca6 | 2025-06-02T17:48:36+05:30 | shalinib-ibm | | cmake : Handle mixed-case 'Power' strings in POWER CPU detection (#13966) |
| 770 | 663445b0deb21fb602176da030d4154197a4fca6 | 7675c555a13c9f473249e59a54db35032ce8e0fc | 2025-06-02T10:12:20+01:00 | Atharva Dubey | | sycl: quantize and reorder the input to q8_1 when reorder is enabled (#13826) |
| 771 | 7675c555a13c9f473249e59a54db35032ce8e0fc | 5e1c3aed4074480f63e914d6c44c93536ed1452a | 2025-06-01T18:08:05+02:00 | Johannes Gäßler | | gguf: fix failure on version == 0 (#13956) |
| 772 | 5e1c3aed4074480f63e914d6c44c93536ed1452a | c496fe0b1da28618dd17bda8b0a6bf5004554080 | 2025-06-01T18:07:21+02:00 | Sigbjørn Skjæret | | convert : fix nomic-bert-moe mask token (#13757) |
| 773 | c496fe0b1da28618dd17bda8b0a6bf5004554080 | e57bb87cede38341963a7a884630dbfb09c7dc00 | 2025-06-01T17:23:11+02:00 | Sigbjørn Skjæret | | convert : fix vocab padding code for bert models (#13954) |
| 774 | e57bb87cede38341963a7a884630dbfb09c7dc00 | f3a4b1659ccc94ebdf3590d472b518377bfecc7a | 2025-06-01T22:53:57+08:00 | Aaron Teo | | ggml: check if non-native endian model is being loaded (#13943) |
| 775 | d337252acf14a91a685c355fa4f3f599a8068207 | af6f91db470da543dc32bc00c057aad8f060dfdb | 2025-05-31T12:39:19+02:00 | Kai Pastor | | cmake : Fix broken CMake error messages (ggml/1252) |
| 776 | a7b8d35f780ab3e7639ae5345442fb1ad10f0163 | 6eba72b71c677ce9aae33c422a6e67008137987a | 2025-05-29T13:29:50+03:00 | Georgi Gerganov | | sync : whisper.cpp (ggml/1250) |
| 777 | fedf034a98378059274e4243d2a370a243335e73 | 8726392d3d927fe3e504868d3548d694496ee37e | 2025-05-27T20:58:46-04:00 | Daniel Tang | | ggml : Print backtrace on uncaught C++ exceptions (ggml/1232) |
| 778 | c04621711a893cbd09cff6c927cb005bc6749e36 | 0fc16b42e8793364918e830c234c1f3caec29dae | 2025-06-01T11:42:16+03:00 | Georgi Gerganov | | parallel : fix n_junk == 0 (#13952) |
| 779 | 51fa76f172957c9916e43aeb581f82c533e12394 | 12d0188c0dc6146ffde6d277a93f232ccbe699f8 | 2025-05-31T10:14:29+02:00 | Xuan-Son Nguyen | | mtmd : drop `_shared` from `libmtmd` name, merge helpers into libmtmd (⚠️ breaking change) (#13917) |
| 780 | 12d0188c0dc6146ffde6d277a93f232ccbe699f8 | eb3949938e82a128855bc0676220bb2ce6e4228d | 2025-05-31T10:24:04+03:00 | Georgi Gerganov | | kv-cache : refactor + add llama_memory_state_i (#13746) |
| 781 | eb3949938e82a128855bc0676220bb2ce6e4228d | e562eece7cb476276bfc4cbb18deb7c0369b2233 | 2025-05-31T14:48:04+08:00 | Shawn yang | | CUDA: add a prop in ggml_cuda_device_infor for distinguish iGPU or dGPU in cuda (#13856) (#13895) |
| 782 | e562eece7cb476276bfc4cbb18deb7c0369b2233 | b47ab7b8e9c4f6154eb6abb6234866ab117d64c7 | 2025-05-30T21:22:03+02:00 | Johannes Gäßler | | CUDA: fix typo in FlashAttention code (#13926) |
| 783 | b47ab7b8e9c4f6154eb6abb6234866ab117d64c7 | dd665cc9d4b378626cde11ea0c4c91f514fdc994 | 2025-05-30T09:56:19-07:00 | Diego Devesa | | sched : avoid changing cur_copy when a graph is already allocated (#13922) |
| 784 | 53f925074de02c5304b00c14b4d6d8910c58667d | db38704f0133be7832123495fa8fc2601ea999d4 | 2025-05-30T16:25:45+03:00 | Georgi Gerganov | | sync : vendor (#13901) |
| 785 | db38704f0133be7832123495fa8fc2601ea999d4 | 07e4351ce663a7802b31f92fd7bc0e555c2044b6 | 2025-05-30T14:50:43+02:00 | Sigbjørn Skjæret | | convert : fix rwkv bos/eos token (#13844) |
| 786 | 07e4351ce663a7802b31f92fd7bc0e555c2044b6 | 291f2b6913c7ef8350dbf0e77da38f7af131a08e | 2025-05-30T12:24:37+02:00 | Xuan-Son Nguyen | | convert : allow partial update to the chkhsh pre-tokenizer list (#13847) |
| 787 | 291f2b6913c7ef8350dbf0e77da38f7af131a08e | 2c90da4c7ec694797f524042aaafbb047a7e65ff | 2025-05-30T18:56:02+09:00 | Đinh Trọng Huy | | llama : add support for DistilBert (#13907) |
| 788 | 54a2c7a8cd8a32b44e3a98c2999b0f5c9114be5c | 21fcc21ad5e5de2daa5da8d08dbbcc86b8d815d7 | 2025-05-29T19:39:20+08:00 | Yibo Cai | | arm64: optimize q4_k_q8_k kernel with i8mm (#13886) |
| 789 | dd8ba93416f492c168f7e20f0b1434c08ebeaeb5 | 66c92061f5c34d2f9a630b7b50cca5ce3ebb4b16 | 2025-05-29T14:48:43+05:30 | Vineel Abhinav | | ggml: aarch64: Implement SVE F32 kernels for Mamba Sequential Scan Algorithm (#13882) |
| 790 | 1b8fb8152d0f3357a9c1d9b4c02f6cc5b9cb7232 | 53ae30640e131082d8d19bd80485b47c4553d551 | 2025-05-29T11:31:33+05:30 | Vineel Abhinav | | ggml: aarch64: Implement SVE F32 kernels for vector functions (#13843) |
| 791 | 53ae30640e131082d8d19bd80485b47c4553d551 | 763d06edb7dd5094ea58bad1d81e2e8d35033e34 | 2025-05-28T14:50:20-07:00 | Beinsezii | | gguf-py : fix SafetensorRemote return on undefined size (< 0) (#13841) |
| 792 | 763d06edb7dd5094ea58bad1d81e2e8d35033e34 | 10961339b26bd2eff01d5479e8879f435da261b7 | 2025-05-28T22:35:31+02:00 | Xuan-Son Nguyen | | llama : fix KV shift for qwen2vl (#13870) |
| 793 | 10961339b26bd2eff01d5479e8879f435da261b7 | d98f2a35fcf4a8d3e660ad48cd19e2a1f3d5b2ef | 2025-05-28T22:35:22+02:00 | Xuan-Son Nguyen | | mtmd : move helpers to dedicated library (⚠️ breaking change) (#13866) |
| 794 | e0e3aa231d899720c2864d09cdb89d4c400eeb55 | aa6dff05be25709bb218bf648951d690029c4b19 | 2025-05-29T02:01:58+09:00 | Đinh Trọng Huy | | llama : add support for BertForSequenceClassification reranker (#13858) |
| 795 | c962ae3382a1e759c8517a229549ee53685313a1 | a3938fb53d0b5183db4f5a6db21fd9122a0e4780 | 2025-05-28T22:33:54+08:00 | Sky | | server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853) |
| 796 | a3938fb53d0b5183db4f5a6db21fd9122a0e4780 | f7873fc698c09047e2873630ab7e7730a0bfb224 | 2025-05-28T16:12:35+02:00 | Xuan-Son Nguyen | | convert : fix qwen omni conversion (#13859) |
| 797 | f7873fc698c09047e2873630ab7e7730a0bfb224 | a68247439bd6fb756cc93ad2817e55a02aa0b100 | 2025-05-28T14:49:28+01:00 | Alex Fanthome | | tests : change umlaut test (#11600) |
| 798 | a68247439bd6fb756cc93ad2817e55a02aa0b100 | 26b79b6cb3e7840ff15729350e95907e19f9f480 | 2025-05-28T13:33:37+02:00 | Johannes Gäßler | | CUDA: fix FA tg at long context for CC >= 8.9 (#13852) |
| 799 | 26b79b6cb3e7840ff15729350e95907e19f9f480 | 1e8659e65ad0f640674d2785d02b556ab938728c | 2025-05-28T10:05:54+02:00 | Xuan-Son Nguyen | | convert : fix tensor naming conflict for llama 4 vision (#13836) |
| 800 | bef817638780dcbd8c0c80c97b7a4f8e92c8fe74 | 34b7c0439ed0f98575cc4689dfecd98991dee8be | 2025-05-27T11:39:07-05:00 | Jeff Bolz | | vulkan: use timestamp queries for GGML_VULKAN_PERF (#13817) |
| 801 | f3101a8cc665f73217c752a10a7042889275cfbc | 1c49c70d07ef87635daa5e8fdd0b5bfd88493dd3 | 2025-05-27T20:52:59+05:30 | Akarshan Biswas | | SYCL: add gelu_erf kernel (#13749) |
| 802 | bc583e3c63c04a11d287c108ea9e6a515ead0423 | 72b090da2c50e540143fd312a2f9aa5f151e6136 | 2025-05-27T14:06:10+02:00 | Xuan-Son Nguyen | | mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784) |
| 803 | 81713121ee56755ba4a147d1a1e3fa248ec31a66 | f9cd68398baf2ba8af4725ca9ed00bef205e6706 | 2025-05-27T13:49:41+03:00 | Georgi Gerganov | | kv-cells : track min/max used cells and per-sequence positions (#13808) |
| 804 | 4f81b33e324b1669b282eb81104e4a1131be7dce | cdf94a18023c92f41808ec874ba577d914674717 | 2025-05-27T09:40:59+03:00 | Georgi Gerganov | | llama : validate seq id batch input (#13809) |
| 805 | a26c4cc11ec7c6574e3691e90ecdbd67deeea35b | 4265a87b59ebfc25f35adbf4db3b608995b0a78a | 2025-05-26T22:24:01+03:00 | Georgi Gerganov | | scripts : add option to compare commits in Debug (#13806) |
| 806 | 4265a87b59ebfc25f35adbf4db3b608995b0a78a | 6f180b915c9ed9ec0c240b5dcd64644988fb5e82 | 2025-05-26T22:14:52+03:00 | Georgi Gerganov | | cuda : avoid cuGetErrorString (#13791) |
| 807 | 6f180b915c9ed9ec0c240b5dcd64644988fb5e82 | 03f582ae8fccecff225c30a2802461b44761e822 | 2025-05-26T21:10:36+05:30 | Akarshan Biswas | | SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611) |
| 808 | 03f582ae8fccecff225c30a2802461b44761e822 | 88c125f2acce0e25e5fc8481ab0681415fc64a10 | 2025-05-26T08:03:57-07:00 | Olivier Chafik | | server: fix streaming crashes (#13786) |
| 809 | 88c125f2acce0e25e5fc8481ab0681415fc64a10 | d74e94c1b3ac02db01e47008e1f8d371029d81ac | 2025-05-26T23:55:24+09:00 | standby24x7 | | examples/training: Fix file name in README (#13803) |
| 810 | d74e94c1b3ac02db01e47008e1f8d371029d81ac | f13847cfb560d92492b480cca2c5d6aa9473cde3 | 2025-05-26T06:56:49-07:00 | Olivier Chafik | | `server`: fix format of streamed tool call deltas (diff name, fix id location) (#13800) |
| 811 | f13847cfb560d92492b480cca2c5d6aa9473cde3 | 79c137f77677b3c8ee3c60a7da033721b938399a | 2025-05-26T06:16:37-07:00 | Olivier Chafik | | server: fix regression on streamed non-chat completion w/ stops (#13785) |
| 812 | 9012eb9b454a82eaa4cd77ae904c0ea391e4db42 | fef693dc6b959a8e8ba11558fbeaad0b264dd457 | 2025-05-26T10:28:53+02:00 | Romain Biessy | | sycl: Add more debug prints (#13640) |
| 813 | 2d38b6e4004fb1c341723e657fb1e71a4d3fb473 | e121edc4324a640be11b7e567edd39b721b0f8e4 | 2025-05-26T10:20:18+08:00 | Bizhao Shi | | CANN: Add the basic supports of Flash Attention kernel (#13627) |
| 814 | de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac | c508256db2de2b032e19c8ed833f4683c827c9a1 | 2025-05-25T16:34:36+03:00 | Georgi Gerganov | | kv-cache : rework kv_cell (#13706) |
| 815 | c508256db2de2b032e19c8ed833f4683c827c9a1 | 40aaa8a403df5dcfb515eb2fd7a817fd99779526 | 2025-05-25T13:35:53+01:00 | Percy Piper | | rpc : Fix build on OpenBSD (#13541) |
| 816 | 40aaa8a403df5dcfb515eb2fd7a817fd99779526 | a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 | 2025-05-25T14:06:32+02:00 | Xuan-Son Nguyen | | mtmd : add support for Qwen2-Audio and SeaLLM-Audio (#13760) |
| 817 | a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 | d785f9c1fd1a1929c6d0e2a0b12cae5db867908b | 2025-05-25T14:04:49+02:00 | ddpasa | | docs : add Moondream2 pre-quantized link (#13745) |
| 818 | d785f9c1fd1a1929c6d0e2a0b12cae5db867908b | 4032ca406632212b075e3c61c2a4476128321410 | 2025-05-25T10:45:49+01:00 | Olivier Chafik | | server: fix/test add_generation_prompt (#13770) |
| 819 | f5cd27b71da3ac375a04a41643d14fc779a8057b | a2d02d5793fd9af7a7224773456501691b95fd02 | 2025-05-25T01:48:08+01:00 | Olivier Chafik | | `server`: streaming of tool calls and thoughts when `--jinja` is on (#12379) |
| 820 | 259469c4b57c1a32606353bcac52ba683424a990 | 4c32832c59e97d96c19349fdc92763e8949fda83 | 2025-05-24T16:49:12+02:00 | 0cc4m | | Move GLM4 f32 attention fix to the correct function (#13750) |
| 821 | c3a2624339187e89c4f65fd72a5fe7103968b5ad | ffd0eae60b7642e942c8245b89642527e36099e6 | 2025-05-24T12:29:09+02:00 | Sigbjørn Skjæret | | vocab : fix ugm tokenizer precision (#13743) |
| 822 | ffd0eae60b7642e942c8245b89642527e36099e6 | b775345d788ac16260e7eef49e11fe57ee5677f7 | 2025-05-24T11:46:19+02:00 | Johannes Gäßler | | CUDA: fix race condition in FA vector kernels (#13742) |
| 823 | e16c4731c7a6bfa8f61b5b39c77245a37e7fc232 | 1dcd01960c33f52afb782b3d850fc2149a08cc6b | 2025-05-23T08:12:48+02:00 | Xuan-Son Nguyen | | ggml : fix the order of ggml_unary_op (#13718) |
| 824 | 3079e9ac8e04ef6eddeb0c164d72edb6b6fd2df5 | 8a1d206f1d2b4e45918b589f3165b4be232f7ba8 | 2025-05-22T15:21:37-07:00 | Diego Devesa | | release : fix windows hip release (#13707) |
| 825 | 8a1d206f1d2b4e45918b589f3165b4be232f7ba8 | 797990c4bca0dca5be295c63e3fb2800dc0a69c2 | 2025-05-22T22:21:07+03:00 | Georgi Gerganov | | tts : fix n_ubatch + make WavTokenizer cache-less (#13713) |
| 826 | 797990c4bca0dca5be295c63e3fb2800dc0a69c2 | ab86335760ebb441574eb47f886fa1ee302e2131 | 2025-05-22T20:42:48+02:00 | Xuan-Son Nguyen | | mtmd : add ultravox audio input (#13623) |
| 827 | ab86335760ebb441574eb47f886fa1ee302e2131 | cc74d5be990e37f201591fd868a92e64abdbf902 | 2025-05-23T02:31:29+08:00 | Aaron Teo | | common: Include torch package for s390x (#13699) |
| 828 | a4e8912dfd4604be1e39bc86ba4c0b02969967ef | edbf42edfdabb9cea72ae12137570cf48f5d8076 | 2025-05-22T02:21:45+03:00 | Henry Linjamäki | | opencl: Add support for multiple devices (#12622) |
| 829 | edbf42edfdabb9cea72ae12137570cf48f5d8076 | d643bb2c798df9c2cd61067d2692b1cd417df402 | 2025-05-21T23:21:17+03:00 | Henry Linjamäki | | opencl: fix couple crashes (#12795) |
| 830 | 5fbfe384d4659f81c47a477eb8ee97692c7ffef9 | c76532e7ba128bb097bf6836bf0f5592e1b56b76 | 2025-05-21T19:46:56+03:00 | Georgi Gerganov | | server : improve error reporting (#13680) |
| 831 | eb0f5c28d37126baa756117d5bdaadc62e03344e | cf4cb59e64d72a1b4c781f71a74de5756a4e2376 | 2025-05-21T17:33:54+03:00 | Emmanuel Ferdman | | gguf-py : display the invalid gguf type (#13687) |
| 832 | cf4cb59e64d72a1b4c781f71a74de5756a4e2376 | 0d5c74216170ef97e5e7511563837263f2d1a496 | 2025-05-21T16:26:33+02:00 | Xuan-Son Nguyen | | ggml : add ggml_gelu_erf() (#13667) |
| 833 | 42158ae2e8ead667a83f07247321ce85f32ace66 | 797f2ac0625b22edeff03cc30e0f988da6b6b068 | 2025-05-21T16:07:57+03:00 | Dorin-Andrei Geman | | server : fix first message identification (#13634) |
| 834 | 797f2ac0625b22edeff03cc30e0f988da6b6b068 | b44890df2e4fad0ece1d5366dcbc8bedae23b658 | 2025-05-21T15:11:13+03:00 | Georgi Gerganov | | kv-cache : simplify the interface (#13660) |
| 835 | b44890df2e4fad0ece1d5366dcbc8bedae23b658 | 33983057d0f578aca74ba15eccc3de9c267a5ff6 | 2025-05-21T13:09:21+03:00 | Georgi Gerganov | | model : disable SWA for Phi models (#13676) |
| 836 | 33983057d0f578aca74ba15eccc3de9c267a5ff6 | fb1cab201c6c4cd36731f100df74eece2f4706fa | 2025-05-21T09:58:49+08:00 | R0CKSTAR | | musa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647) |
| 837 | fb1cab201c6c4cd36731f100df74eece2f4706fa | b7a17463ec190aeee7b9077c606c910fb4688b84 | 2025-05-20T21:35:16Z | Eve | | vulkan: fix warnings (#13626) |
| 838 | b7a17463ec190aeee7b9077c606c910fb4688b84 | be0239693c1530a18496086331fc18d8a9adbad1 | 2025-05-21T00:55:30+08:00 | l3utterfly | | mtmd-helper : bug fix to token batching in mtmd (#13650) |
| 839 | be0239693c1530a18496086331fc18d8a9adbad1 | a4090d1174aed22dde5cacce2a4c27656b987a2f | 2025-05-20T19:21:04+03:00 | Georgi Gerganov | | model : fix llama4 graph (#13663) |
| 840 | c9c64dee572c5eedf073a6c6eb5d92d8283f7639 | c00a2634bec49805c6b31438b1a6006a2bd793cb | 2025-05-20T10:11:56+02:00 | 0cc4m | | Set GLM4 blk.*.attn_output.weight, kqv_out-* matmul to GGML_PREC_F32 to fix infinity values in output (#13639) |
| 841 | c00a2634bec49805c6b31438b1a6006a2bd793cb | e298d2fbd082a52c0f6ed02729f94e9bf630cf17 | 2025-05-20T10:41:40+03:00 | Georgi Gerganov | | metal : fix typo in FA kernel comments (#13651) |
| 842 | e298d2fbd082a52c0f6ed02729f94e9bf630cf17 | f0adb80bf7c2c0d80abb04f4533b5513622d9964 | 2025-05-20T08:05:46+03:00 | Georgi Gerganov | | kv-cache : add SWA support (#13194) |
| 843 | f0adb80bf7c2c0d80abb04f4533b5513622d9964 | f7c9429c85748cde9599499601ba48d0057722e6 | 2025-05-20T11:43:43+08:00 | Xinpeng Dou | | CANN: Update CANN model support (#13162) |
| 844 | 8960efd0a65e5a4830a14f6937c10703534f2569 | 725f23f1f3f0d3adf49f95d8dfa6e7c74adff149 | 2025-05-19T17:54:08+02:00 | 0cc4m | | Vulkan: Add f32 accumulator support to quantized mul mat to fix GLM4 32B incoherence (#13607) |
| 845 | 725f23f1f3f0d3adf49f95d8dfa6e7c74adff149 | 92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 | 2025-05-19T14:38:20+01:00 | Alberto Cabrera Pérez | | sycl : backend documentation review (#13544) |
| 846 | 92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 | f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c | 2025-05-19T13:04:14+02:00 | Xuan-Son Nguyen | | mtmd : add vision support for llama 4 (#13282) |
| 847 | 6c35981a643d4f74a286268b62f65bfa156af2e6 | 8b5e19aea6ce9fe4452598663924373234041440 | 2025-05-19T09:33:35+02:00 | Johannes Gäßler | | mnist: fix segmentation fault (ggml/1227) |
| 848 | 8b5e19aea6ce9fe4452598663924373234041440 | 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 | 2025-05-18T18:30:13-07:00 | Diego Devesa | | ggml : fix apple OS check in ggml_print_backtrace (ggml/1229) |
| 849 | 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 | 9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1 | 2025-05-17T19:06:26-04:00 | Daniel Tang | | ggml : Fix missing backtrace on Linux (ggml/1228) |
| 850 | 9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1 | 33d7aed4a83e7bbecac4af535208d4ed3e1ca8fd | 2025-05-19T18:25:41+08:00 | Nick | | fix: check model pointer validity before use (#13631) |
| 851 | e3a7cf6c5bf6a0a24217f88607b06e4405a2b5d9 | 518329b2d4434d0683c30b741b4f4cf5734b5f99 | 2025-05-17T21:26:43+03:00 | Gilad S. | | cmake: use the current build config for vulkan-shaders-gen (#13595) |
| 852 | 2f5a4e1e09567e09be8b84a5f976334de9539d17 | 4f41ee11d6a4ddb02e4644922bf0b56880ee6f55 | 2025-05-17T16:14:55+09:00 | Jeff Bolz | | vulkan: move common FA code to flash_attn_base.comp (#13556) |
| 853 | 3e0be1cacef290c99cbb99ceaa433b4344f87355 | 6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 | 2025-05-16T14:56:28-06:00 | Z | | llguidance : official v0.7.20 release (no actual changes) [noci] (#13594) |
| 854 | 6aa892ec2aa7fe0c93e87c4b970d83a942fb9454 | aea9f8b4e73876739bf88fb705502f291294e469 | 2025-05-16T21:50:00+02:00 | Xuan-Son Nguyen | | server : do not return error out of context (with ctx shift disabled) (#13577) |
| 855 | aea9f8b4e73876739bf88fb705502f291294e469 | 06c1e4abc1e50ef6dcf6369f9685ca8fe82d21fe | 2025-05-16T21:49:01+02:00 | Xuan-Son Nguyen | | webui : improve accessibility for visually impaired people (#13551) |
| 856 | 0a338ed013c23aecdce6449af736a35a465fa60f | bc098c3cf0aac93e57e9bda9d95e2456acf88894 | 2025-05-16T12:15:29+02:00 | Łukasz Ślusarczyk | | sycl : fixed compilation warnings (#13582) |
| 857 | 07ad2b6db3c117868728e2cdfe3b711473d66e14 | c531edfa34fec8074d0b424396cdd450df23b612 | 2025-05-15T12:47:10-04:00 | Daniel Tang | | gguf-py : fix disconnect-before-connect in editor-gui (#13569) |
| 858 | c531edfa34fec8074d0b424396cdd450df23b612 | 02cdd2d8b092b5a4bb18e013c6887ce49ba20ac5 | 2025-05-15T17:40:07+02:00 | Xuan-Son Nguyen | | convert : fix conversion for llama 4 (#13567) |
| 859 | 6c8b91500e75df6664278d1e9af3e39e8a2fb0d0 | 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 | 2025-05-15T06:46:55-07:00 | Diego Devesa | | llama-bench : fix -ot with dl backends (#13563) |
| 860 | 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 | c753d7bed0dc2cc2d5c42dfa9806cba91748392e | 2025-05-15T14:24:50+02:00 | Xuan-Son Nguyen | | webui : handle PDF input (as text or image) + convert pasted long content to file (#13562) |
| 861 | c753d7bed0dc2cc2d5c42dfa9806cba91748392e | b2838049ccf50859cea4c390e81405c2fb01e820 | 2025-05-15T08:40:58+02:00 | Piotr Wilkin (ilintar) | | server : proper error handling for missing elements in messages array (OpenAI compatible backend) (#13540) |
| 862 | b2838049ccf50859cea4c390e81405c2fb01e820 | aa48e373f256df9608395ee6881e7010840d6202 | 2025-05-15T05:57:02+03:00 | Georgi Gerganov | | bench : handle decode errors (#13548) |
| 863 | aa48e373f256df9608395ee6881e7010840d6202 | e3a9421b78da5c810d812e6348a405f5acc39f34 | 2025-05-15T02:39:51+01:00 | Olivier Chafik | | `server`: inject date_string in llama 3.x template + fix date for firefunction v2 (#12802) |
| 864 | e3a9421b78da5c810d812e6348a405f5acc39f34 | 5ab5d5fb256aa23f8ab4de8463515ea627f43006 | 2025-05-14T23:15:15+03:00 | Georgi Gerganov | | kv-cache : fix out-of-bounds view during reserve graph (#13547) |
| 865 | 5ab5d5fb256aa23f8ab4de8463515ea627f43006 | 3198405e98530c683d12fd123e3920f2bd2aafa5 | 2025-05-15T03:53:52+08:00 | Yibo Cai | | arm64: optimize q6_k_q8_k kernel with i8mm (#13519) |
| 866 | f5170c1d7a66222ca7c75d2022fec3ed87257e0b | 017f10b5fa630a013ec4f9936e410a60d4f460d5 | 2025-05-14T20:22:49+02:00 | Sigbjørn Skjæret | | editorconfig : fix trailing whitespace from #13542 (#13546) |
| 867 | 017f10b5fa630a013ec4f9936e410a60d4f460d5 | 4696d5674999dc10a7fb8c27b33406a929f7463a | 2025-05-14T19:18:18+03:00 | Gilad S. | | fix: crash when calling `llama_state_get_size` on a context without a KV cache (#13542) |
| 868 | 4696d5674999dc10a7fb8c27b33406a929f7463a | b7d26720821823e23e2273a99e38398d511242e9 | 2025-05-14T16:41:02+02:00 | Johannes Gäßler | | CUDA: fix crash on large batch size for quant. MoE (#13537) |
| 869 | b7d26720821823e23e2273a99e38398d511242e9 | 6da34fa27620fa56e3334172e023f4f2533df51f | 2025-05-14T07:12:36-07:00 | Diego Devesa | | llama : fix quantize with dl backends (#13539) |
| 870 | 5e7d95e22e386d316f7f659b74c9c34b65507912 | 053174436f3b3cbb01077f26ff17809537b832c7 | 2025-05-14T06:53:59-06:00 | Gabe Goodhart | | fix: Move build_inp_pos to the top of the graph section for build_granite (#13538) |
| 871 | 360a9c98e13d35f322b4c5b1309aab0cc90ed82b | 09d13d94fb169093095416ac6323551c37b75339 | 2025-05-14T13:35:07+02:00 | Xuan-Son Nguyen | | server : fix cache_tokens bug with no cache_prompt (#13533) |
| 872 | d486dd3e8ecfba0170f8632a1530540de560f4a3 | 21ca987fba504d273ea28ebc4d3e5b3736a11c8e | 2025-05-14T10:07:31+02:00 | Luca Stefani | | webui: Allow pasting file from clipboard (#13526) |
| 873 | 21ca987fba504d273ea28ebc4d3e5b3736a11c8e | be1d4a13db26750fac702ceb3af88ae4f39dc9f4 | 2025-05-14T09:59:12+02:00 | ddpasa | | docs: Update link to ggml-org in multimodal.md (#13513) |
| 874 | be1d4a13db26750fac702ceb3af88ae4f39dc9f4 | ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2 | 2025-05-14T08:41:01+02:00 | Sigbjørn Skjæret | | scripts : fix compare-llama-bench.py show parameter (#13514) |
| 875 | ab3971f2a0a526564bfde0e4cc8a5b90f9d33ad2 | e5c834f718a32b7584f142799bbf508fddb9021c | 2025-05-14T13:15:50+09:00 | Jeff Bolz | | vulkan: workaround FA compile failures on macos (#13517) |
| 876 | 71bdbdb58757d508557e6d8b387f666cdfb25c5e | f0995d28ce3d15095b6845d94ce4465e46575873 | 2025-05-13T17:07:21+02:00 | Xuan-Son Nguyen | | clip : clip.h become private API (⚠️ breaking change) (#13510) |
| 877 | f0995d28ce3d15095b6845d94ce4465e46575873 | c252e0c4097b34666e5a81db9d0450d71fa3098f | 2025-05-13T18:04:39+03:00 | Georgi Gerganov | | metal : use FA-vec kernel up to batch size 20 (#13496) |
| 878 | c252e0c4097b34666e5a81db9d0450d71fa3098f | 4f711afed5e7ef4304b567c8888ee1aa60e868eb | 2025-05-13T18:04:00+03:00 | Georgi Gerganov | | metal : optimize multi-sequence FA vec kernel (#13493) |
| 879 | 4f711afed5e7ef4304b567c8888ee1aa60e868eb | b89d605a91dee0a518ecd582f8991a07d523e2fa | 2025-05-13T17:02:28+02:00 | Dan Johansson | | ggml-cpu: Update KleidiAI to v1.6 and fix include directives (#13509) |
| 880 | b89d605a91dee0a518ecd582f8991a07d523e2fa | b4726345aca49e2ad62d615e6e370b3dbad6434f | 2025-05-13T18:01:53+03:00 | Georgi Gerganov | | batched-bench : fix pp batch contents (#13492) |
| 881 | b4726345aca49e2ad62d615e6e370b3dbad6434f | bf7937112058f2815fc3825a9ff7b536ecafa3bb | 2025-05-13T15:33:58+02:00 | Xuan-Son Nguyen | | mtmd : remove libllava, remove clip-quantize-cli (⚠️ breaking change) (#13460) |
| 882 | d590cd4c244e5f260c42c290b83a358b9d86d763 | 1e2809bc4b5d8db2a9ed12ac872eca832c53f5fd | 2025-05-13T07:12:01-06:00 | Gabe Goodhart | | model : Granite MoE shared (#13269) |
| 883 | cf0a43bb6490bd49344775abb22ba26f8047cb54 | f0d46ef15717cd609a7b69cf6190edde64d466c8 | 2025-05-12T15:31:37-07:00 | Diego Devesa | | llama-bench : add defrag-thold, check for invalid ranges (#13487) |
| 884 | 10d2af0eaa0aafd7c6577b279dfa5221ff44a63f | 064cc596ac44308dc326a17c9e3163c34a6f29d1 | 2025-05-12T14:44:49+02:00 | Johannes Gäßler | | llama/ggml: add LLM training support (#10544) |
| 885 | 064cc596ac44308dc326a17c9e3163c34a6f29d1 | 91159ee9df84edb72ccf874e353d2414f3a8c60d | 2025-05-12T15:12:27+03:00 | Georgi Gerganov | | context : fix state io for memory-less contexts (#13470) |
| 886 | 91159ee9df84edb72ccf874e353d2414f3a8c60d | 22cdab343b63edd0906f1c132616746085f81983 | 2025-05-12T18:56:42+07:00 | Anudit Nagar | | server : allow content to be null in oaicompat_completion_params_parse (#13477) |
| 887 | a71a4075cdb8e81eaaa834e48ffda88b038286bc | 95e18884fc7ea4031f70f1a518d5d1df616e5717 | 2025-05-12T13:06:19+02:00 | Dan Johansson | | ggml-cpu: Integrate fp32=bf16xbf16 SME KleidiAI kernel (#13053) |
| 888 | 95e18884fc7ea4031f70f1a518d5d1df616e5717 | df8491922f0ea4e032338186350dff2fb6b2b4e3 | 2025-05-12T10:51:21+02:00 | Johannes Gäßler | | CUDA: fix misaligned synchronization in FA (#13469) |
| 889 | 9a390c4829cd3058d26a2e2c09d16e3fd12bf1b1 | 09232370fc6426aa5dd9be01a8271b9c28f5af3a | 2025-05-11T11:08:26-04:00 | Anthony Umfer | | tools : fix uninitialized llama_batch in server (#13436) |
| 890 | 7474e00b34629e9cd8b06bc87ad935584ea30f8e | 7f323a589f8684c0eb722e7309074cb5eac0c8b5 | 2025-05-11T16:09:33+02:00 | Johannes Gäßler | | CUDA: fix crash with partial offloading of MoE (#13439) |
| 891 | a634d75d1bb4034b8c945042ceea268b5b895730 | 62d4250e52917dc4d634f054b1e2183ed7dee944 | 2025-05-11T11:34:23+02:00 | Xuan-Son Nguyen | | mtmd : move helpers to dedicated file (#13442) |
| 892 | 62d4250e52917dc4d634f054b1e2183ed7dee944 | 0208355f42bdab88a08507ead4a6302790a08323 | 2025-05-10T22:26:46+02:00 | Thomas Germer | | docs : Fix typo in InternVL3 model name (#13440) |
| 893 | 0208355f42bdab88a08507ead4a6302790a08323 | d2a4ef05c60506ee48e7375eb36f2257de7ab0d2 | 2025-05-10T22:22:48+02:00 | Johannes Gäßler | | CUDA: fix race conditions FlashAttention kernels (#13438) |
| 894 | 15e6125a397f6086c1dfdf7584acdb7c730313dc | 3b24d26c22b9d92b5aa39930988700c84e524cf4 | 2025-05-10T19:57:54+02:00 | Xuan-Son Nguyen | | mtmd : add hard limit on image resolution for qwen2vl / qwen2.5vl (#13434) |
| 895 | 43dfd741a5da77982e0a94d1e522a2481dfb914d | b064a51a4e7246fa43a3307f58e59f65e6be170a | 2025-05-10T17:19:52+02:00 | Sigbjørn Skjæret | | llguidance : set tokenizer slices to default (#13424) |
| 896 | 053367d149f778cdabc356ee3024494e0dd53223 | d8919424f1dee7dc1638349c616f2ef5d2ee16fb | 2025-05-10T16:26:42+02:00 | Xuan-Son Nguyen | | mtmd : support InternVL 2.5 and 3 (#13422) |
| 897 | d8919424f1dee7dc1638349c616f2ef5d2ee16fb | 7fef11766cdeb9fa7bbbe3db13580616b7d3d599 | 2025-05-10T09:16:52+02:00 | Johannes Gäßler | | CUDA: fix FlashAttention on Turing (#13415) |
| 898 | 33eff4024084d1f0c8441b79f7208a52fad79858 | 17512a94d636c4b6c1332370acb3e5af3ca70918 | 2025-05-09T19:29:37+02:00 | Xuan-Son Nguyen | | server : vision support via libmtmd (#12898) |
| 899 | 17512a94d636c4b6c1332370acb3e5af3ca70918 | 611aa914ef4231fab5d1ad04773c42e119ae2d2e | 2025-05-09T16:34:08+01:00 | Alberto Cabrera Pérez | | sycl : implementation of reordered Q4_0 MMVQ for Intel GPUs (#12858) |
| 900 | 27ebfcacbaadc6104e2b18acd8f13515cbf63dce | 5c86c9ed3ef1cc7307fdce05f0f0e2e45253cf90 | 2025-05-09T13:02:07+02:00 | Diego Devesa | | llama : do not crash if there is no CPU backend (#13395) |
| 901 | 5c86c9ed3ef1cc7307fdce05f0f0e2e45253cf90 | efb8b47eda78ea8ae570d4fece3953aae499289e | 2025-05-09T12:14:04+02:00 | Johannes Gäßler | | CUDA: fix crash on large batch size for MoE models (#13384) |
| 902 | 2189fd3b6327a1d17893694125da8edcf74a6468 | 3f96aeff394e9b72bbd2fa665c3e023a70ed8648 | 2025-05-09T11:18:02+02:00 | Xuan-Son Nguyen | | mtmd : fix batch_view for m-rope (#13397) |
| 903 | 3f96aeff394e9b72bbd2fa665c3e023a70ed8648 | b486ba05bf973aae3652b3fd593e0b257d3a41d4 | 2025-05-09T11:17:51+02:00 | Xuan-Son Nguyen | | llama : one-off chat template fix for Mistral-Small-2503 (#13398) |
| 904 | b486ba05bf973aae3652b3fd593e0b257d3a41d4 | 02115dcd9a6d0c03b527d5bee8c1493ab819ddbd | 2025-05-09T10:31:07+03:00 | Radoslav Gerganov | | rpc : add rpc_msg_set_tensor_hash_req (#13353) |
| 905 | 15e03282bb432631193464100c2237a3b6bcfe4c | f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d | 2025-05-08T23:45:22+02:00 | Diego Devesa | | ci : limit write permission to only the release step + fixes (#13392) |
| 906 | ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 | 8c83449cb780c201839653812681c3a4cf17feed | 2025-05-08T18:51:45+02:00 | Xuan-Son Nguyen | | server : (webui) fix a very small misalignment (#13387) |
| 907 | 8c83449cb780c201839653812681c3a4cf17feed | 1a844be132dbe865358e1de81136920c1d35ac73 | 2025-05-08T15:37:29+02:00 | Xuan-Son Nguyen | | server : (webui) revamp the input area, plus many small UI improvements (#13365) |
| 908 | 0ccc1213549e39ef4c1affb1bf5f49651ef4ce48 | 6562e5a4d6c58326dcd79002ea396d4141f1b18e | 2025-05-08T22:03:53+09:00 | welix | | mtmd : fix the calculation of n_tokens for smolvlm (#13381) |
| 909 | 8733e0cf6eefc7c7752297cc22d0836706f4222c | 814f795e063c257f33b921eab4073484238a151a | 2025-05-08T10:08:01+01:00 | Alberto Cabrera Pérez | | sycl: addressing non-contiguous src1 mul_mats (nc and batched) (#13343) |
| 910 | 32916a49072f01c43e20df374af5f8a1f70d6963 | ffc727203af1061fdeb49efef30f76171722e403 | 2025-05-06T22:40:24+02:00 | Xuan-Son Nguyen | | clip : refactor graph builder (#13321) |
| 911 | 1e333d5bba18e99bc328bb87ac1ee6a4e6260e0e | 2f54e348ad2999c4e31b8777592247622b20420f | 2025-05-06T20:27:06+05:30 | Akarshan Biswas | | SYCL: Disable reorder optimize by default and stop setting tensor extras when optimize is disabled (#13254) |
| 912 | 2f54e348ad2999c4e31b8777592247622b20420f | 2356fb1d53c86d838756211010bbabfafda7cb94 | 2025-05-06T14:25:40+02:00 | Xuan-Son Nguyen | | llama : fix build_ffn without gate (#13336) |
| 913 | 2356fb1d53c86d838756211010bbabfafda7cb94 | 764b85627b46f43d7ea801867cd1b6abef484574 | 2025-05-06T13:58:51+02:00 | Johannes Gäßler | | CUDA: fix bad asserts for partial offload (#13337) |
| 914 | 15a28ec8c705b188ebe178170966d1dcc36fe151 | a7366faa5bb2fff97b9fb43340d853709f52d8c9 | 2025-05-06T08:36:46+02:00 | Johannes Gäßler | | CUDA: fix --split-mode row for MMQ (#13323) |
| 915 | 907036502070ba608bdb2aaebf802092d4cfba07 | 233461f8121455f957a47e6a22a77b3bc88277b0 | 2025-05-05T22:32:13+02:00 | Johannes Gäßler | | CUDA: fix logic for clearing padding with -ngl 0 (#13320) |
| 916 | 233461f8121455f957a47e6a22a77b3bc88277b0 | b34c859146630dff136943abc9852ca173a7c9d6 | 2025-05-05T17:12:19-03:00 | oobabooga | | sampling : Integrate Top-nσ into main sampling chain (and add it to the server) (#13264) |
| 917 | b34c859146630dff136943abc9852ca173a7c9d6 | 9b61acf06041dcbaff6afa5f28940e93297f8520 | 2025-05-05T17:03:31+03:00 | igardev | | server : Webui - change setText command from parent window to also send the message. (#13309) |
| 918 | 9b61acf06041dcbaff6afa5f28940e93297f8520 | 5215b91e9377ce23e4ccc92ec3156bf5c7f892a3 | 2025-05-05T16:02:55+02:00 | Xuan-Son Nguyen | | mtmd : rename llava directory to mtmd (#13311) |
| 919 | 5215b91e9377ce23e4ccc92ec3156bf5c7f892a3 | ae803bfc3d0fc2d0d3e1cce22ee103a30939e104 | 2025-05-05T12:54:44+02:00 | Xuan-Son Nguyen | | clip : fix confused naming ffn_up and ffn_down (#13290) |
| 920 | 27aa2595321c4d9cc4086a8e67bdea204b8309b0 | 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 | 2025-05-04T23:43:42+02:00 | Xuan-Son Nguyen | | mtmd : add C public API (#13184) |
| 921 | 86bd60d3fe4a08b8c9d920e6defbc2412d803569 | 9f2da5871f4bbd205b8a3b952cdc76283218d595 | 2025-05-04T17:05:20+02:00 | Diego Devesa | | llava/mtmd : fixes to fully support dl backends (#13303) |
| 922 | 93c4e23905987949b714b21ae918ff6bfb55fe36 | 8afbd968182909cf93fb15959fc867b6dd3adb53 | 2025-05-04T14:16:39+02:00 | Johannes Gäßler | | CUDA: fix race condition in MMQ stream-k fixup (#13299) |
| 923 | 8afbd968182909cf93fb15959fc867b6dd3adb53 | 8ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c | 2025-05-04T13:58:38+02:00 | Johannes Gäßler | | CUDA: fix race condition in MMQ ids_dst (#13294) |
| 924 | 3e959f09764a2bb0e64af594eab83f7fb3e08eb2 | 36667c8edcded08063ed51c7d57e9e086bbfc903 | 2025-05-04T00:50:37+02:00 | Johannes Gäßler | | imatrix: fix oob writes if src1 is not contiguous (#13286) |
| 925 | 36667c8edcded08063ed51c7d57e9e086bbfc903 | 3bf785f3efa89ed28294fbf73054558a2b034bfb | 2025-05-03T20:07:54+02:00 | Xuan-Son Nguyen | | clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259) |
| 926 | b34443923cad751483cc53af2e680d595daadce7 | a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd | 2025-05-02T20:54:30+03:00 | Georgi Gerganov | | sync : ggml (#13268) |
| 927 | a75cb30dc9e63488c3614e2d5a9fe2306eaf47cd | 3f3769ba76061a511f02f2a48da2ad2d93fce511 | 2025-05-02T20:54:13+03:00 | Georgi Gerganov | | context : fix reorder logic (#13267) |
| 928 | 3f3769ba76061a511f02f2a48da2ad2d93fce511 | 2f567611c0234bbca0a4009762acb47b56866095 | 2025-05-02T22:23:12+05:30 | shalinib-ibm | | ggml : Enable MMA for BF16 in llamafile_sgemm (#13148) |
| 929 | 074e42ab31de4c99aa7d9d2d239660f64b2380d6 | c642bc014c105728ce45015813351dc5a37f60a2 | 2025-05-02T17:17:15+02:00 | Xuan-Son Nguyen | | convert : converting mmproj for Qwen2/2.5VL from convert_hf_to_gguf (#13209) |
| 930 | c642bc014c105728ce45015813351dc5a37f60a2 | cb06a3c363f50cd35113984fe8fb164aea419077 | 2025-05-02T17:48:36+03:00 | Georgi Gerganov | | kv-cache : separate recurrent vs non-recurrent impl (#12799) |
| 931 | 2af6880178b4bc2c0eced726bab68b4bf333042b | e84773ab604fe0d935d03741df003716398dc57b | 2025-05-02T17:06:09+08:00 | piDack | | llama-chat : reset glmedge chat template (#13253) |
| 932 | e84773ab604fe0d935d03741df003716398dc57b | fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 | 2025-05-02T14:20:27+06:00 | Shakil Ahmed | | mtmd-cli : fix out_of_range when input image path is empty (#13244) |
| 933 | d24d5928086471063fa9d9fd45aca710fd1336ae | 8efbdadc616fa717c369059b9b388160958d886c | 2025-05-01T19:06:39-03:00 | bandoti | | ci: fix cross-compile sync issues (#12804) |
| 934 | f057808ffadce213f54c1884ab5096e60140f358 | d7a14c42a1883a34a6553cbfe30da1e1b84dfd6a | 2025-05-01T13:46:10-07:00 | Jesse Gross | | ggml: Don't assert fail when tensor data changes (#13222) |
| 935 | d7a14c42a1883a34a6553cbfe30da1e1b84dfd6a | b6e4ff69b8abd509647b531bd5b4e86950204f66 | 2025-05-01T21:48:08+02:00 | Diego Devesa | | build : fix build info on windows (#13239) |
| 936 | 79f26e9e125b21760aeb016f34bfd42a93f48351 | fc727bcdd5a311c7c69a76dbf87f4784e828c7b4 | 2025-05-01T13:49:39-05:00 | Jeff Bolz | | vulkan: Add bfloat16 support (#12554) |
| 937 | 99881f77d82efda80b21057d84f1cc2df2f1e0f6 | b5769d92b4510c77691ad9e3f8b643c2ba202e53 | 2025-05-01T10:05:24+02:00 | Daniel Bevenius | | whisper : add check that target name exists (whisper/3103) |
| 938 | b5769d92b4510c77691ad9e3f8b643c2ba202e53 | 8936784f7a1ec4f91637d04b77fdc90ec36ebac9 | 2025-04-29T15:47:55+02:00 | Daniel Bevenius | | ggml : suppress Windows compiler warnings (whisper/3075) |
| 939 | 8936784f7a1ec4f91637d04b77fdc90ec36ebac9 | 13c9a3319b65469e883c49dd1c478abedc410157 | 2025-05-01T17:05:42+02:00 | Xuan-Son Nguyen | | mtmd : add **vision** support for Mistral Small 3.1 (#13231) |
| 940 | a70183eb0079fdf6ebeaed12966338a039461b5d | 8d33d740c308fe0049515668aac0e561269afe9e | 2025-05-01T03:09:41-04:00 | Jared Van Bortel | | llama-model : fix the reported size class for nomic-embed-text-v2-moe (#13223) |
| 941 | 4254bb49518e0f920f14c9aadd96eefdfd38b429 | 9998540149a490200894acfe595e9a1546bab723 | 2025-04-30T15:20:40+02:00 | Diego Devesa | | ggml : fix ggml_gallocr_ptr type (ggml/1205) |
| 942 | 9998540149a490200894acfe595e9a1546bab723 | e1e8e0991ffd9e99a445c6812bb519d5bac9f4b5 | 2025-04-24T18:59:06+03:00 | Georgi Gerganov | | cuda : fix unused variable compile warning (whisper/0) |
| 943 | 6f67cf1f480926391ad75ff746e0a021214bf70c | 16a457facd996915652f6274384c87602b27d21a | 2025-04-30T22:29:15+02:00 | Xuan-Son Nguyen | | arg : -hf do not fail if url mismatch (#13219) |
| 944 | 16a457facd996915652f6274384c87602b27d21a | 3e168bede4d27b35656ab8026015b87659ecbec2 | 2025-04-30T15:28:43-05:00 | ddh0 | | fix typo: `n_ctx_pre_seq` -> `n_ctx_per_seq` (#13221) |
| 945 | 3e168bede4d27b35656ab8026015b87659ecbec2 | ceda28ef8e310a8dee60bf275077a3eedae8e36c | 2025-04-30T16:56:24+02:00 | Xuan-Son Nguyen | | convert : improve model arch handling (#13122) |
| 946 | e5007a5edf2692ef7151a81a61ce2716b83374e5 | 416313773b53585fddcafbcb914cbbfbaeb94b1f | 2025-04-30T07:38:37-05:00 | Jeff Bolz | | vulkan: use uint array index to avoid glslang bug (#13193) |
| 947 | 416313773b53585fddcafbcb914cbbfbaeb94b1f | 07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa | 2025-04-30T16:47:08+05:30 | shalinib-ibm | | ggml : fix ppc64le build (#13176) |
| 948 | a0f7016d170ca4bfe24d9a9f26c024d034af69f2 | 19e899ce21a7c9ffcf8bb2b22269a75f6e078f8f | 2025-04-30T14:29:22+08:00 | xiaofei | | rpc : fix cache directory initialization (#13188) |
| 949 | e2e1ddb93a01ce282e304431b37e60b3cddb6114 | d9d398f84f96d16c308d4976f5e90222ecc2a492 | 2025-04-29T20:33:10+02:00 | matteo | | server : Prefilling assistant message in openai compatible API (#13174) |
| 950 | 5a6398011704c31178d7b774be67856ba57647c8 | cdf76586b23c67abd3ca064ee2c084c57ae240bd | 2025-04-29T16:24:36+01:00 | Alberto Cabrera Pérez | | llama-bench: fixed size of fields to correctly map to values (#13183) |
| 951 | cdf76586b23c67abd3ca064ee2c084c57ae240bd | 7d3af70b089bb349b5d17eb01839224c99ec1952 | 2025-04-29T16:00:27+02:00 | Johannes Gäßler | | CUDA: fix non-cont. inputs for batched mat mul (#13155) |
| 952 | b6ce7430b7eb51f032152316880204e0a9c0470e | 5f5e39e1ba5dbea814e41f2a15e035d749a520bc | 2025-04-29T08:45:49+02:00 | Xuan-Son Nguyen | | llama-graph : fix text position for mrope (#13159) |
| 953 | 5f5e39e1ba5dbea814e41f2a15e035d749a520bc | eaea3253244dc4bbe07f6cd81325847ccc6cf93e | 2025-04-28T15:52:15-04:00 | AT | | model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466) |
| 954 | eaea3253244dc4bbe07f6cd81325847ccc6cf93e | 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 | 2025-04-28T21:23:19+02:00 | Xuan-Son Nguyen | | clip : fix model size display (#13153) |
| 955 | 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 | 1831f538f720d1d99fba146f24f0a8e970838cc4 | 2025-04-28T21:00:20+03:00 | Ville Vesilehto | | fix(rpc): Improve input validation and error handling (#13069) |
| 956 | 1831f538f720d1d99fba146f24f0a8e970838cc4 | 4e87962e34a4b257ec374c4baf6b1568554b81a9 | 2025-04-28T20:20:39+05:30 | Vishal Agarwal | | llama-bench: add `-d` depth arg (#13096) |
| 957 | 4e87962e34a4b257ec374c4baf6b1568554b81a9 | fb0471d1753824e75474c24f82fbdd54c94dceda | 2025-04-28T16:12:56+02:00 | Xuan-Son Nguyen | | mtmd : fix glm-edge redundant token count (#13139) |
| 958 | 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 | a4c340f974f9b7ac0c1aae897aabaa54549a97e5 | 2025-04-28T12:18:59+02:00 | Xuan-Son Nguyen | | clip : refactor set input for cgraph + fix qwen2.5vl input (#13136) |
| 959 | 43f2b07193cbcccd266734320ea9b948f5a01926 | e5d6c2554e7597665e26991a93fa2f3d16c79ad5 | 2025-04-28T11:57:19+03:00 | Georgi Gerganov | | common : fix noreturn compile warning (#13151) |
| 960 | e5d6c2554e7597665e26991a93fa2f3d16c79ad5 | f0dd6a1926cdb2f4183a937deee40db26ef8f1da | 2025-04-28T10:11:58+02:00 | Xuan-Son Nguyen | | llama-chat : fix typo GML --> GLM (#13143) |
| 961 | f0dd6a1926cdb2f4183a937deee40db26ef8f1da | 69699be48a6b94570773532850667f1591dc5bbe | 2025-04-28T15:33:28+08:00 | R0CKSTAR | | musa: fix typo in cc control (#13144) |
| 962 | 69699be48a6b94570773532850667f1591dc5bbe | 85f36e5e7173eef7c671c778db44c034e1d0ab19 | 2025-04-28T09:29:26+02:00 | Johannes Gäßler | | CUDA: fix q_nope_absorbed prec for DS 2 Lite f16 (#13137) |
| 963 | 85f36e5e7173eef7c671c778db44c034e1d0ab19 | c0a97b762e5ec767dc414f0dc4979befd4c09a52 | 2025-04-28T07:16:59+02:00 | Xuan-Son Nguyen | | arg : fix unused variable (#13142) |
| 964 | c0a97b762e5ec767dc414f0dc4979befd4c09a52 | ced44be34290fab450f8344efa047d8a08e723b4 | 2025-04-27T14:48:26-07:00 | 4onen | | llama-bench : Add `--override-tensors` arg (#12922) |
| 965 | ced44be34290fab450f8344efa047d8a08e723b4 | e291450b7602d7a36239e4ceeece37625f838373 | 2025-04-27T21:57:32+02:00 | matteo | | llama-chat : fix wrong template in GLM4-0414 (#13140) |
| 966 | e291450b7602d7a36239e4ceeece37625f838373 | 59e991c23cc44cb5fb657e7b9358cac21fb79828 | 2025-04-27T19:22:49+08:00 | R0CKSTAR | | musa: fix build warning (#13129) |
| 967 | 59e991c23cc44cb5fb657e7b9358cac21fb79828 | ca2bb89eac2097ab4620448737e58af8452e444b | 2025-04-27T18:43:37+08:00 | LostRuins Concedo | | Fixes Qwen2.5VL segfault during inference with https://github.com/ggml-org/llama.cpp/pull/12402 as has_qwen2vl_merger migration was incomplete (#13133) |
| 968 | ca2bb89eac2097ab4620448737e58af8452e444b | 2d451c80590b9ac250322769ac13d3b4870dbcf7 | 2025-04-27T16:10:34+08:00 | HimariO | | clip : Add Qwen2.5VL support (#12402) |
| 969 | 295354ea6848a77bdee204ee1c971d9b92ffcca9 | 558a764713468f26f5a163d25a22100c9a04a48f | 2025-04-25T19:40:11+02:00 | Diego Devesa | | llama : fix K-shift with quantized K and BLAS backend (#13113) |
| 970 | 558a764713468f26f5a163d25a22100c9a04a48f | edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e | 2025-04-25T14:38:34+02:00 | City | | Force FP32 compute in GLM4 FFN Down (#13101) |
| 971 | edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e | 514c45608f93f66106a712dee1abe062099ce790 | 2025-04-25T14:31:42+02:00 | Xuan-Son Nguyen | | clip : fix pixtral on some GPU backends (#13097) |
| 972 | 514c45608f93f66106a712dee1abe062099ce790 | 553a5c3a9fdf771be2101bc3529937963f817457 | 2025-04-25T17:37:51+08:00 | Neo Zhang Jianyu | | change the reorder tensor from init to execute OP (#13003) |
| 973 | 553a5c3a9fdf771be2101bc3529937963f817457 | 13be08daf992c89d5169518229b3740041c0f419 | 2025-04-25T10:08:08+03:00 | Radoslav Gerganov | | rpc : do not wait for response when sending RPC_CMD_SET_TENSOR (#12943) |
| 974 | 226251ed56b85190e18a1cca963c45b888f4953c | 87616f0680947800ecba3e9f6bc6e101943bf8e6 | 2025-04-24T22:29:22+03:00 | Georgi Gerganov | | embeddings : fix batch sizes (#13076) |
| 975 | 87616f0680947800ecba3e9f6bc6e101943bf8e6 | 63b4911494afe04778c61b9c19019341d71c99fc | 2025-04-24T17:22:27+03:00 | Georgi Gerganov | | ggml : fix trailing whitespaces (#0) |
| 976 | c6e8cc28c15166dba15629dba6a7366d4d5955ca | b10d8bfdb1dac40cce34e8860ca5ec7d950c3a44 | 2025-04-17T14:16:45+02:00 | Acly | | ggml : Depthwise 2D convolution (ggml/1152) |
| 977 | 80982e815e67bae2442237f4e11466f44c9a2988 | 7604a7d6b80e78eef8f275fc700d0f64820d672f | 2025-04-24T12:14:13+02:00 | Xuan-Son Nguyen | | arg : clean up handling --mmproj with -hf (#13082) |
| 978 | 7604a7d6b80e78eef8f275fc700d0f64820d672f | b3b6d862cfdf190e1b9ad961639a25f5ebc0c7e3 | 2025-04-24T10:38:30+03:00 | Georgi Gerganov | | metal : fix floating-point range of attention scores in FA kernels (#13090) |
| 979 | ecda2ec4b347031a9b8a89ee2efc664ce63f599c | eb1776b15a32d832f1266deeeab75b9d255c5849 | 2025-04-23T20:21:59+02:00 | Xuan-Son Nguyen | | mtmd : Support Pixtral 12B (#13065) |
| 980 | 658987cfc9d752dca7758987390d5fb1a7a0a54a | dc39a5e7a84815a90fa0c515ed8927870cf858c9 | 2025-04-22T21:27:40+02:00 | Johannes Gäßler | | CUDA: noncont MMVQ + batched bs1 MUL_MAT_ID (#13014) |
| 981 | dc39a5e7a84815a90fa0c515ed8927870cf858c9 | ab47dec3d37aa1927c2ec590e166b76141374ed3 | 2025-04-22T16:24:54+02:00 | Xuan-Son Nguyen | | mtmd : support SmolVLM (version 1 and 2) (#13050) |
| 982 | 7b53389c24a507564be39e1ea82746a39749059b | 243453533e029334181dda50d911d5fc5a2b2486 | 2025-04-22T16:15:51+03:00 | Georgi Gerganov | | metal : add memory pool for temp allocs (#12850) |
| 983 | 243453533e029334181dda50d911d5fc5a2b2486 | 1d735c0b4fa0551c51c2f4ac888dd9a01f447985 | 2025-04-22T10:37:00+02:00 | Xuan-Son Nguyen | | llava : update documentations (#13055) |
| 984 | 2016f07bd106c73699ecbaace80f55db5ed95dac | 6602304814e679cc8c162bb760a034aceb4f8965 | 2025-04-20T23:29:36+02:00 | Xuan-Son Nguyen | | convert : experimental support for `--mmproj` flag (#13023) |
| 985 | 6602304814e679cc8c162bb760a034aceb4f8965 | 66168204be9559dc841f06f0025f3da01d9a8546 | 2025-04-20T03:15:41-07:00 | Jeffrey Morgan | | llava: fix errors in clip.h on certain compilers (#13030) |
| 986 | fb28f4f80efb5a2990a6a240433b02e259b0dbb1 | 37b9f0d29d7301dd0ec5dfae8f357ccee96325d7 | 2025-04-19T16:26:38+02:00 | Sigbjørn Skjæret | | gguf-py : fix upload python package workflow (#13020) |
| 987 | 6408210082cc0a61b992b487be7e2ff2efbb9e36 | aff9d107b066c9d464f7ab1324280acfdcebf569 | 2025-04-18T16:02:55-04:00 | Daniel Tang | | main : Fix Ctrl+D/newline handling (#12951) |
| 988 | 35370ba94593c3abc9550328377d461fc4f822b7 | 8d6600576318dfc6b091fca744b0fd36a5e5255f | 2025-04-18T19:58:12+02:00 | Xuan-Son Nguyen | | server : use std::move whenever possible (#12936) |
| 989 | 8d6600576318dfc6b091fca744b0fd36a5e5255f | b9154ecff93ff54dc554411eb844a2a654be49f2 | 2025-04-18T19:27:56+05:30 | Akarshan Biswas | | SYCL: Refactor and enable FP16 in binary broadcast OPs (#12975) |
| 990 | b9154ecff93ff54dc554411eb844a2a654be49f2 | 2db9ba1464f3de0aceb2b5289963e69fc369cb66 | 2025-04-18T10:04:51+02:00 | Xuan-Son Nguyen | | mtmd : add methods to access `mtmd_image_tokens` (#12906) |
| 991 | 2db9ba1464f3de0aceb2b5289963e69fc369cb66 | 2f74c354c0f752ed9aabf7d3a350e6edebd7e744 | 2025-04-18T10:13:42+03:00 | Radoslav Gerganov | | rpc : add RPC_CMD_HELLO (#12955) |
| 992 | 7a395f67a7a02bb361d944b816d6e933889e28e1 | 971f245b3b5f3f55991bb779cb541b00f82eea1d | 2025-04-17T20:34:16+08:00 | hipudding | | CANN: Add support for async operator submission (#12864) |
| 993 | 971f245b3b5f3f55991bb779cb541b00f82eea1d | 12b17501e6015ffe568ac54fdf08e6580833bf1b | 2025-04-17T01:37:05-07:00 | Mikko Juola | | llama : recognize IBM Granite 3.3 FIM tokens (#12988) |
| 994 | 12b17501e6015ffe568ac54fdf08e6580833bf1b | 015022bb53387baa8b23817ac03743705c7d472b | 2025-04-17T06:25:57+09:00 | kimminsu | | opencl: fix incorrect local_size index in profiling log (#12868) |
| 995 | 80f19b41869728eeb6a26569957b92a773a2b2c6 | f8f820cc4dc37032d5375972ba904ce53043445d | 2025-04-15T12:26:00-07:00 | lhez | | opencl: split `ggml-opencl.cl` into multiple files and cleanup (#12886) |
| 996 | 54a72720432810c89c2693f34908b60b88da1e46 | 84778e97703740d8ac5fb64e14d83b80eafa0f3c | 2025-04-15T19:08:55+08:00 | hipudding | | CANN: Add x86 build ci (#12950) |
| 997 | daa422881a0ec7944771bcc8ff8de34d11f5bd3b | eccc7a1602f0752507de4aaad1008b9618a282c8 | 2025-04-15T07:49:57+01:00 | Juk Armstrong | | llama : DeepSeek V2/V3 MLA implementation (#12801) |
| 998 | eccc7a1602f0752507de4aaad1008b9618a282c8 | 0019279bb56f028e4eee19b59b19750736c719f7 | 2025-04-15T11:52:36+05:30 | Srihari-mcw | | ggml : Add AVX512 implementation of GEMM - Q4_Kx8 (#12829) |
| 999 | 0019279bb56f028e4eee19b59b19750736c719f7 | b0c75ac9f93322b45e3766e149417334b4fd1ed9 | 2025-04-15T10:09:35+08:00 | Chenguang Li | | CANN: Opt ROPE optimization (#12865) |
| 1000 | b0c75ac9f93322b45e3766e149417334b4fd1ed9 | d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 | 2025-04-15T10:04:24+08:00 | Xinpeng Dou | | CANN: Optimize CANN buffer pool memory management (#12875) |
| 1001 | 75afa0ae31f0a51aaadcc5ff146eb7a32a7f9088 | c772d549264c1be058411312a54049e0dc86a037 | 2025-04-14T17:53:53+05:30 | Akarshan Biswas | | SYCL: Fix im2col (#12910) |
| 1002 | a25355e2643b1feb2fcbbc4c00312aa86370d858 | e959d32b1c16c02c0bc0bcdc7bc3f7077bc32f99 | 2025-04-11T12:14:19+05:30 | cmdr2 | | cpu: fix cpu backend's supports-op for GET_ROWS_BACK. fixes a fatal when running test-backend-ops with only the CPU backend (ggml/1190) |
| 1003 | 307bfa253dea07c9270e78fa53b133504e9c3c9d | 71e90e8813f90097701e62f7fce137d96ddf41e2 | 2025-04-13T22:12:21+01:00 | Alan Gray | | ggml: disable CUDA graphs for unsupported DUP and CONT node types (#12891) |
| 1004 | 71e90e8813f90097701e62f7fce137d96ddf41e2 | bc091a4dc585af25c438c8473285a8cfec5c7695 | 2025-04-13T19:29:28+01:00 | Ed Addario | | quantize: Handle user-defined quantization levels for additional tensors (#12511) |
| 1005 | e59ea539b83d2c7947c99bd350549364dbba450c | c94085df2871d2cad11f6411304d7798d7dd4cdd | 2025-04-12T01:29:03-04:00 | Matt Clayton | | llava: Fix cpu-only clip image encoding sefault (#12907) |
| 1006 | b6930ebc421e20399663bbd3bc7b7266d5236d06 | 68b08f36d047bfa048ebd7d16262c53bf9ece701 | 2025-04-11T12:47:52-07:00 | Olivier Chafik | | `tool-call`: fix non-tool-calling grammar crashes w/ Qwen / Hermes 2 templates (#12900) |
| 1007 | b2034c2b55b36b2192bdefb3b295db2a911370f5 | 06bb53ad9b6e6d92b6ab6979927530080b1c990c | 2025-04-11T20:01:56+08:00 | tastelikefeet | | contrib: support modelscope community (#12664) |
| 1008 | 06bb53ad9b6e6d92b6ab6979927530080b1c990c | 0c509239445088f21265580b86733c5b184261d9 | 2025-04-11T18:10:10+08:00 | Yuxuan Zhang | | llama-model : add Glm4Model implementation for GLM-4-0414 (#12867) |
| 1009 | 0c509239445088f21265580b86733c5b184261d9 | fccf9cae83e6c6cd31a0ecb403d237638e427d0a | 2025-04-11T12:09:39+02:00 | Xuan-Son Nguyen | | clip : use smart pointer (⚠️ breaking change) (#12869) |
| 1010 | ec6c09d0fac1f2699c3ea1994e10482cb4b95e0f | 8ac9f5d765f2b1b7f821873618c0cff68ca59bc8 | 2025-04-11T00:49:09-07:00 | Daniel Han | | convert : Llama4 RoPE fix (#12889) |
| 1011 | 12e9158f25cb47e97ca9b8083e1ec7415f262260 | 5b1f13cb64dbb0de7e95dae86725928d350c188c | 2025-04-11T09:24:34+02:00 | Daniel Bevenius | | xcf : add check for visionos build version (#12854) |
| 1012 | 0fed24c34787d2aa916ed204db88889591ad6e55 | 47ba87d0a4f91eb181ea60f8a7fc2539b123aeaf | 2025-04-11T13:20:07+08:00 | Aaron Teo | | ggml: fix compilation error s390x (#12848) |
| 1013 | 1d2b613445bab6b179296aa63c8ee346fb947cc4 | eb420e11484ef32cc1abedb2a26ecef1bbf1e31b | 2025-04-11T00:04:25+03:00 | Georgi Gerganov | | tests : fix init order (#0) |
| 1014 | cb79c2e7fa28e874694c14598c1fd2fde82263e1 | fe92821ea9ae53f3088cf2699a9e102448295fa0 | 2025-04-10T17:53:08+05:30 | cmdr2 | | ggml: don't include arm_neon.h when using CUDA 12 with ARM Neon (ggml/1187) |
| 1015 | e4bf72d631434b38656cb97e2411826d900433e8 | 8b9cc7cdd8a0dcf0176c60c755322c95b5965299 | 2025-04-10T23:59:01+03:00 | Georgi Gerganov | | scripts : fix sync-ggml-am.sh |
| 1016 | 8b9cc7cdd8a0dcf0176c60c755322c95b5965299 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | 2025-04-10T22:57:16+02:00 | Xuan-Son Nguyen | | llava : introduce libmtmd (#12849) |
| 1017 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | fe5b78c89670b2f37ecb216306bed3e677b49d9f | 2025-04-10T17:24:44+02:00 | Xuan-Son Nguyen | | convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) |
| 1018 | 11d07e1e69138b46375e9267b31acd58e3813577 | b0091ecc1e5c0f689be856fade3803a534f35c9f | 2025-04-10T04:48:01+05:30 | Prajwal B Mehendarkar | | Fixes #12823 (#12830) |
| 1019 | 31f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e | 2391506ace6abb56186def40c7107fdfa694ed55 | 2025-04-09T23:00:34Z | Piotr Kubaj | | ggml-cpu-impl.h: do not redefine bool on POWER9 (#12856) |
| 1020 | 2391506ace6abb56186def40c7107fdfa694ed55 | d3bd7193ba66c15963fd1c59448f22019a8caf6e | 2025-04-09T23:00:25Z | Piotr Kubaj | | ggml-impl.h: fix build on POWER9 (#12855) |
| 1021 | d3bd7193ba66c15963fd1c59448f22019a8caf6e | d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 | 2025-04-09T17:47:36+08:00 | Bo Zheng | | llama : Support Qwen3 and Qwen3MoE (#12828) |
| 1022 | 381603a77504ad1788965f694094540c1bed9ea2 | 65a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d96 | 2025-04-09T11:11:11+03:00 | Plamen Minev | | ci: detach common from the library (#12827) |
| 1023 | 0090950f679475c5ecaac2f7bca5049cca96492b | 7ecd780b1a1d5214b8d04c25ebfc194d310816ed | 2025-04-09T00:25:08-05:00 | Jeff Bolz | | vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833) |
| 1024 | a19b5cef16d885c44c635da4a5c97113c1577de8 | 78a1ba0a4f2bfed5b8b8e312592143d22e531698 | 2025-04-08T19:54:51+03:00 | Georgi Gerganov | | llama : fix FA when KV cache is not used (i.e. embeddings) (#12825) |
| 1025 | 78a1ba0a4f2bfed5b8b8e312592143d22e531698 | 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 | 2025-04-08T18:37:06+02:00 | Xuan-Son Nguyen | | server : fix thread.join() on exit (#12831) |
| 1026 | a226bc7a9ac50551f9f113808de0f0046837f188 | 1466621e738779eefe1bb672e17dc55d63d166bb | 2025-04-08T03:03:07-04:00 | compilade | | gguf-py : support lazy tensor splitting (#12809) |
| 1027 | 1466621e738779eefe1bb672e17dc55d63d166bb | 82974011f312057b446c27267105bd7ad3810599 | 2025-04-07T23:06:44+02:00 | Xuan-Son Nguyen | | llama : Support llama 4 text-only (#12791) |
| 1028 | 1a1ab7e7a4a9b6e6440c1d9965d2b9d1b7e7dafb | a4e46e28f99d7f64f38d8328cdb6bee5a3a1cd03 | 2025-04-07T13:18:07+03:00 | Georgi Gerganov | | cuda : fix HIP and MUSA BF16 (#0) |
| 1029 | 36ca8b362885e4b4984d72e348ba403568864a95 | 995083e4ed24933e6a289472f9de0f0b53ca5eca | 2025-04-04T21:05:12+02:00 | Sigbjørn Skjæret | | CUDA: don't convert BF16 weights to FP32 (ggml/1174) |
| 1030 | 995083e4ed24933e6a289472f9de0f0b53ca5eca | 518a01480eb3a7c80a4951b430db9dee55428310 | 2025-04-02T17:46:16+05:30 | cmdr2 | | cpu: move all the operators into a separate c++ file (except mul_mat) (ggml/1167) |
| 1031 | bd3f59f81289b920bcc597a208c14f55e39ed37e | 52b3d71f128c1eeab39b918adf1f7a8f5e256619 | 2025-04-07T13:35:19+02:00 | Xuan-Son Nguyen | | cmake : enable curl by default (#12761) |
| 1032 | 52b3d71f128c1eeab39b918adf1f7a8f5e256619 | d0d5b2232b3826cac2c6e62d0244a474ba79860f | 2025-04-07T19:34:14+08:00 | zhouwg | | CANN: fix typo in ggml-cann (#12733) |
| 1033 | d0d5b2232b3826cac2c6e62d0244a474ba79860f | 916c83bfe7f8b08ada609c3b8e583cf5301e594b | 2025-04-07T17:10:36+08:00 | hipudding | | CANN: Refactor to reduce duplicate code (#12731) |
| 1034 | 916c83bfe7f8b08ada609c3b8e583cf5301e594b | 0c74b04376b0b9efc096480fe10f866afc8d7c1c | 2025-04-06T21:23:54+08:00 | R0CKSTAR | | musa: fix compilation warnings in mp_22/31 (#12780) |
| 1035 | 0c74b04376b0b9efc096480fe10f866afc8d7c1c | 80b717d493a9a5bae7167ad2384c12c60bb2ef20 | 2025-04-06T04:03:47-05:00 | Jeff Bolz | | vulkan: fix NaN issue in flash attention shader (#12776) |
| 1036 | f1e3eb4249db68d97be352c0adf16eef7ae53795 | 0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4 | 2025-04-05T23:46:00+08:00 | Sergey Fedorov | | common : fix includes in arg.cpp and gemma3-cli.cpp (#12766) |
| 1037 | 0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4 | c6ff5d2a8da2587cc78c9ede9171dfc3f076c757 | 2025-04-05T17:17:40+02:00 | Xuan-Son Nguyen | | clip : refactor clip_init, add tests (#12757) |
| 1038 | 7a84777f42a9b3ba47db5d20b7662f8ddf92f652 | 3e1d29348b5d77269f6931500dd1c1a729d429c8 | 2025-04-04T13:16:39-07:00 | Olivier Chafik | | sync: minja (#12739) |
| 1039 | 3e1d29348b5d77269f6931500dd1c1a729d429c8 | 1be76e4620ddc99b3cbff0f206436117ae561047 | 2025-04-04T21:48:10+03:00 | Georgi Gerganov | | kv-cache : simplify + fix warning for recurrent models (#12756) |
| 1040 | b7723942970b70412793f1926a35cfb93d5c157c | 23106f94ea2bc3da929afb7330655fd5515d08dc | 2025-04-04T09:09:52-05:00 | Nauful Shaikh | | server : webui : Upgrade daisyui, tailwindcss. (#12735) |
| 1041 | 9ac4d611d05b03f961e627f4f399e4377bdb4ad3 | 348888e0dc469a476f9e9eccb394893c513daab8 | 2025-04-04T15:12:40+02:00 | Ronny Brendel | | cmake: fix ggml-shaders-gen compiler paths containing spaces (#12747) |
| 1042 | 74d4f5b041ad837153b0e90fc864b8290e01d8d5 | 35e592eb30832187412360912ab8f2f5b7984df1 | 2025-04-04T00:54:35-05:00 | Jeff Bolz | | vulkan: Hybrid waitForFences/getFenceStatus to reduce fence latency (#12630) |
| 1043 | 7d7b1bafa7980603a61cb102879fe38a33f66c08 | c262beddf29f3f3be5bbbf167b56029a19876956 | 2025-04-03T22:18:17-07:00 | lhez | | opencl: update doc for OpenCL (#12702) |
| 1044 | 1c059995e080e37aeaacaae35850fc4c044b9dbe | 2004644b7a5da6fe080e51861ab583480280f1d3 | 2025-04-03T10:08:26-05:00 | Jeff Bolz | | vulkan: Fix missing cmake logic for dot product extension (#12721) |
| 1045 | 193c3e03a63ccda3ac3d6a2999e41e6d1414fe23 | 65cfe136a0793b2fdf5af8bdb1ab2cf10c3e1d2e | 2025-04-03T15:32:55+08:00 | a3sh | | fix MUSA compiler warning (#12704) |
| 1046 | 3f9da22c2b21a2cef216de50006436ef1cab8764 | 2a0dc97e56eac6db0a4016f0b45da6d0a0055ef2 | 2025-04-03T02:31:15+01:00 | Alan Gray | | Simplify and improve CUDA graphs through use of indirect copy pointers (#9017) |
| 1047 | 2a0dc97e56eac6db0a4016f0b45da6d0a0055ef2 | 97a20c012be2f9bfbeee0209405a31001f93ccf9 | 2025-04-03T08:49:51+08:00 | hipudding | | CANN: Fix failed test cases (#12708) |
| 1048 | be0a0f8cae039e2286f757612accebfb8f21b36e | 92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2 | 2025-04-02T12:40:32-05:00 | Jeff Bolz | | vulkan: Implement grouped query attention in the coopmat2 FA shader (#12559) |
| 1049 | 92e3006bb69dfeb656ccf5c7c1c1efadb03c88c2 | 833e2b7409211a07df97716998c5002526642652 | 2025-04-02T19:12:30+02:00 | 0cc4m | | Vulkan: Fix mmq int dot float cache size (#12722) |
| 1050 | 833e2b7409211a07df97716998c5002526642652 | e0e912f49b3195ef9d0c51378629ba03c9b972da | 2025-04-02T16:38:54+03:00 | Georgi Gerganov | | model : print tensor size during load (#12711) |
| 1051 | e0e912f49b3195ef9d0c51378629ba03c9b972da | a10b36c91a091f4606710fba4e9327fd71e0e738 | 2025-04-02T14:52:01+02:00 | Diego Devesa | | llama : add option to override model tensor buffers (#11397) |
| 1052 | a10b36c91a091f4606710fba4e9327fd71e0e738 | 83a88bd6affbe148a622ac730952ac5b8b585979 | 2025-04-02T14:32:59+03:00 | Georgi Gerganov | | llama : refactor kv cache guard (#12695) |
| 1053 | 83a88bd6affbe148a622ac730952ac5b8b585979 | 42eb248f46e1175349e553b6eda6cb63027d74d1 | 2025-04-02T11:21:48+02:00 | Sigbjørn Skjæret | | vocab : BailingMoE : change possessive quantifiers to greedy (#12677) |
| 1054 | 42eb248f46e1175349e553b6eda6cb63027d74d1 | 9bacd6b37461608385360fd64326c13247ccf18e | 2025-04-02T09:58:34+02:00 | Xuan-Son Nguyen | | common : remove json.hpp from common.cpp (#12697) |
| 1055 | 267c1399f15a278ec8c3cdcf9c90dc94151fbc38 | f423981ac806bf031d83784bcb47d2721bc70f97 | 2025-04-01T23:44:05+02:00 | Xuan-Son Nguyen | | common : refactor downloading system, handle mmproj with -hf option (#12694) |
| 1056 | f423981ac806bf031d83784bcb47d2721bc70f97 | e39e727e9a3daec7082b9c59540a429ad85914af | 2025-04-02T01:54:34+09:00 | Junil Kim | | opencl : fix memory allocation size (#12649) |
| 1057 | 5936a616e46cffad4579ccaff8f8fa315809da4c | 3fd072a54001a908c54e81fd2e82b682ecfdd475 | 2025-04-01T14:37:13+02:00 | Sigbjørn Skjæret | | convert : BailingMoE : fix qkv split when head_dim is 0 (#12687) |
| 1058 | 3fd072a54001a908c54e81fd2e82b682ecfdd475 | a6f32f0b3437ac79827ffb55521cb839343324ab | 2025-04-01T14:57:19+03:00 | Georgi Gerganov | | metal : use F32 prec in FA kernels (#12688) |
| 1059 | a6f32f0b3437ac79827ffb55521cb839343324ab | 2bb3597e426ce092c3e10ae0bdd876963765e6ed | 2025-04-01T19:12:53+08:00 | R0CKSTAR | | Fix clang warning in gguf_check_reserved_keys (#12686) |
| 1060 | 2bb3597e426ce092c3e10ae0bdd876963765e6ed | 82939705421f4ef27e924879fdeed6d7b5f6d769 | 2025-04-01T06:38:07-03:00 | Wagner Bruna | | vulkan: fix build when glslc doesn't support coopmat (#12683) |
| 1061 | 82939705421f4ef27e924879fdeed6d7b5f6d769 | 8bbf26083d93274240a20d16cda324441c57fcc6 | 2025-04-01T10:24:29+02:00 | Romain Biessy | | SYCL: Rename oneMKL to oneMath (#12192) |
| 1062 | c80a7759dab10657b9b6c3e87eef988a133b9b6a | 250d7953e829ff0e16074510fef0e7cec696461b | 2025-03-31T18:40:56+02:00 | Daniel Bevenius | | vocab : add special infill tokens for CodeLlama (#11850) |
| 1063 | a8a1f3356786cbf8bcc3422e3c8737fc33b453e7 | 1790e7315726ceda256ea91eaa66fc36b63f6067 | 2025-03-31T14:37:01+02:00 | 0cc4m | | Vulkan: Add DP4A MMQ and Q8_1 quantization shader (#12135) |
| 1064 | 1790e7315726ceda256ea91eaa66fc36b63f6067 | 0114a32da0adc21dc04f05278cd8e3f67ba5f8c7 | 2025-03-31T15:05:30+03:00 | Georgi Gerganov | | cmake : fix whitespace (#0) |
| 1065 | 1a859490670c271e8e992c83cb11459ea0c3580c | 6c02a032fa21d69e881ef9a5c94ba28ebaf1d749 | 2025-03-31T11:28:30+02:00 | Sigbjørn Skjæret | | llava : proper description fix (#12668) |
| 1066 | 6c02a032fa21d69e881ef9a5c94ba28ebaf1d749 | f52d59d771dc231fc2ac39adacf157ddefc97730 | 2025-03-31T14:55:24+05:30 | Akarshan Biswas | | SYCL: Remove misleading ggml_sycl_op_flatten function (#12387) |
| 1067 | f52d59d771dc231fc2ac39adacf157ddefc97730 | 52de2e594979be52f0da92601747aa44a13e50e4 | 2025-03-31T11:07:07+02:00 | Sigbjørn Skjæret | | llava : fix clip loading GGUFs with missing description (#12660) |
| 1068 | 4663bd353c61c1136cd8a97b9908755e4ab30cec | b3de7cac732e7dc0e10e1bb07502a500b0ee9022 | 2025-03-30T22:04:04+03:00 | Georgi Gerganov | | metal : use constexpr in FA kernels + fix typedef (#12659) |
| 1069 | 7242dd96756472f90ba41db4e5ebb3969dfc7e7c | 492d7f1ff77e116e44962b832cc3db24cfc46d24 | 2025-03-30T21:12:03+03:00 | Sergei Vorobyov | | llama-chat : Add Yandex instruct model template support (#12621) |
| 1070 | 492d7f1ff77e116e44962b832cc3db24cfc46d24 | d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8 | 2025-03-30T16:59:38+08:00 | R0CKSTAR | | musa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611) |
| 1071 | a62d7fa7a979d21bcd760f1d7c19a66e55611f44 | e408d4351a4ad143656672479d8ae1479306ce31 | 2025-03-29T11:37:13+05:30 | cmdr2 | | cpu: de-duplicate some of the operators and refactor (ggml/1144) |
| 1072 | e408d4351a4ad143656672479d8ae1479306ce31 | 3891e183c61c1e25c2c61afe68d7b95019ea3f89 | 2025-03-24T09:53:38+01:00 | Daniel Bevenius | | ggml : add logging for native build options/vars (whisper/2935) |
| 1073 | 3891e183c61c1e25c2c61afe68d7b95019ea3f89 | af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 | 2025-03-20T07:02:18+01:00 | Daniel Bevenius | | examples : command.wasm updates (whisper/2904) |
| 1074 | af6ae1efb27a9a7c3f7f7f84639d2243f7303ac1 | 0bb2919335d00ff0bc79d5015da95c422de51f03 | 2025-03-30T00:07:37+01:00 | Xuan-Son Nguyen | | llama : fix non-causal mask for gemma 3 (#12615) |
| 1075 | 0bb2919335d00ff0bc79d5015da95c422de51f03 | a69f8463510a70fe0c85701b8c7ede283a0d1a7d | 2025-03-29T14:07:37+01:00 | Djip007 | | llama : change cpu_buft_list order: ACCEL -> GPU host -> CPU extra -> CPU (#12632) |
| 1076 | a69f8463510a70fe0c85701b8c7ede283a0d1a7d | d07a0d7a79bafb01fb3b6c8992121e75c57c0c2f | 2025-03-29T18:04:58+08:00 | Jay | | cmake : fix ccache conflict (#12522) |
| 1077 | 3714c3ee1a62ed64ac328ec7d699410ad1219150 | b4ae50810e4304d052e630784c14bde7e79e4132 | 2025-03-28T22:13:02+01:00 | Sigbjørn Skjæret | | llama : fix incorrect Qwen2Moe ffn_moe_out graph callback (#12631) |
| 1078 | b4ae50810e4304d052e630784c14bde7e79e4132 | b86f6007234da4bff51a3ebef2bdb952b52059c6 | 2025-03-28T20:21:59+02:00 | Georgi Gerganov | | metal : improve FA + improve MoE (#12612) |
| 1079 | b86f6007234da4bff51a3ebef2bdb952b52059c6 | dd373dd3bf81eced3e711fb7cb49123a6105933e | 2025-03-29T01:51:06+08:00 | Icenowy Zheng | | vulkan: fix coopmat shader generation when cross-compiling (#12272) |
| 1080 | dd373dd3bf81eced3e711fb7cb49123a6105933e | 5d01670266859444366e4f333ade5e0e5e2ae63d | 2025-03-28T18:08:52+01:00 | Johannes Gäßler | | llama: fix error on bad grammar (#12628) |
| 1081 | 13731766db91ec927c1b61bf502ac7a9be2b11b9 | ab6ab8f809bd514d88e02a63869b4d619f13fa86 | 2025-03-28T13:13:22+05:30 | amritahs-ibm | | llamafile : ppc64le GEMV forwarding for FP32. (#12594) |
| 1082 | ab6ab8f809bd514d88e02a63869b4d619f13fa86 | 2099a9d5dbdcd2841d02dd396a71d0de70bf4490 | 2025-03-28T08:18:04+02:00 | Radoslav Gerganov | | rpc : send hash when tensor data is above some fixed threshold (#12496) |
| 1083 | f125b8dccff34439a26bf750c9edef358c48c1f8 | 953c2a62cf487e618140f3ea18d94e3b0257af93 | 2025-03-27T10:49:15Z | Si1w | | llama : add PLM GGUF Conversion & Inference Support (#12457) |
| 1084 | 771d84371c0785c2554aef9a47cdd551b8c7ceaf | df0665a483b08da1c9b55534b624ae4e1fe89767 | 2025-03-27T09:22:30+02:00 | Georgi Gerganov | | scripts : update sync + fix cmake merge |
| 1085 | c7b43ab60855f752ae79937fb93d561bc30b69a4 | 24feaec05792b972d5ff3e2b12d9237ebd50d1ac | 2025-03-27T12:21:47+05:30 | amritahs-ibm | | llamafile : ppc64le MMA implementation for Q4_0. (#12489) |
| 1086 | 24feaec05792b972d5ff3e2b12d9237ebd50d1ac | f28bc4c286c453cd8385388eea057a404fdb6402 | 2025-03-27T14:38:34+08:00 | xctan | | ggml : riscv: add 128-bit RVV support (#12530) |
| 1087 | b3298fa47a2d56ae892127ea038942ab1cada190 | 2447ad8a981253a2b8e9f4b31cc8e7fdff83423e | 2025-03-26T21:38:38+02:00 | Georgi Gerganov | | metal : refactor mat-vec code (#12569) |
| 1088 | 02082f1519565fc7b49de211b28bc5404a69209b | df4d20cd53d5bb6fc21c1dc65f026d53b566d097 | 2025-03-26T22:06:04+08:00 | Ivy233 | | clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566) |
| 1089 | df4d20cd53d5bb6fc21c1dc65f026d53b566d097 | 5ed38b6852bd509d56acfdae54bceec8ab3cc396 | 2025-03-26T14:21:05+02:00 | Georgi Gerganov | | convert : fix squeeze for ssm_conv tensors (#12573) |
| 1090 | 5ed38b6852bd509d56acfdae54bceec8ab3cc396 | fd7855f8f522ab26681b25ae506ff99c654e2dd5 | 2025-03-26T13:02:00+02:00 | Georgi Gerganov | | ggml : fix MUL_MAT_ID repack with Q8_K (#12544) |
| 1091 | fd7855f8f522ab26681b25ae506ff99c654e2dd5 | 53af4dba425768fd507ce6b45873cfbb3df2295f | 2025-03-26T15:09:48+08:00 | R0CKSTAR | | doc: [MUSA] minor changes (#12583) |
| 1092 | 53af4dba425768fd507ce6b45873cfbb3df2295f | ef19c71769681a0b3dde6bc90911728376e5d236 | 2025-03-25T23:03:10+01:00 | Sigbjørn Skjæret | | convert: fix Mistral3/Gemma3 model hparams init (#12571) |
| 1093 | 053b3f9aae63151732eccf6b7408c6418ba8746e | e2f560175a195f63c3276972a3d1caec0bd13e05 | 2025-03-25T12:10:18+01:00 | Dan Johansson | | ggml-cpu : update KleidiAI to v1.5.0 (#12568) |
| 1094 | 2d77d88e70d017cd82c3f1a4517e3102e2028ac4 | c95fa362b3587d1822558f7e28414521075f254f | 2025-03-25T09:19:23+02:00 | Georgi Gerganov | | context : fix worst-case reserve outputs (#12545) |
| 1095 | 48d7021c61ceda6fcf1a7294d2115b8e1a53ae95 | 3361e2deba0f24942877559b35c430dec68528c3 | 2025-03-24T18:28:32+05:30 | Akarshan Biswas | | CI: fix SYCL build (#12546) |
| 1096 | 7ea75035b67f44c22ed7039967f718011fd35ce5 | c54f6b7988b63714b87b0390e01a1e69aee79a12 | 2025-03-24T18:28:34+08:00 | R0CKSTAR | | CUDA: Fix clang warnings (#12540) |
| 1097 | 9b169a4d4e01af7bc07a6981b53b27c18c9470d8 | 77f9c6bbe55fccd9ea567794024cb80943947901 | 2025-03-24T01:56:17-05:00 | Jeff Bolz | | vulkan: fix mul_mat_vec failure in backend tests (#12529) |
| 1098 | ba932dfb50cc694645b1a148c72f8c06ee080b17 | fac63a3d786b2a0f97876c30add02cb525a9648e | 2025-03-22T16:23:26+02:00 | Georgi Gerganov | | ggml : fix quantized cpy op (#12310) |
| 1099 | 4375415b4abf94fb36a5fd15f233ac0ee23c0bd1 | 30c42ef5cbb2db756eff9aadc6b6c528ba68388d | 2025-03-21T20:34:50+01:00 | stduhpf | | Vulkan: RTE rounding for cpy to quant (#12480) |
| 1100 | 30c42ef5cbb2db756eff9aadc6b6c528ba68388d | af04481e6b3b8dcdf5c1cc7d84bc7ece5658e9ab | 2025-03-21T19:27:47Z | Eve | | vulkan: workaround for AMD Windows driver 16 bit unpack8 bug (#12472) |
| 1101 | ea1518e839abe668c20f7e0074c0721f803da898 | 1aa87ee53d05505247c54612e40f6a38c680b433 | 2025-03-21T10:12:45+01:00 | marcoStocchi | | llama-tts : avoid crashes related to bad model file paths (#12482) |
| 1102 | 1aa87ee53d05505247c54612e40f6a38c680b433 | 9ffcc9e374080f73b16b7a351e6d76e7a8a19ce3 | 2025-03-21T14:58:47+08:00 | 蕭澧邦 | | [SYCL] Fix build on Windows when ccache enabled (#9954) (#9976) |
| 1103 | 3d82dbcbce2c677fc35fbf99574ccd107d95a1f8 | 732b5fbf5e7f9cf069942f0c5850ee959ef321ba | 2025-03-20T17:05:34+05:30 | Srihari-mcw | | ggml : block interleaving support for Q4_K quantization for x86 AVX2 architecture (#12332) |
| 1104 | 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 | a9b59288e222f39fc0311dc66944ed5a86c815fa | 2025-03-20T01:22:06+05:30 | Gaurav Garg | | CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183) |
| 1105 | 0fd8487b142b2b92565bc95b39ddc440955a237c | 108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 | 2025-03-19T10:15:23Z | Guus Waals | | Fix visionOS build and add CI (#12415) |
| 1106 | c446b2edd2a9fe2772a1a18923c3e54a6749c364 | d84635b1b085d54d6a21924e6171688d6e3dfb46 | 2025-03-19T02:26:26-05:00 | Jeff Bolz | | vulkan: Submit once enough matmul work has been recorded (#12406) |
| 1107 | d84635b1b085d54d6a21924e6171688d6e3dfb46 | 75422e8bc42646005be0754f7aa438b97a5e777e | 2025-03-18T12:54:55-07:00 | lhez | | opencl: improve profiling (#12442) |
| 1108 | 75422e8bc42646005be0754f7aa438b97a5e777e | bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71 | 2025-03-18T21:35:19+02:00 | Georgi Gerganov | | graph : normalize Q, K, V shapes + sync cross attention (#12449) |
| 1109 | c6af2161b200284d55633cf184a07406ca89908e | 99aa304fb900654ec338749f64e62895b9a88afd | 2025-03-18T19:35:11+02:00 | Georgi Gerganov | | speculative : fix seg fault in certain cases (#12454) |
| 1110 | 8551c44d840a7db50adb958ccaf464dc3ded82e7 | 35cae5ba05a5292dc3108636a71ec59fa2f80ab7 | 2025-03-18T13:05:49+02:00 | Georgi Gerganov | | context : always use non-causal attention for encoder graphs (#12447) |
| 1111 | 35cae5ba05a5292dc3108636a71ec59fa2f80ab7 | 810e0af3f50379682dd46b7967c4aadf3f8286f6 | 2025-03-18T11:16:31+01:00 | Łukasz Ślusarczyk | | SYCL: using graphs is configurable by environment variable and compile option (#12371) |
| 1112 | 810e0af3f50379682dd46b7967c4aadf3f8286f6 | eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c | 2025-03-18T12:05:42+02:00 | Georgi Gerganov | | server : fix warmup draft cache type (#12446) |
| 1113 | eba92d64c3f6d86de2e6b4dd3a540d2805a22b0c | d9a14523bb9074eef42d1b43ae4a1e149f81b7e2 | 2025-03-18T15:07:33+05:30 | Prajwal B Mehendarkar | | cmake : fix PowerPC build (#12241) |
| 1114 | fd123cfead49eb32e386e26b8ef7a6d41554dda5 | a53f7f7b8859f3e634415ab03e1e295b9861d7e6 | 2025-03-18T07:21:40+01:00 | 0cc4m | | Vulkan: Default to 1GB allocations instead of 4GB to avoid fragmentation and driver issues (#12434) |
| 1115 | a53f7f7b8859f3e634415ab03e1e295b9861d7e6 | 7dfad387e3f6ac98d383ded2d175eb59736a3993 | 2025-03-18T01:51:25+01:00 | Łukasz Ślusarczyk | | fixed compilation warnings in ggml-sycl (#12424) |
| 1116 | 7dfad387e3f6ac98d383ded2d175eb59736a3993 | 60c902926c928f9c2cd6390ce411876f92feeaf3 | 2025-03-18T07:27:50+08:00 | Molly Sophia | | llama: Add support for RWKV v7 architecture (#12412) |
| 1117 | b1b132efcba216c873715c483809730bb253f4a1 | 01e8f2138b2e40902afe2983ecbf503a08d74b1d | 2025-03-17T23:55:13+05:30 | Gaurav Garg | | cuda : enable CUDA Graph on CUDA Toolkit < 12.x (#12394) |
| 1118 | cf2270e4d3685ac46f4a166d8718997ba7cbc45a | f07690c930f74d82d4f108e567c7092544847f77 | 2025-03-17T12:42:33+01:00 | Daniele | | vulkan: subgroup size tuning (#12087) |
| 1119 | 8ba95dca2065c0073698afdfcda4c8a8f08bf0d9 | dc079cfdffa1141a6caf5d41a33d73a1ef03da55 | 2025-03-16T18:46:36+01:00 | Sigbjørn Skjæret | | llama : fix OLMo-2-0325-32B-Instruct K-norm size (#12400) |
| 1120 | dc079cfdffa1141a6caf5d41a33d73a1ef03da55 | 7b61bcc87cfdeab88350e82df1c4b7be64331ea6 | 2025-03-16T19:29:36+02:00 | Georgi Gerganov | | context : fix init of n_outputs (#12397) |
| 1121 | 7b61bcc87cfdeab88350e82df1c4b7be64331ea6 | f4c3dd5daa3a79f713813cf1aabdc5886071061d | 2025-03-16T18:22:05+01:00 | Daniel Bevenius | | ci : add --symlinks to xcframework zip command (#12409) |
| 1122 | f4c3dd5daa3a79f713813cf1aabdc5886071061d | 3d35d87b4113648e224b837bb88e6b2c4c7f29e5 | 2025-03-15T17:23:11+01:00 | marcoStocchi | | llama-tts : add '-o' option (#12398) |
| 1123 | 9f2250ba722738ec0e6ab684636268a79160c854 | 774973b8f3d5e375b0b74d58638eeb1817e950a8 | 2025-03-14T16:41:20Z | Eric Curtin | | Add CLI arg to llama-run to adjust the number of threads used (#12370) |
| 1124 | 84d547554123a62e9ac77107cb20e4f6cc503af4 | be7c3034108473beda214fd1d7c98fd6a7a3bdf5 | 2025-03-13T19:08:07+02:00 | Georgi Gerganov | | llama : fix Gemma3 SWA KV cache shift (#12373) |
| 1125 | e0dbec0bc6cd4b6230cda7a6ed1e9dac08d1600b | 2048b5913d51beab82dfe29955f9008130b936c0 | 2025-03-13T12:35:44+02:00 | Georgi Gerganov | | llama : refactor llama_context, llama_kv_cache, llm_build_context (#12181) |
| 1126 | 2048b5913d51beab82dfe29955f9008130b936c0 | f08f4b3187b691bb08a8884ed39ebaa94e956707 | 2025-03-13T06:10:05-04:00 | Ishaan Gandhi | | server : fix crash when using verbose output with input tokens that are not in printable range (#12178) (#12338) |
| 1127 | 80a02aa8588ef167d616f76f1781b104c245ace0 | 363f8c5d67dcf80e00c39580dfa86dc2774d74c2 | 2025-03-12T13:45:32+01:00 | Daniel Bevenius | | llama.swiftui : fix xcframework dir in README [no ci] (#12353) |
| 1128 | 34c961b181836a4f06ab4c56d5ce61ce03fc478b | 7841fc723e059d1fd9640e5c0ef19050fcc7c698 | 2025-03-12T10:14:11+01:00 | uvos | | CUDA/HIP: Fix fattn-vec-* when device warp size is not 32 (#12315) |
| 1129 | 7841fc723e059d1fd9640e5c0ef19050fcc7c698 | bf69cfe62f9ccc01112c0232a55820b95a8c1fda | 2025-03-12T09:30:24+01:00 | Xuan-Son Nguyen | | llama : Add Gemma 3 support (+ experimental vision capability) (#12343) |
| 1130 | bf69cfe62f9ccc01112c0232a55820b95a8c1fda | 10f2e81809bbb69ecfe64fc8b4686285f84b0c07 | 2025-03-12T00:59:19-05:00 | Jeff Bolz | | vulkan: fix bug in coopmat1 mul_mat_id (#12316) |
| 1131 | ba7654380a3c7c1b5ae154bea19134a3a9417a1e | 6ab2e4765a673abcd162258a2671560a76106d69 | 2025-03-11T21:25:17+08:00 | jklincn | | ggml-backend : fix backend search path (#12330) |
| 1132 | 96e1280839561aaabb73851f94972a2cd37b2d96 | 2c9f833d17bb5b8ea89dec663b072b5420fc5438 | 2025-03-11T09:20:16+01:00 | Xuan-Son Nguyen | | clip : bring back GPU support (#12322) |
| 1133 | 8acdacb3ea00697477eb019efbb6fc183371055c | 89b2b56e8658800375a8314200870b1ad4208a0b | 2025-03-10T18:57:00+02:00 | Henry Linjamäki | | opencl: use OpenCL C standard supported by the device (#12221) |
| 1134 | e128a1bf5b65741b485dd094a4201264d0580d68 | 6ef79a67caf1159b0150b44ee80888c7ec98b83f | 2025-03-10T14:07:15+02:00 | Georgi Gerganov | | tests : fix test-quantize-fns to init the CPU backend (#12306) |
| 1135 | 6ef79a67caf1159b0150b44ee80888c7ec98b83f | 4e39a3c332f84b890e91353ec448502cb8373a6f | 2025-03-10T12:34:13+01:00 | marcoStocchi | | common : refactor '-o' option (#12278) |
| 1136 | 2b3a25c212f8c4d8a49cec23e03343a7719d51c9 | 8352cdc87b207a735d34c431a36c425728cb4586 | 2025-03-10T09:44:42Z | Olivier Chafik | | `sampler`: fixes trigger tokens + lazy grammars (fix typo cast from token to string) (#12291) |
| 1137 | 8352cdc87b207a735d34c431a36c425728cb4586 | 1e2f78a00450593e2dfa458796fcdd9987300dfc | 2025-03-10T16:33:24+08:00 | tc-mb | | llava : fix bug in minicpm-v code (#11513) |
| 1138 | 7c7f3b7f435f41f2508e0e3010f0013cd8335156 | 102ac1891db32c346a7b6b96145a2a23c1e4c352 | 2025-03-07T14:15:27+01:00 | Daniel Bevenius | | ggml : skip intermediate .air file when compiling .metallib (#12247) |
| 1139 | ea002810a209246d034d1b6ddac387f778751588 | 8fad3c7a7c54a25a1ca38dfb08244df55288e675 | 2025-03-07T12:19:31+02:00 | Georgi Gerganov | | ci : fix save-load test invocations (#12245) |
| 1140 | 8fad3c7a7c54a25a1ca38dfb08244df55288e675 | 7cf64f6beecf54c6ac71503181f154667fd4228a | 2025-03-07T11:15:33+01:00 | Sigbjørn Skjæret | | server : Log original chat template parsing error (#12233) |
| 1141 | 5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 | f1648e91cf6c52e9593810aa70857e412d474c09 | 2025-03-07T15:35:57+08:00 | BB-fat | | metal : simplify kernel arguments using a struct (#3229) (#12194) |
| 1142 | f1648e91cf6c52e9593810aa70857e412d474c09 | d6c95b0740510231b3797b80d6d3440d8fe188b6 | 2025-03-07T15:06:08+08:00 | David Huang | | HIP: fix rocWMMA build flags under Windows (#12230) |
| 1143 | d6c95b0740510231b3797b80d6d3440d8fe188b6 | d76a86d967ef491d530400b08bc8ef8a14807936 | 2025-03-07T06:23:16+01:00 | Daniel Bevenius | | metal : fix default.metallib build (#12224) |
| 1144 | 776f9e59cc8a85e840d1d4af8540d199c77190ac | 3d652bfddfba09022525067e672c3c145c074649 | 2025-03-07T06:58:25+08:00 | xiaofei | | cmake : fix undefined reference errors for std::filesystem in ggml (#12092) (#12094) |
| 1145 | 5220a16d18563d3ffc509002f0514415fdda4036 | 3ffbbd5ce130859be91909e9b77d4c1962a6be2c | 2025-03-06T18:45:09+01:00 | Johannes Gäßler | | CUDA: fix FA logic for PTX 7.0 and CC >= 7.5 (#12222) |
| 1146 | 57b6abf85acb1f697913a44e5e105e333d894b78 | 94bb63e4f0f6135579b88e5700ed40cefa374e09 | 2025-03-05T22:22:49-08:00 | Han Yin | | android : fix KV cache log message condition (#12212) |
| 1147 | 94bb63e4f0f6135579b88e5700ed40cefa374e09 | f79243992cd31e4e4844d5158d2f3325b1d2d811 | 2025-03-06T03:33:40+02:00 | Henry Linjamäki | | opencl : fix buffer alignment (#12197) |
| 1148 | f79243992cd31e4e4844d5158d2f3325b1d2d811 | ed4ce0dda24986c80d58e2ce112049af00f632f4 | 2025-03-06T03:31:14+02:00 | Henry Linjamäki | | opencl : fix `ulong` kernel args were set from `int` variables (#12174) |
| 1149 | ed4ce0dda24986c80d58e2ce112049af00f632f4 | 07d15723470a0a5b15d8ccad1aff5b20354ffbe1 | 2025-03-06T09:30:05+08:00 | simon886212 | | opencl : fix profile-related errors (#12095) |
| 1150 | 16e4b22c5e58ee200ede913fd7b7b8ba92132ce8 | 074c4fd39df3af974e10fbee6cc6db5d9304655b | 2025-03-05T17:16:01+02:00 | Plamen Minev | | ggml : fix GGMLMetalClass ODR (#12200) |
| 1151 | 074c4fd39df3af974e10fbee6cc6db5d9304655b | 669912d9a5bf927312c553332ff997f0a99da8fb | 2025-03-05T14:16:40+01:00 | Daniel Bevenius | | ci : add fetch-depth to xcframework upload (#12195) |
| 1152 | 669912d9a5bf927312c553332ff997f0a99da8fb | fa31c438e0e709242ab7334d26fc3be3dcda07a0 | 2025-03-05T13:05:13Z | Olivier Chafik | | `tool-call`: fix Qwen 2.5 Coder support, add micro benchmarks, support trigger patterns for lazy grammars (#12034) |
| 1153 | fa31c438e0e709242ab7334d26fc3be3dcda07a0 | 3ccbfe5a71c74ac574b00607067d0aa0a49df04c | 2025-03-05T10:22:29+01:00 | Daniel Bevenius | | ci : fix xcframework artifact tag (#12191) |
| 1154 | 3ccbfe5a71c74ac574b00607067d0aa0a49df04c | 06a92a193a07afe445929607be9d5e4d033956fb | 2025-03-05T08:34:02+01:00 | Daniel Bevenius | | ci : remove xframework upload (#12190) |
| 1155 | 06a92a193a07afe445929607be9d5e4d033956fb | a057897ad4e48e3df0354256e0cc80dadcb57595 | 2025-03-05T15:25:45+08:00 | Clauszy | | server : fix cache reuse logic (#12161) |
| 1156 | a057897ad4e48e3df0354256e0cc80dadcb57595 | 5bbe6a9fe9a8796a9389c85accec89dbc4d91e39 | 2025-03-05T06:30:31+01:00 | Daniel Bevenius | | llama : add xcframework build script (#11996) |
| 1157 | 5bbe6a9fe9a8796a9389c85accec89dbc4d91e39 | 20a9b8f5e1380243ed03aeb50ae1bf94b8d68501 | 2025-03-04T17:53:26+01:00 | mgroeber9110 | | ggml : portability fixes for VS 2017 (#12150) |
| 1158 | 20a9b8f5e1380243ed03aeb50ae1bf94b8d68501 | 56d7a9f81274717fe035db192f315a049261c7fa | 2025-03-04T18:42:44+02:00 | Georgi Gerganov | | readme : fix roadmap link (#12185) |
| 1159 | 56d7a9f81274717fe035db192f315a049261c7fa | 1a24c4621f0280306b0d53a4fa474fc65d3f1b2e | 2025-03-04T17:19:39+01:00 | Sigbjørn Skjæret | | main: allow preloading conversation with -p and add -st / --single-turn (#12145) |
| 1160 | 1a24c4621f0280306b0d53a4fa474fc65d3f1b2e | becade5de77674696539163dfbaf5c041a1a8e97 | 2025-03-04T06:24:07Z | Olivier Chafik | | `server`: fix deadly typo in response_format.json_schema.schema handling (#12168) |
| 1161 | 87abb7e903635a2660e89f9336122f374d683e0a | 6d4c23b81b03c7b089a5f7a21ca73d1385d37191 | 2025-02-28T12:34:39+05:30 | cmdr2 | | cuda/cpu: Increase support for fp16 unary operations (ggml/1125) |
| 1162 | 6d4c23b81b03c7b089a5f7a21ca73d1385d37191 | 6512a9003741bd3fe2e11bf3bb3608ec497d368d | 2025-02-27T13:35:07+01:00 | Diego Devesa | | whisper : support GGML_BACKEND_DL (whisper/2843) |
| 1163 | 6512a9003741bd3fe2e11bf3bb3608ec497d368d | 4512055792cff7ea107f2d2231f79aa1af073c62 | 2025-02-05T04:41:10-08:00 | midnight | | cmake : fix compile assumptions for power9/etc (whisper/2777) |
| 1164 | aede2074f608d7bf6614cdd047bce687a2b3d908 | 2679c3b55d1c9c3fed56dea00fea713622e42594 | 2025-02-28T09:09:38+02:00 | Georgi Gerganov | | scripts : sync-ggml-am.sh fix |
| 1165 | 2679c3b55d1c9c3fed56dea00fea713622e42594 | c43af9276b119dae7436b7878d59671d0f6b1a97 | 2025-03-03T16:17:36+01:00 | Daniel Bevenius | | ci : set GITHUB_ACTION env var for server tests (#12162) |
| 1166 | c43af9276b119dae7436b7878d59671d0f6b1a97 | d5c63cd7f932663a20a860ef11a238e627abac53 | 2025-03-03T21:09:29+08:00 | dm4 | | tts: add speaker file support (#12048) |
| 1167 | 9660ffef582ca275092b621c87085a6eea136a90 | c950a1f69269bff416d74349a82d78181ce6f0f8 | 2025-03-03T20:54:08+08:00 | ag2s20150909 | | ggml : fix kleidiai build (#12159) |
| 1168 | 7b69003af74924ac04d97313c2e57c45ba56b616 | ece9745bb8079b9f4af45df29b67ad0c6e50584d | 2025-03-03T11:42:45+01:00 | Xuan-Son Nguyen | | webui : add ?m=... and ?q=... params (#12148) |
| 1169 | ece9745bb8079b9f4af45df29b67ad0c6e50584d | cc473cac7cea1484c1f870231073b0bf0352c6f9 | 2025-03-03T15:37:22+05:30 | Akarshan Biswas | | SYCL: Move CPY kernels to a separate file and add few missing kernels (#12133) |
| 1170 | 14dec0c2f29ae56917907dbf2eed6b19438d0a0e | 1782cdfed60952f9ff333fc2ab5245f2be702453 | 2025-03-02T14:53:48+01:00 | Sigbjørn Skjæret | | main: use jinja chat template system prompt by default (#12118) |
| 1171 | 80c41ddd8f11b8094018296d9820c2b6c119ac12 | 2cc4a5e44a3a9ab94426816770d611b33fae8f77 | 2025-03-01T12:57:22+01:00 | Erik Scholz | | CUDA: compress mode option and default to size (#12029) |
| 1172 | 2cc4a5e44a3a9ab94426816770d611b33fae8f77 | 06c2b1561d8b882bc018554591f8c35eb04ad30e | 2025-03-01T15:45:09+05:30 | Vivian | | webui : minor typo fixes (#12116) |
| 1173 | 06c2b1561d8b882bc018554591f8c35eb04ad30e | 70680c48e5f77d2d3138712a6582bd8c1e548922 | 2025-02-28T17:44:46+01:00 | Xuan-Son Nguyen | | convert : fix Norway problem when parsing YAML (#12114) |
| 1174 | 70680c48e5f77d2d3138712a6582bd8c1e548922 | c43a3e7996e585e2addde1e44057a4f3cdbadef8 | 2025-02-28T05:41:47-08:00 | William Tambellini | | ggml : upgrade init_tensor API to return a ggml_status (#11854) |
| 1175 | c43a3e7996e585e2addde1e44057a4f3cdbadef8 | 84d5f4bc195b9540fcb902d869015fba7ef6baa4 | 2025-02-28T12:44:11+01:00 | Xuan-Son Nguyen | | llama : add Phi-4-mini support (supersede #12099) (#12108) |
| 1176 | 438a83926afcff3643ffef5543db67545ceffe39 | 9c42b1718ca8299f9afeabdc122badeab64c9690 | 2025-02-28T09:42:52+01:00 | Rémy O | | vulkan: add specific MMV kernels for IQ2 and IQ3 quants + optimizations (#11595) |
| 1177 | 9c42b1718ca8299f9afeabdc122badeab64c9690 | 05e6f5aad0a4bb48fb2775f2a78505540fdbc47d | 2025-02-28T09:26:43+01:00 | Johannes Gäßler | | CUDA: fix logic for V100 + GGML_CUDA_FORCE_MMQ (#12098) |
| 1178 | 673cfef9aa8daad09966208909f346eb996628a4 | fbeda9002d4b8b79a4f9288a7ff0d34ef4fb23d5 | 2025-02-28T15:23:47+08:00 | hipudding | | CANN: Fix build error with GCC 13 (#11990) |
| 1179 | b95c8af37ccf169b0a3216b7ed691af0534e5091 | a800ae46da2ed7dac236aa6bf2b595da6b6294b5 | 2025-02-27T08:42:48+01:00 | Vladimir Vuksanovic | | cmake: Fix ggml backend dependencies and installation (#11818) |
| 1180 | 69050a11be0ae3e01329f11371ecb6850bdaded5 | 3567ee3a94d57ba72b6d023ca507d11e75767edb | 2025-02-26T14:04:48+01:00 | Sigbjørn Skjæret | | Refactor gguf scripts to improve metadata handling (#11909) |
| 1181 | a82c9e7c23ef6db48cebfa194dc9cebbc4ac3552 | 401af80b546005a06854827b732e3b46979ae028 | 2025-02-25T09:30:21-06:00 | Jeff Bolz | | vulkan: fix assertion when qy_needs_dequant (#12068) |
| 1182 | 393fca629e6ec391b76edf778cb3f7a8a3bc56f9 | 61d4f39dfeaf3bbcf4e1535ac03953a5d766680b | 2025-02-25T19:28:22+08:00 | Molly Sophia | | ggml-cpu: Fix build with sve (#12059) |
| 1183 | 34a846b5847a18d133b360074f1fb485b2632b2d | 7a2c913e66353362d7f28d612fd3c9d51a831eda | 2025-02-24T13:47:07-08:00 | lhez | | opencl: fix for small models (#11950) |
| 1184 | 7a2c913e66353362d7f28d612fd3c9d51a831eda | 08d5986290cc42d2c52739e046642b8252f97e4b | 2025-02-24T09:09:51-07:00 | Alex Brooks | | llava : Add Granite Vision Support (#11794) |
| 1185 | 08d5986290cc42d2c52739e046642b8252f97e4b | 651adf4b6675339465179b81b194d98cc14704d6 | 2025-02-24T22:33:23+08:00 | Neo Zhang Jianyu | | [SYCL] Optimize mul_mat for Q4_0 on Intel GPU (#12035) |
| 1186 | 8303e8b0fb2c1e26a8edd58071f9120a5bd6930a | 7ad0779f5de84a68143b2c00ab5dc94a948925d3 | 2025-02-24T15:48:25+05:30 | Akarshan Biswas | | SYCL: Fix GGML_SYCL_DEBUG macro (#11995) |
| 1187 | 7ad0779f5de84a68143b2c00ab5dc94a948925d3 | f777a73e18c218848bca0748581c043987348a5d | 2025-02-23T18:15:51+01:00 | Florent BENOIT | | run: allow to customize prompt by env var LLAMA_PROMPT_PREFIX (#12041) |
| 1188 | f777a73e18c218848bca0748581c043987348a5d | af7747c95ae71a5db4184947f837179e82c70b77 | 2025-02-23T13:14:32Z | Eric Curtin | | Some llama-run cleanups (#11973) |
| 1189 | af7747c95ae71a5db4184947f837179e82c70b77 | a28e0d5eb18c18e6a4598286158f427269b1444e | 2025-02-23T05:39:24+08:00 | Aaron Teo | | ggml-cpu: Support s390x SIMD Instruction Set (#12019) |
| 1190 | f3e64859edb0d55d4223ead78672597cd1a218df | 5fa07c2f93c73161bf09ef0b23b5d2686f9a073e | 2025-02-22T15:03:00+02:00 | Georgi Gerganov | | ci : fix arm upload artifacts (#12024) |
| 1191 | 0b3863ff9576872855b0265da2cab2ce7e25c4d9 | ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe | 2025-02-21T15:46:23+08:00 | Bodhi | | MUSA: support ARM64 and enable dp4a .etc (#11843) |
| 1192 | ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe | c392e5094deaf2d1a7c18683214f007fad3fe42b | 2025-02-20T23:11:03-07:00 | Alex Brooks | | clip : fix visual encoders with no CLS (#11982) |
| 1193 | c392e5094deaf2d1a7c18683214f007fad3fe42b | c5d91a74006c49376590ef2b67420bc7ce206397 | 2025-02-21T03:43:22+09:00 | momonga | | server (webui): Fix Premature Submission During IME Conversion (#11971) |
| 1194 | 4806498bf15ef767de3776b00856e56c373dd1b1 | 0d559580a0a74c842c3a876035ba96a338aabfb2 | 2025-02-20T15:38:32+05:30 | Prashant Vithule | | ggml: aarch64: implement SVE kernels for q3_K_q8_K vector dot (#11917) |
| 1195 | 0d559580a0a74c842c3a876035ba96a338aabfb2 | d04e7163c85a847bc61d58c22f2c503596db7aa8 | 2025-02-20T09:35:11+01:00 | Michael Engel | | run : add --chat-template-file (#11961) |
| 1196 | d07c621393fab6cf32f3add2aa65e4d5331d4a67 | abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 | 2025-02-19T12:29:52+01:00 | Daniel Bevenius | | common : add llama.vim preset for Qwen2.5 Coder (#11945) |
| 1197 | abd4d0bc4f1a9a0e429bc8ee0d5ece2a394a0a39 | 9626d9351a6dfb665400d9fccbda876a0a96ef67 | 2025-02-19T13:29:42+02:00 | Georgi Gerganov | | speculative : update default params (#11954) |
| 1198 | 9626d9351a6dfb665400d9fccbda876a0a96ef67 | b58934c1836b5ea51dbacbe899eee125775e77c9 | 2025-02-19T06:16:23+01:00 | Daniel Bevenius | | llama : fix indentation in llama-grammar [no ci] (#11943) |
| 1199 | b58934c1836b5ea51dbacbe899eee125775e77c9 | 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d | 2025-02-19T00:01:44+02:00 | igardev | | server : (webui) Enable communication with parent html (if webui is in iframe) (#11940) |
| 1200 | 63e489c025d61c7ca5ec06c5d10f36e2b76aaa1d | 63ac12856303108ee46635e6c9e751f81415ee64 | 2025-02-18T18:03:23Z | Olivier Chafik | | tool-call: refactor common chat / tool-call api (+ tests / fixes) (#11900) |
| 1201 | 63ac12856303108ee46635e6c9e751f81415ee64 | 5137da7b8c3eaa090476a632888ca178ba109f8a | 2025-02-18T14:21:41+01:00 | Xuan-Son Nguyen | | server : add TEI API format for /rerank endpoint (#11942) |
| 1202 | 09aaf4f1f5b69b5173b7fcd24eab96729f6b242a | 73e2ed3ce3492d3ed70193dd09ae8aa44779651d | 2025-02-18T17:12:49+08:00 | xiaobing318 | | docs : Fix duplicated file extension in test command (#11935) |
| 1203 | c4d29baf3236b011730b6ccaae6852e781fb1b91 | 2eea03d86a2d132c8245468c26290ce07a27a8e8 | 2025-02-17T11:25:12+01:00 | Antoine Viallon | | server : fix divide-by-zero in metrics reporting (#11915) |
| 1204 | 2eea03d86a2d132c8245468c26290ce07a27a8e8 | 0f2bbe656473177538956d22b6842bcaa0449fab | 2025-02-17T07:55:57+01:00 | Rémy O | | vulkan: implement several ops relevant for ggml_opt (#11769) |
| 1205 | fe163d5bf3fb8e99c96ff6d21775fa3d1daee3cf | 818a340ea8be55b3706e1772527cb8738e90a8c7 | 2025-02-16T18:51:13+09:00 | standby24x7 | | common : Fix a typo in help (#11899) |
| 1206 | 818a340ea8be55b3706e1772527cb8738e90a8c7 | bf42a23d0a515a508aecf10fde1d52c5ed5104c6 | 2025-02-16T10:36:39+01:00 | Xuan-Son Nguyen | | ci : fix (again) arm64 build fails (#11895) |
| 1207 | c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad4 | 6dde1782483d6b0a1d59f5a5fbcb3119b9d34c27 | 2025-02-16T14:50:26+08:00 | Hale Chan | | metal : fix the crash caused by the lack of residency set support on Intel Macs. (#11904) |
| 1208 | 6dde1782483d6b0a1d59f5a5fbcb3119b9d34c27 | fc10c38ded84670955d4c44770f8acfb64617e15 | 2025-02-15T20:23:22+01:00 | Johannes Gäßler | | scripts: fix compare-llama-bench commit hash logic (#11891) |
| 1209 | fc10c38ded84670955d4c44770f8acfb64617e15 | 22885105a6b034abaf1c1471ad90fb2ae96146bb | 2025-02-15T20:03:30+01:00 | 708-145 | | examples: fix typo in imatrix/README.md (#11884) |
| 1210 | c2cd24fbfdfeacc2fc6ad03878379de104264114 | 68ff663a04ed92044a9937bcae353e9d9733f9cd | 2025-02-15T20:29:56+02:00 | Georgi Gerganov | | readme : add notice about new package registry (#11890) |
| 1211 | f3552296924e704c11ca936907b9cad7873db8e2 | fc1b0d0936e4dfc52a81f38e7420c7d23f6caa88 | 2025-02-15T10:11:36Z | Olivier Chafik | | server: fix type promotion typo causing crashes w/ --jinja w/o tools (#11880) |
| 1212 | 89daa2564f6eab33be53c6a1b39273af536d6bb3 | 300907b2110cc17b4337334dc397e05de2d8f5e0 | 2025-02-14T12:46:08-08:00 | Michał Moskal | | llguidance build fixes for Windows (#11664) |
| 1213 | 300907b2110cc17b4337334dc397e05de2d8f5e0 | 94b87f87b502d2ab6c8b28d2b5935cf008ca1505 | 2025-02-14T11:12:23-08:00 | lhez | | opencl: Fix rope and softmax (#11833) |
| 1214 | 94b87f87b502d2ab6c8b28d2b5935cf008ca1505 | dbc2ec59b5603fbd25f3833b2407b4f3612b9f02 | 2025-02-14T15:33:52+01:00 | Diego Devesa | | cuda : add ampere to the list of default architectures (#11870) |
| 1215 | a4f011e8d02179f032627130f961eb77ee30401c | a7b8ce226071b2b0faaad0d36cc5ebd7fb074730 | 2025-02-14T02:59:40Z | Eve | | vulkan: linux builds + small subgroup size fixes (#11767) |
| 1216 | a7b8ce226071b2b0faaad0d36cc5ebd7fb074730 | 04045bb84288dc7e9e424d4e2bf7f40d259b4c6a | 2025-02-14T09:13:43+08:00 | theraininsky | | llama-bench : fix unexpected global variable initialize sequence issue (#11832) |
| 1217 | c48f630d1c1942fce08aa7cb18a53ace443cd611 | bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 | 2025-02-13T14:46:59+01:00 | Daniel Bevenius | | llama : add --completion-bash option (#11846) |
| 1218 | c7f460ab882065ec5696e3d51e24dbf67b539287 | 27e8a23300e30cd6ff6107ce262acf832ca60597 | 2025-02-13T10:05:16Z | Olivier Chafik | | `server`: fix tool-call of DeepSeek R1 Qwen, return reasoning_content (Command 7RB & DeepSeek R1) unless `--reasoning-format none` (#11607) |
| 1219 | 27e8a23300e30cd6ff6107ce262acf832ca60597 | e4376270d971cff7992bdb6c5412a739195b1459 | 2025-02-13T00:45:57-06:00 | Vinesh Janarthanan | | sampling: add Top-nσ sampler (#11223) |
| 1220 | e4376270d971cff7992bdb6c5412a739195b1459 | 3e693197724c31d53a9b69018c2f1bd0b93ebab2 | 2025-02-13T01:25:34-05:00 | Oleksandr Kuvshynov | | llama.cpp: fix warning message (#11839) |
| 1221 | 3e693197724c31d53a9b69018c2f1bd0b93ebab2 | a394039db004c6ee00098250d160b5aa018c2314 | 2025-02-13T07:07:51+01:00 | Daniel Bevenius | | llama : update llama_decode_internal ref [no ci] (#11840) |
| 1222 | a394039db004c6ee00098250d160b5aa018c2314 | be3bbd62153820ff6d358c817360927f429105c4 | 2025-02-13T01:02:38+01:00 | Diego Devesa | | ggml-cpu : add chunking support to mul_mat_id (#11666) |
| 1223 | be3bbd62153820ff6d358c817360927f429105c4 | 31afcbee0eebbc998ab311aa314e389d60aa2127 | 2025-02-13T00:33:45+01:00 | Xuan-Son Nguyen | | ggml : x2 speed for WASM by optimizing SIMD (#11453) |
| 1224 | bfd11a2344ce6005bfbd5432a06fc7325bc0ecae | 0fb77f821f6e70ad8b8247a97d1022f0fef78991 | 2025-02-12T20:36:11Z | JC | | Fix: Compile failure due to Microsoft STL breaking change (#11836) |
| 1225 | fef0cbeadf5c8e221f832158cb4006ade39ef786 | 748ee9fe9312acb8755ee4bf46fd9de2e6a45f29 | 2025-02-12T10:06:53-04:00 | bandoti | | cleanup: fix compile warnings associated with gnu_printf (#11811) |
| 1226 | 748ee9fe9312acb8755ee4bf46fd9de2e6a45f29 | 198b1ec611a2c551ea40e5b9c0b862f37555a4cc | 2025-02-12T13:57:33Z | Richard | | ggml : fix multi-threaded clamp_f32 (#11824) |
| 1227 | 198b1ec611a2c551ea40e5b9c0b862f37555a4cc | c3d6af7cd2d79dc89da086b2d08c777d0319d829 | 2025-02-12T20:22:58+08:00 | Weizhao Ouyang | | ggml-cpu: Fix duplicate MATMUL_INT8 (#11817) |
| 1228 | c3d6af7cd2d79dc89da086b2d08c777d0319d829 | 369be5598ac5f71f6aa6d6606e9aec769a23dafa | 2025-02-12T13:16:39+01:00 | Johannes Gäßler | | CUDA: fix CUDART_VERSION checks (#11821) |
| 1229 | 369be5598ac5f71f6aa6d6606e9aec769a23dafa | 4078c77f9891831f29ffc7c315c8ec6695ba5ce7 | 2025-02-12T08:40:01+01:00 | Daniel Bevenius | | llama : fix typo in llama-grammar.h [no ci] (#11816) |
| 1230 | 90e4dba461b07e635fd1daf3b491c978c7dd0013 | a18f481f99962638092d6f1c98b1d34d3e3256de | 2025-02-11T10:55:45-05:00 | Sheldon Robinson | | Fix #11802: Compile bug - RegQueryValueExA changed to RegQueryValueEx (#11803) |
| 1231 | a18f481f99962638092d6f1c98b1d34d3e3256de | b9ab0a4d0b2ed19effec130921d05fb5c30b68c5 | 2025-02-11T14:06:45+01:00 | Daniel Bevenius | | server : use common_token_to_piece instead of common_detokenize (#11740) |
| 1232 | 7b891bdc863663b4dc1155aa9429b58c721524b2 | 81732619fd2d570712dc78db5965cee9224b38bd | 2025-02-10T23:21:31+01:00 | Maxim Evtush | | fix: typos in documentation files (#11791) |
| 1233 | 19b392d58dc08c366d0b29bd3b9c6991fa4e1662 | 0893e0114e934bdd0eba0ff69d9ef8c59343cbc3 | 2025-02-10T19:58:18+01:00 | Wilken Gottwalt | | llama-mmap: fix missing include (#11796) |
| 1234 | 9ac3457b39c78c5eb103280e08fb6163642484ff | c2a67efe38e6782c0217e1de3edc68de6951612b | 2025-02-10T16:05:57+08:00 | pascal-lc | | Update README.md [no ci] (#11781) |
| 1235 | 55ac8c7791ff44aeb82bd7fe3ca2041844fc77f1 | e6e658319952f7ad269dc11275b9edddc721fc6d | 2025-02-08T21:54:50+01:00 | Xuan-Son Nguyen | | server : (webui) revamp Settings dialog, add Pyodide interpreter (#11759) |
| 1236 | bdcf8b6a56f4d49d3420ae5b21cdf9a116040551 | 4d3465c5aeca8be29cac77f1535c35f4fb274eca | 2025-02-08T16:49:38+02:00 | Georgi Gerganov | | cont : fix mmap flag print (#11699) |
| 1237 | 4d3465c5aeca8be29cac77f1535c35f4fb274eca | d80be897acdca45f8f7ea2e52c930b1d0e738a14 | 2025-02-08T15:30:53+01:00 | Karol Kontny | | ggml: Fix data race in ggml threadpool (#11736) |
| 1238 | d80be897acdca45f8f7ea2e52c930b1d0e738a14 | 3ab410f55f26038de45d6cc569aaa5cb29acb918 | 2025-02-08T10:46:07+01:00 | Johannes Gäßler | | CUDA: fix min. version for movmatrix (#11751) |
| 1239 | 0cf867160ca9d492e06c0bc688b337cffd1eb187 | d2fe216fb2fb7ca8627618c9ea3a2e7886325780 | 2025-02-08T10:42:34+01:00 | Xuan-Son Nguyen | | server : (webui) fix numeric settings being saved as string (#11739) |
| 1240 | d2fe216fb2fb7ca8627618c9ea3a2e7886325780 | ed926d8833df3c29797edbc98dafd9b575aa0729 | 2025-02-07T14:42:46Z | Eric Curtin | | Make logging more verbose (#11714) |
| 1241 | ed926d8833df3c29797edbc98dafd9b575aa0729 | 2d219b389e8c8c40bce547b08c8aa7add60fde1f | 2025-02-07T16:05:34+02:00 | Georgi Gerganov | | llama : fix defrag logic (#11707) |
| 1242 | 2d219b389e8c8c40bce547b08c8aa7add60fde1f | 333820d7491cd31c707a340ff23b984a84e40154 | 2025-02-07T08:55:47-05:00 | Christian Fillion | | vocab : ignore invalid UTF-8 input in the BPE tokenizer (#11729) |
| 1243 | 333820d7491cd31c707a340ff23b984a84e40154 | c026ba3c23765a648ca27c7a15ecf179f8e27f26 | 2025-02-07T15:48:47+02:00 | magicse | | llama : fix progress dots (#11730) |
| 1244 | b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 | 225bbbfa39930cda38a2e5d1f3e5b38226732009 | 2025-02-07T09:15:22+01:00 | Daniel Bevenius | | common : add default embeddings presets (#11677) |
| 1245 | 225bbbfa39930cda38a2e5d1f3e5b38226732009 | 855cd0734aca26c86cc23d94aefd34f934464ac9 | 2025-02-07T15:38:31+08:00 | Jinyang He | | ggml : optimize and build warning fix for LoongArch (#11709) |
| 1246 | 855cd0734aca26c86cc23d94aefd34f934464ac9 | 8a59053f63fffc24e730cd3ea067760abfe4a919 | 2025-02-06T22:48:51+01:00 | tv1wnd | | llama : fix old glm4 models (#11670) |
| 1247 | 1d20e53c40c3cc848ba2b95f5bf7c075eeec8b19 | 2fb3c32a1634488a5265d1304ab37628eeb5480d | 2025-02-06T09:29:13-05:00 | Patrick Peng | | rpc: fix known RCE in rpc-server (ggml/1103) |
| 1248 | 2fb3c32a1634488a5265d1304ab37628eeb5480d | 9ab42dc722ad19a12af80f38a06474d498f96da3 | 2025-02-06T17:32:29+01:00 | Xuan-Son Nguyen | | server : (webui) migrate project to ReactJS with typescript (#11688) |
| 1249 | c0d4843225eed38903ea71ef302a02fa0b27f048 | 8d4d2be143a3919c3d194b9bf7a221e50abed893 | 2025-02-06T12:08:13+01:00 | Adrien Gallouët | | build : fix llama.pc (#11658) |
| 1250 | 8d4d2be143a3919c3d194b9bf7a221e50abed893 | 2c6c8df56d8a3edd657b9a295e95d469a37f0044 | 2025-02-06T17:20:00+08:00 | junchao-zhao | | ggml : fix LoongArch compile error with 128-bit SIMD (#11701) |
| 1251 | 2c6c8df56d8a3edd657b9a295e95d469a37f0044 | 8a7e3bf17aa5a8412854787746c92a28623a8925 | 2025-02-06T00:15:30-06:00 | Jeff Bolz | | vulkan: optimize coopmat2 iq2/iq3 callbacks (#11521) |
| 1252 | 1ec208083cb896dd8772a2f962151fa3d4a74e36 | 9f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa6 | 2025-02-05T14:45:40+07:00 | SAMI | | llava: add quantization for the visual projector LLAVA, Qwen2VL (#11644) |
| 1253 | db288b60cb49eab69703f995379b8d75c18bf5b3 | 106045e7bb8db481bb2ebbc60e3b53cb27ada117 | 2025-02-04T15:48:53Z | Olivier Chafik | | `tool-call`: command r7b fix for normal responses (#11608) |
| 1254 | f117d84b48104992ba16961b35a96fa93efbb355 | 534c46b53c23613628d72e93c63ea01ea4d1e2ac | 2025-02-04T19:15:24+08:00 | Jhen-Jie Hong | | swift : fix llama-vocab api usage (#11645) |
| 1255 | b34aedd558dcf67f7e96b0260d6b554877bd3499 | cde383323959544abe10a4d79e1d3e1ee479933c | 2025-02-04T09:30:42+02:00 | Georgi Gerganov | | ci : do not stale-close roadmap issues |
| 1256 | cde383323959544abe10a4d79e1d3e1ee479933c | b3451785aca16fbf4214eeba7e4612676cdf8ccb | 2025-02-03T23:49:27Z | Olivier Chafik | | `tool-call`: allow `--chat-template chatml` w/ `--jinja`, default to chatml upon parsing issue, avoid double bos (#11616) |
| 1257 | b3451785aca16fbf4214eeba7e4612676cdf8ccb | 1d1e6a90bcf485ad2dee309c31cf19bd802465e5 | 2025-02-04T00:10:52+01:00 | Xuan-Son Nguyen | | server : (webui) revert hacky solution from #11626 (#11634) |
| 1258 | 5598f475be3e31430fbe17ebb85654ec90dc201e | 8ec05832fa8409c49b3bbd13f957c6ae8486e618 | 2025-02-03T16:45:38+01:00 | Daniel Bevenius | | server : remove CPPHTTPLIB_NO_EXCEPTIONS define (#11622) |
| 1259 | 21c84b5d2dc04050714567501bf78762bfa17846 | d92cb67e37abc23b1c6f7b0ef27a9889da8537e3 | 2025-02-03T13:25:56+01:00 | Johannes Gäßler | | CUDA: fix Volta FlashAttention logic (#11615) |
| 1260 | d92cb67e37abc23b1c6f7b0ef27a9889da8537e3 | 6eecde3cc8fda44da7794042e3668de4af3c32c6 | 2025-02-03T09:42:55Z | mashdragon | | server : (webui) Fix Shift+Enter handling (#11609) |
| 1261 | 6eecde3cc8fda44da7794042e3668de4af3c32c6 | 396856b40029dd6747d2fbdb179e828683418045 | 2025-02-02T23:48:29+01:00 | Johannes Gäßler | | HIP: fix flash_attn_stream_k_fixup warning (#11604) |
| 1262 | 4d0598e1445a64c99cf2faac72f8d5d023f1e6a1 | 90f9b88afb6447d3929843a2aa98c0f11074762d | 2025-02-02T22:08:05+01:00 | uvos | | HIP: add GGML_CUDA_CC_IS_* for amd familys as increasing cc archtectures for amd gpus are not supersets of eatch other (#11601) |
| 1263 | 90f9b88afb6447d3929843a2aa98c0f11074762d | 864a0b67a6c8f648c43ce8271f9cb2e12dd5df6e | 2025-02-02T19:58:34Z | Olivier Chafik | | nit: more informative crash when grammar sampler fails (#11593) |
| 1264 | 69804487e0b10f2c5c06316f0ac0eb6ada68433f | ff227703d6d6e1888bdc7af6138514092ffcdb96 | 2025-02-02T09:10:15Z | Olivier Chafik | | Fix exotic ci env that lacks ostringstream::str (#11581) |
| 1265 | ff227703d6d6e1888bdc7af6138514092ffcdb96 | 0cec062a638700495673f5494d200b74340538be | 2025-02-01T23:55:32-08:00 | Michał Moskal | | sampling : support for llguidance grammars (#10224) |
| 1266 | 0cec062a638700495673f5494d200b74340538be | 53debe6f3c9cca87e9520a83ee8c14d88977afa4 | 2025-02-02T15:48:46+08:00 | piDack | | llama : add support for GLM-Edge and GLM-Edge-V series models (#10573) |
| 1267 | a83f528688324a21484a97af1d1be5e1bc8d4c8e | b1bcd309fc8ac929cbd4a6207b3a19886bda031f | 2025-01-31T14:15:25Z | Olivier Chafik | | `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539) |
| 1268 | b1bcd309fc8ac929cbd4a6207b3a19886bda031f | 5783575c9d99c4d9370495800663aa5397ceb0be | 2025-01-31T13:48:31Z | Olivier Chafik | | fix stop regression (#11543) |
| 1269 | 5783575c9d99c4d9370495800663aa5397ceb0be | 4a2b196d03d52da31236390e9f5694a88d43d11d | 2025-01-31T08:24:29Z | Olivier Chafik | | Fix chatml fallback for unsupported builtin templates (when --jinja not enabled) (#11533) |
| 1270 | 4a2b196d03d52da31236390e9f5694a88d43d11d | 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f | 2025-01-31T08:12:40Z | Olivier Chafik | | server : fix --jinja when there's no tools or schema (typo was forcing JSON) (#11531) |
| 1271 | 1bd3047a939e561adfb3c7dd2e17c4cc7a4e4e6f | a2df2787b32e0846205f7151dfad88ceab592beb | 2025-01-31T00:58:55-05:00 | Steve Grubb | | common: Add missing va_end (#11529) |
| 1272 | 4314e56c4f8c5091f45732f39bd94c0c6c323798 | 496e5bf46bab757d05e18227cb4e17055ae42f42 | 2025-01-30T11:05:00+01:00 | Daniel Bevenius | | server : use lambda instead of std::bind (#11507) |
| 1273 | e0449763a4f335cca374254a72892141f41eaa59 | eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc | 2025-01-30T05:48:14+01:00 | Daniel Bevenius | | server : update json snippets in README.md [no ci] (#11492) |
| 1274 | 66ee4f297cff3c7ce98b31dbc0ce909d41b9e408 | e51c47b401f8cb5f21630a05171e2529cde4d186 | 2025-01-29T18:29:39+01:00 | Rémy Oudompheng | | vulkan: implement initial support for IQ2 and IQ3 quantizations (#11360) |
| 1275 | e51c47b401f8cb5f21630a05171e2529cde4d186 | 2711d0215ff6a1ecb2202ac8c1f135bceed7057b | 2025-01-29T16:34:18+01:00 | Daniel Bevenius | | server : update auto gen files comments [no ci] (#11484) |
| 1276 | 2711d0215ff6a1ecb2202ac8c1f135bceed7057b | f0d4b29edfc633ec3ba6442482a6b43a5cd80a01 | 2025-01-29T09:26:50-06:00 | Jeff Bolz | | vulkan: Catch pipeline creation failure and print an error message (#11436) |
| 1277 | f0d4b29edfc633ec3ba6442482a6b43a5cd80a01 | 815857791d3639a4d544d0a8cf25a49b0325c08c | 2025-01-29T12:23:10+01:00 | Eric Curtin | | Parse https://ollama.com/library/ syntax (#11480) |
| 1278 | 1a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6 | d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d | 2025-01-23T11:59:08-08:00 | William Tambellini | | ggml : add option to not print stack on abort (ggml/1081) |
| 1279 | d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d | b636228c0ad0db95bf73008094c6145a05615cf6 | 2025-01-17T21:29:08+09:00 | issixx | | ggml-cpu : fix ggml_graph_compute_thread did not terminate on abort. (ggml/1065) |
| 1280 | b636228c0ad0db95bf73008094c6145a05615cf6 | 325afb370a1a7b32b5fe46a749bc840c66db9765 | 2025-01-29T09:38:54+01:00 | Daniel Bevenius | | embedding : enable --no-warmup option (#11475) |
| 1281 | 325afb370a1a7b32b5fe46a749bc840c66db9765 | 794fe23f29fb40104975c91fe19f23798f7c726e | 2025-01-29T12:07:21+08:00 | Molly Sophia | | llama: fix missing k_cache store for rwkv6qwen2 (#11445) |
| 1282 | cf8cc856d7d02165bd08593b4757e1256a62d501 | d0c08040b6c8bebeade7b8d5764df6cf901678d5 | 2025-01-28T16:03:42-07:00 | peidaqi | | server : Fixed wrong function name in llamacpp server unit test (#11473) |
| 1283 | d0c08040b6c8bebeade7b8d5764df6cf901678d5 | be5ef7963fcf14a9c77c963fdd3f7b606eacb498 | 2025-01-29T00:02:56+01:00 | Xuan-Son Nguyen | | ci : fix build CPU arm64 (#11472) |
| 1284 | cae9fb4361138b937464524eed907328731b81f6 | 7fee2889e6565830631fbe76d47ef85cf8fd946a | 2025-01-28T07:42:20-08:00 | Nikita Sarychev | | HIP: Only call rocblas_initialize on rocblas versions with the multiple instantation bug (#11080) |
| 1285 | 4bf3119d61c1de5660025fd5a611effe503e3d2b | f643120bad8ab3a753daa64aaac8288ee5800e06 | 2025-01-28T09:15:34-05:00 | someone13574 | | cmake : don't fail on `GGML_CPU=OFF` (#11457) |
| 1286 | 6e84b0ab8e10b8f6f99a32855f976ebcd35b0353 | 2b8525d5c89b124c4578a2621cbeb64354ff3d9c | 2025-01-28T15:26:58+05:30 | Akarshan Biswas | | SYCL : SOFTMAX F16 mask support and other fixes (#11261) |
| 1287 | 2b8525d5c89b124c4578a2621cbeb64354ff3d9c | a4417ddda98fd0558fb4d802253e68a933704b59 | 2025-01-28T09:32:40+01:00 | Michael Engel | | Handle missing model in CLI parameters for llama-run (#11399) |
| 1288 | a5203b4465c5c87813936bde98170e25bb09024f | df984e014714cba4c99ef894b20b51cbcef31b16 | 2025-01-27T17:42:09+04:00 | lexasub | | llama : minor fixes for up llama load model speed (#11448) |
| 1289 | acd38efee316f3a5ed2e6afcbc5814807c347053 | caf773f249aa267c78d3da5567b8ab156080ea59 | 2025-01-27T02:41:59-05:00 | Ihar Hrachyshka | | metal: Handle null returned from MTLCreateSystemDefaultDevice() (#11441) |
| 1290 | caf773f249aa267c78d3da5567b8ab156080ea59 | 178a7eb952d211b8d4232d5e50ae1b64519172a9 | 2025-01-26T22:45:32+01:00 | Xuan Son Nguyen | | docker : fix ARM build and Vulkan build (#11434) |
| 1291 | 178a7eb952d211b8d4232d5e50ae1b64519172a9 | 6f53d8a6b41e48c73b345fc6c712c3b00ea4fb93 | 2025-01-26T20:06:16+02:00 | Georgi Gerganov | | metal : use residency sets (#11427) |
| 1292 | 19f65187cbf009801288861133267ee5573ceead | 1d8ee06000ecdd274e7f0a0465d6bf26ad2b3491 | 2025-01-26T12:07:48-04:00 | bandoti | | cmake: add ggml find package (#11369) |
| 1293 | 1d8ee06000ecdd274e7f0a0465d6bf26ad2b3491 | 2cc9b8c32c78d09cd1b4df0aaa605ab2d0176243 | 2025-01-26T23:20:34+08:00 | Frank Mai | | rpc: fix register position (#11424) |
| 1294 | 4a75d19376f2f00dbae6c266eb9c4f3001872b52 | 26771a1491f3a4c3d5b99c4c267b81aca9a7dfa0 | 2025-01-25T15:29:57-06:00 | Jeff Bolz | | vulkan: compile shaders on-demand (#11406) |
| 1295 | 49b0e3cec4b67dc9f4debe3a16acd4c819f751d6 | 20a758155bc5f37290b20ea44d76ba99c4e7f2cb | 2025-01-25T16:36:44+01:00 | Xuan Son Nguyen | | server : fix cleaning up stream task (#11418) |
| 1296 | 20a758155bc5f37290b20ea44d76ba99c4e7f2cb | 00c24acb2ac49d9f8318e808b6ada2f5649f253f | 2025-01-25T15:22:29+01:00 | Diego Devesa | | docker : fix CPU ARM build (#11403) |
| 1297 | 00c24acb2ac49d9f8318e808b6ada2f5649f253f | 466ea66f338d63109540dae1df97ccfdbf4cd08f | 2025-01-25T13:36:48+02:00 | Georgi Gerganov | | ci : fix line breaks on windows builds (#11409) |
| 1298 | 466ea66f338d63109540dae1df97ccfdbf4cd08f | 5f0db9522f347b095f84c3033d6c1c1895402e25 | 2025-01-25T07:26:01+08:00 | jiahao su | | CANN: Add Ascend CANN build ci (#10217) |
| 1299 | c5d9effb49649db80a52caf5c0626de6f342f526 | 9fbadaef4f0903c64895ba9c70f02ac6e6a4b41c | 2025-01-24T21:02:43+01:00 | Johannes Gäßler | | CUDA: fix FP16 cuBLAS GEMM (#11396) |
| 1300 | 9755129c27da76d768bd7e47e206bac61b40cf18 | a07c2c8a52464646ce13040e62c1ea04459f721e | 2025-01-24T18:41:30+02:00 | Georgi Gerganov | | release : pack /lib in the packages (#11392) |
| 1301 | 8137b4bb2b5fd4cb4a752bfe69ccfd915a313d58 | 1af6945eb0d0e97525dc0ec18167abf05c28f482 | 2025-01-24T12:38:31+01:00 | Johannes Gäßler | | CPU/CUDA: fix (GQA) mul mat back, add CUDA support (#11380) |
| 1302 | 1af6945eb0d0e97525dc0ec18167abf05c28f482 | 01f37edf1a6fae76fd9e2e02109aae6995a914f0 | 2025-01-24T12:21:35+01:00 | Bernhard M. Wiedemann | | cmake : avoid -march=native when reproducible build is wanted (#11366) |
| 1303 | c07e87f38bd0c22ec6dbc852ae50aaa1c64632d4 | 564804b79b78df1469ec8646869972de5e885ec4 | 2025-01-24T09:02:38+01:00 | stduhpf | | server : (webui) put DeepSeek R1 CoT in a collapsible <details> element (#11364) |
| 1304 | 564804b79b78df1469ec8646869972de5e885ec4 | 05f63cc9ee859de07f585f7b12939345f39ada8b | 2025-01-23T14:51:24-06:00 | Jeff Bolz | | tests: fix some mul_mat test gaps (#11375) |
| 1305 | 58456616408c828a1ce6d2481940fd1c97bce3b5 | f211d1dc10332b7e89a4abd1041903fa63bfed27 | 2025-01-23T13:56:05+01:00 | Xuan Son Nguyen | | server : add more clean up when cancel_tasks is called (#11340) |
| 1306 | f211d1dc10332b7e89a4abd1041903fa63bfed27 | 955a6c2d91480954e90469517c4b91c4052c6a59 | 2025-01-23T10:38:20Z | Eric Curtin | | Treat hf.co/ prefix the same as hf:// (#11350) |
| 1307 | 955a6c2d91480954e90469517c4b91c4052c6a59 | 1971adf55e3ebbfab83771d6174d37b77c352c71 | 2025-01-23T15:14:28+08:00 | amd-dwang | | Vulkan-run-test: fix mmq_wg_denoms (#11343) |
| 1308 | 1971adf55e3ebbfab83771d6174d37b77c352c71 | 5245729e3317064959faefc5e5cbc63f4e9cfbea | 2025-01-23T01:07:50-06:00 | Jeff Bolz | | vulkan: sort shaders for more deterministic binary (#11315) |
| 1309 | 5245729e3317064959faefc5e5cbc63f4e9cfbea | 6152129d05870cb38162c422c6ba80434e021e9f | 2025-01-23T01:01:17-06:00 | Jeff Bolz | | vulkan: fix diag_mask_inf (#11323) |
| 1310 | 6152129d05870cb38162c422c6ba80434e021e9f | 16d3df7ab0bb9def78047eab4d9b15393997f495 | 2025-01-22T19:22:20+01:00 | Diego Devesa | | main : update README documentation for batch size (#11353) |
| 1311 | 12c2bdf2de34f747d13b270fc9d3b52490bf194f | c64d2becb13f2a7c0145b516a05f028d949a046b | 2025-01-22T17:44:40+01:00 | Diego Devesa | | server : fix draft context not being released (#11354) |
| 1312 | 3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b | 6171c9d25820ccf676b243c172868819d882848f | 2025-01-22T15:35:48+08:00 | tc-mb | | llava : support Minicpm-omni (#11289) |
| 1313 | 6171c9d25820ccf676b243c172868819d882848f | e28245f35f2faaf249dd352998b3693a8cc28c51 | 2025-01-21T13:18:51Z | Olivier Chafik | | Add Jinja template support (#11016) |
| 1314 | e28245f35f2faaf249dd352998b3693a8cc28c51 | 6da5bec81c34f3b8a8f1b367cf23ad016e83d332 | 2025-01-21T14:07:12+01:00 | Xuan Son Nguyen | | export-lora : fix tok_embd tensor (#11330) |
| 1315 | 2139667ec419cdd953987f4df2ace9da87bbda28 | 80d0d6b4b7abca342fc990399e78af8d213eabaf | 2025-01-21T08:48:13+02:00 | Georgi Gerganov | | metal : fix out-of-bounds write (#11314) |
| 1316 | 80d0d6b4b7abca342fc990399e78af8d213eabaf | aea8ddd5165d525a449e2fc3839db77a71f4a318 | 2025-01-20T22:29:43+02:00 | Georgi Gerganov | | common : add -hfd option for the draft model (#11318) |
| 1317 | aea8ddd5165d525a449e2fc3839db77a71f4a318 | 9f7add1cde670ff744b791f5ed6649e86a0c586c | 2025-01-20T10:38:32-06:00 | Jeff Bolz | | vulkan: fix coopmat2 validation failures (#11284) |
| 1318 | 9f7add1cde670ff744b791f5ed6649e86a0c586c | 90d987b105db6016cb395f673b4d21e02129721e | 2025-01-20T16:36:08+02:00 | Georgi Gerganov | | examples : fix add_special conditions (#11311) |
| 1319 | a4251edd6fc16d168f517a7e4b0936212b296603 | ec7f3ac9ab33e46b136eb5ab6a76c4d81f57c7f1 | 2025-01-20T15:02:15+01:00 | Michael Podvitskiy | | cmake: fix shell command quoting in build-info script (#11309) |
| 1320 | ef6dada60ca710f4edfbb6fd9e1258685d8ea49d | ae3c1db2f9c4beec0737c6a82d1f3791fd6fcdb2 | 2025-01-20T09:29:32+02:00 | Georgi Gerganov | | cont : fix whitespaces (#11305) |
| 1321 | 92bc493917d43b83e592349e138b54c90b1c3ea7 | b9daaffe02d6a77d85f0420bce5dfe0e00daeff6 | 2025-01-19T20:22:30+02:00 | Georgi Gerganov | | tests : increase timeout when sanitizers are enabled (#11300) |
| 1322 | b9daaffe02d6a77d85f0420bce5dfe0e00daeff6 | 99487b57d47e14dc342b7b89d238ca11c0345241 | 2025-01-19T18:12:09+02:00 | Georgi Gerganov | | simple-chat : fix BOS being added to each message (#11278) |
| 1323 | 4dd34ff83165a483ebff7bd43621b28490fa1fd6 | f30f099228f774209aa3010b78dfbe5d262e69aa | 2025-01-18T16:18:15+02:00 | Georgi Gerganov | | cmake : add sanitizer flags for llama.cpp (#11279) |
| 1324 | f30f099228f774209aa3010b78dfbe5d262e69aa | f26c87417999209e7f4576b4f3ecf7a5b9c66a29 | 2025-01-18T14:12:05+01:00 | Xuan Son Nguyen | | server : implement cancellable request (#11285) |
| 1325 | 6390a998bfc63241fde8509022b0768a71bf20bb | 44e18ef93995f3040660750b527e5becf85899d0 | 2025-01-18T18:20:57+08:00 | LostRuins Concedo | | tts : add guide tokens support (#11186) |
| 1326 | 44e18ef93995f3040660750b527e5becf85899d0 | 3edfa7d3753c29e44b964c0ff424d2ea8d5fdee6 | 2025-01-18T02:26:50-06:00 | Jeff Bolz | | vulkan: fix coopmat2 flash attention for non-contiguous inputs (#11281) |
| 1327 | a133566d34a1dd3693c504786963bf1b7b7d8c0e | 960ec65273a9554ff2510ba285a970289256ebfb | 2025-01-17T09:28:00+02:00 | Georgi Gerganov | | vocab : fix double-eos check (#11273) |
| 1328 | 960ec65273a9554ff2510ba285a970289256ebfb | 7a689c415e2aecea1a5ae438542afeaf69815d52 | 2025-01-17T02:12:01-05:00 | David Renshaw | | llama : fix deprecation message: vocabable -> vocab (#11269) |
| 1329 | 4dbc8b9cb71876e005724f4e8f73a3544646bcf5 | 9c8dcefe171ba70ed14f2a64d1433da12d0dd1c1 | 2025-01-17T02:10:38+08:00 | RunningLeon | | llama : add internlm3 support (#11233) |
| 1330 | c67cc9837d48ea7f612b5666b90d189e63dfd7d3 | adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 | 2025-01-16T18:11:49+09:00 | fj-y-saito | | ggml: aarch64: implement SVE kernels for q4_K_q8_K vector dot (#11227) |
| 1331 | adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 | f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 | 2025-01-15T19:50:13Z | Eve | | vulkan: scale caching for k quants + misc fixes (#11081) |
| 1332 | f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 | 1d8504338ea27c7331998c11afdbd47ce5a9daac | 2025-01-15T18:28:35+02:00 | Georgi Gerganov | | ci : use -no-cnv in gguf-split tests (#11254) |
| 1333 | 1d8504338ea27c7331998c11afdbd47ce5a9daac | 432df2d5f901a8ac93d1befad916144a0478bd9e | 2025-01-15T22:17:42+09:00 | Junil Kim | | fix: ggml: fix vulkan-shaders-gen build (#10448) |
| 1334 | 432df2d5f901a8ac93d1befad916144a0478bd9e | 0ccd7f3eb2debe477ffe3c44d5353cc388c9418d | 2025-01-15T12:51:37+01:00 | Johannes Gäßler | | RoPE: fix back, CUDA support for back + noncont. (#11240) |
| 1335 | 0ccd7f3eb2debe477ffe3c44d5353cc388c9418d | f446c2cf6a56a750b67c967505e717a996d2f2fd | 2025-01-15T05:44:38+01:00 | Daniel Bevenius | | examples : add embd_to_audio to tts-outetts.py [no ci] (#11235) |
| 1336 | 504af20ee4eae72080a56d59d744f6774f7901ce | 84a44815f704aaed8e8edec7a39e846a975c7ba9 | 2025-01-13T22:53:31+03:30 | ebraminio | | server : (UI) Improve messages bubble shape in RTL (#11220) |
| 1337 | 39509fb082895d1eae2486f8ad2cbf0e905346c4 | a29f0870d4846f52eda14ae28cea612ab66d903c | 2025-01-13T16:45:53+01:00 | Andreas Kieslinger | | cuda : CUDA Graph Compute Function Refactor (precursor for performance improvements) (#11042) |
| 1338 | 00b4c3da6202e855087a4986bf19bb41b959e333 | 7426a26b2492fc546a4db6991e871ee605714093 | 2025-01-13T13:56:23+01:00 | Xuan Son Nguyen | | common : support tag-based --hf-repo like on ollama (#11195) |
| 1339 | 7426a26b2492fc546a4db6991e871ee605714093 | 8f70fc3d1b1d3c17b61842330dd106d391cc1227 | 2025-01-13T14:46:36+02:00 | Georgi Gerganov | | contrib : add naming guidelines (#11177) |
| 1340 | 8f70fc3d1b1d3c17b61842330dd106d391cc1227 | 1244cdcf14900dd199907b13f25d9c91a507f578 | 2025-01-13T13:38:20+01:00 | Daniel Bevenius | | llama : remove 'd' from bad special token log (#11212) |
| 1341 | 1244cdcf14900dd199907b13f25d9c91a507f578 | 924518e2e5726e81f3aeb2518fb85963a500e93a | 2025-01-13T13:31:41+02:00 | Radoslav Gerganov | | ggml : do not define GGML_USE_CUDA when building with GGML_BACKEND_DL (#11211) |
| 1342 | 9a483999a6fda350772aaf7bc541f1cb246f8a29 | 08f10f69c38288e9e8bb1f933af63a3fc9013d40 | 2025-01-12T13:45:14+01:00 | Xuan Son Nguyen | | llama : fix chat template gguf key (#11201) |
| 1343 | afa8a9ec9b520137bbd1ca6838cda93ee39baf20 | c05e8c9934f94fde49bc1bc9dc51eed282605150 | 2025-01-12T11:32:42+02:00 | Georgi Gerganov | | llama : add `llama_vocab`, functions -> methods, naming (#11110) |
| 1344 | c05e8c9934f94fde49bc1bc9dc51eed282605150 | 2739a71e4b88474833b64aa974ca4515574fd3c4 | 2025-01-11T03:42:31-06:00 | Vinesh Janarthanan | | gguf-py: fixed local detection of gguf package (#11180) |
| 1345 | 2739a71e4b88474833b64aa974ca4515574fd3c4 | ba8a1f9c5b675459c55a83e3f97f10df3a66c788 | 2025-01-11T05:50:33+01:00 | Daniel Bevenius | | convert : sort print supported models [no ci] (#11179) |
| 1346 | ba8a1f9c5b675459c55a83e3f97f10df3a66c788 | ff3fcabc727b2dd0c477d23a258217b27cc639fb | 2025-01-10T13:16:16+01:00 | Daniel Bevenius | | examples : add README.md to tts example [no ci] (#11155) |
| 1347 | ff3fcabc727b2dd0c477d23a258217b27cc639fb | c3f9d25706ac84297067aeaa662c1f1af42ed443 | 2025-01-10T11:30:53+01:00 | Daniel Bevenius | | convert : add --print-supported-models option (#11172) |
| 1348 | c3f9d25706ac84297067aeaa662c1f1af42ed443 | ee7136c6d1e0ba7633294dad137b1573048031ec | 2025-01-10T06:39:33+01:00 | 0cc4m | | Vulkan: Fix float16 use on devices without float16 support + fix subgroup_size_control validation error (#11161) |
| 1349 | ee7136c6d1e0ba7633294dad137b1573048031ec | c6860cc7346c90219475e4467bb8a288e0df975c | 2025-01-10T09:58:08+08:00 | Molly Sophia | | llama: add support for QRWKV6 model architecture (#11001) |
| 1350 | c6860cc7346c90219475e4467bb8a288e0df975c | 1204f9727005974587d6fc1dcd4d4f0ead87c856 | 2025-01-10T05:43:03+05:30 | Akarshan Biswas | | SYCL: Refactor ggml_sycl_compute_forward (#11121) |
| 1351 | 8eceb888d7b7f5e93d20a4f85ca6511022b87040 | f8feb4b01af374ad2fce302fd5790529c615710b | 2025-01-09T11:28:29+01:00 | Daniel Bevenius | | server : add tooltips to settings and themes btn (#11154) |
| 1352 | 8d59d911711b8f1ba9ec57c4b192ccd2628af033 | 8a1d9c25fafbaf4182dd0b785dd6303ee40d55bc | 2025-01-09T04:03:28+08:00 | hydai | | fix: add missing msg in static_assert (#11143) |
| 1353 | 8a1d9c25fafbaf4182dd0b785dd6303ee40d55bc | 1bf839b1e8b9d043306c65eddd9021fe4337733e | 2025-01-08T12:54:58-06:00 | Vinesh Janarthanan | | gguf-py : move scripts directory (#11116) |
| 1354 | 1bf839b1e8b9d043306c65eddd9021fe4337733e | f7cd13301c2a88f97073fd119072b4cc92c08df1 | 2025-01-08T18:47:05Z | Eric Curtin | | Enhance user input handling for llama-run (#11138) |
| 1355 | 80ccf5d725571035b454659e3c1b4b2b07b65e71 | a3c1232c3f475f0a77b9cc5225516ac31c567a06 | 2025-01-08T12:07:20+01:00 | Xuan Son Nguyen | | ci : pin dependency to specific version (#11137) |
| 1356 | 8cef75c743ba13ebbd6d380c531200c768a8b8aa | 0d52a69e4bf0d6181beec7853307bdcdeec9905b | 2025-01-08T16:24:19+05:30 | amritahs-ibm | | llamafile : ppc64le MMA INT8 implementation (#10912) |
| 1357 | 0d52a69e4bf0d6181beec7853307bdcdeec9905b | 02f04301417e7fb44fa1025bc1b0aef866e2ca89 | 2025-01-08T11:29:34+02:00 | Georgi Gerganov | | ci : fix cmake option (#11125) |
| 1358 | bec2183f2c8d37cf1278c11d1adb9311e9eaa242 | 53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f | 2025-01-08T16:17:29+08:00 | ag2s20150909 | | fix: Vulkan shader gen binary path when Cross-compiling (#11096) |
| 1359 | 53ff6b9b9fb25ed0ec0a213e05534fe7c3d0040f | 017cc5f446863316d05522a87f25ec48713a9492 | 2025-01-07T18:01:58+01:00 | Johannes Gäßler | | GGUF: C++ refactor, backend support, misc fixes (#11030) |
| 1360 | 017cc5f446863316d05522a87f25ec48713a9492 | a3d50bc022bedd6c7754c24749a1fef4d2d60c7c | 2025-01-07T16:11:57+01:00 | Diego Devesa | | ggml-backend : only offload from host buffers (fix) (#11124) |
| 1361 | a4dd490069a66ae56b42127048f06757fc4de4f7 | c0d6f790d07aa78be15584ec394ac20739ade93b | 2025-01-07T08:37:02+02:00 | Radoslav Gerganov | | rpc : code cleanup (#11107) |
| 1362 | c0d6f790d07aa78be15584ec394ac20739ade93b | dc7cef9f373f2a24b851f0df7a618c5209e593fa | 2025-01-07T11:56:07+05:30 | Akarshan Biswas | | SYCL: Use get_multi_ptr instead of deprecated get_pointer in wkv6 (#11087) |
| 1363 | dc7cef9f373f2a24b851f0df7a618c5209e593fa | ecebbd292d741ac084cf248146b2cfb17002aa1d | 2025-01-06T22:45:28Z | Eric Curtin | | llama-run : fix context size (#11094) |
| 1364 | 96be8c32649378a23031630a48c440f3a5d0839b | e6e7c75d94adf4d39e846d30807c531ff22865e7 | 2025-01-06T16:34:49+01:00 | Xuan Son Nguyen | | github : add cmd line field to bug report (#11090) |
| 1365 | e6e7c75d94adf4d39e846d30807c531ff22865e7 | 09186fabbe05236f2b9446ba6c643cb737540d10 | 2025-01-06T15:36:08+02:00 | Georgi Gerganov | | server : fix extra BOS in infill endpoint (#11106) |
| 1366 | 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 | 3e6e7a6bc2c4b980a0cf0fcb5cb3b79a965b5f14 | 2025-01-06T10:55:18+02:00 | Georgi Gerganov | | llama : update llama_model API names (#11063) |
| 1367 | ae2f606bb598b287f5fb69c9fdfc98b86598c6cc | 727368c60f2ebf2d6a7473a4a9f80957ab063a8e | 2025-01-06T10:52:38+02:00 | Georgi Gerganov | | mmap : fix fileno macro clash (#11076) |
| 1368 | 727368c60f2ebf2d6a7473a4a9f80957ab063a8e | 5047dd3546951dea3d65c02257d06c46c8662338 | 2025-01-06T10:52:15+02:00 | Georgi Gerganov | | llama : use LLAMA_TOKEN_NULL (#11062) |
| 1369 | 5047dd3546951dea3d65c02257d06c46c8662338 | 46e3556e01b824e52395fb050b29804b6cff2a7c | 2025-01-06T10:52:01+02:00 | Georgi Gerganov | | llama : use _impl suffix instead of _internal (#11060) |
| 1370 | f922a9c542ee117550a168395c63ea79261f5c99 | 46be942214e295cd34660bbbd6b846155d1c36a0 | 2025-01-04T16:10:30Z | matt23654 | | [GGML][RPC] Support for models with non-512-aligned tensors over RPC. (#11047) |
| 1371 | db68c93b57bfdf6da1fbdae81080382d6998cbc9 | c31fc8b966817b2f0b277fd28e04a189e388972a | 2024-12-19T03:50:12+01:00 | Daniel Bevenius | | ggml : improve inputs log sched_print_assignments (ggml/1053) |
| 1372 | c31fc8b966817b2f0b277fd28e04a189e388972a | 4b0c638b9a68f577cb2066b638c9f622d91ee661 | 2025-01-04T10:17:31+02:00 | Gilad S. | | fix: Vulkan shader gen binary path (#11037) |
| 1373 | f66f5829276650cd83a087ab2cfed1a760183ea1 | 2f0ee84b9b02d2a98742308026f060ebdc2423f1 | 2025-01-03T10:18:53+02:00 | Georgi Gerganov | | llama : refactor `src/llama.cpp` (#10902) |
| 1374 | 2f0ee84b9b02d2a98742308026f060ebdc2423f1 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | 2025-01-02T18:06:12+01:00 | Pierrick Hymbert | | server: bench: minor fixes (#10765) |
| 1375 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | a45433ba209ee0b33d02c7dc4c31f29894ad83a6 | 2025-01-02T15:05:18+01:00 | Xuan Son Nguyen | | server : allow using LoRA adapters per-request (#10994) |
| 1376 | 0827b2c1da299805288abbd556d869318f2b121e | 45095a61bfd164e87563a0dc0fbd7b0e9891590b | 2024-12-31T19:53:33+05:30 | Srihari-mcw | | ggml : fixes for AVXVNNI instruction set with MSVC and Clang (#11027) |
| 1377 | 45095a61bfd164e87563a0dc0fbd7b0e9891590b | 5896c65232c7dc87d78426956b16f63fbf58dcf6 | 2024-12-31T15:22:01+01:00 | Xuan Son Nguyen | | server : clean up built-in template detection (#11026) |
| 1378 | bc7b1f86324279a3dabb705c04ad754a2b27df16 | 6e1531aca5ed17f078973b4700fcdadbda4a34a5 | 2024-12-31T19:04:48+08:00 | ymcki | | convert : fix Llama-3_1-Nemotron-51B rope settings (#11008) |
| 1379 | 6e1531aca5ed17f078973b4700fcdadbda4a34a5 | 716bd6dec3e044e5c325386b5b0483392b24cefe | 2024-12-31T11:46:06+11:00 | Peter | | common, examples, ggml : fix MSYS2 GCC compiler errors and warnings when building with LLAMA_CURL=ON and GGML_OPENCL=ON (#11013) |
| 1380 | c250ecb3157f3bae0a45f44c3c953b5414d4c2f7 | a813badbbdf0d38705f249df7a0c99af5cdee678 | 2024-12-30T20:35:13+08:00 | ag2s20150909 | | android : fix llama_batch free (#11014) |
| 1381 | a813badbbdf0d38705f249df7a0c99af5cdee678 | fdd21889123bec62b1db3b2fc22b5a4abab32174 | 2024-12-29T03:16:34-06:00 | Jeff Bolz | | vulkan: im2col and matmul optimizations for stable diffusion (#10942) |
| 1382 | 16cdce7b68218959e0658e2f95b4572573d5008e | d79d8f39b4da6deca4aea8bf130c6034c482b320 | 2024-12-28T15:08:54Z | Alexey Parfenov | | server : fix token duplication when streaming with stop strings (#10997) |
| 1383 | d79d8f39b4da6deca4aea8bf130c6034c482b320 | d283d02bf254a7f2991e1502066330cc0d4321a6 | 2024-12-26T10:54:44-05:00 | Eve | | vulkan: multi-row k quants (#10846) |
| 1384 | d283d02bf254a7f2991e1502066330cc0d4321a6 | 9ba399dfa7f115effc63d48e6860a94c9faa31b2 | 2024-12-27T00:59:11+11:00 | Peter | | examples, ggml : fix GCC compiler warnings (#10983) |
| 1385 | 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d | 09fe2e76137dde850b13313f720e7ffa17efdefa | 2024-12-24T18:54:49+01:00 | Djip007 | | ggml : more perfo with llamafile tinyblas on x86_64 (#10714) |
| 1386 | 09fe2e76137dde850b13313f720e7ffa17efdefa | 30caac3a68a54de8396b21e20ba972554c587230 | 2024-12-24T19:39:49+03:00 | NeverLucky | | server: allow filtering llama server response fields (#10940) |
| 1387 | 3327bb0f8dea381118f8e66c18ea14db56d3b942 | 32d6ee6385b3fc908b283f509b845f757a6e7206 | 2024-12-24T04:05:17+01:00 | Diego Devesa | | ggml : fix arm enabled features check (#10961) |
| 1388 | 32d6ee6385b3fc908b283f509b845f757a6e7206 | 14b699ecde8f1e9e251ebff9eca39ebc5603b83b | 2024-12-23T20:25:52+01:00 | Diego Devesa | | ggml : fix const usage in SSE path (#10962) |
| 1389 | 14b699ecde8f1e9e251ebff9eca39ebc5603b83b | 485dc01214f266afff7004bc702498b491abc404 | 2024-12-23T12:52:25+01:00 | Xuan Son Nguyen | | server : fix missing model id in /model endpoint (#10957) |
| 1390 | b92a14a841fb4dfaf27b29d982ec8ba5289a3bff | 6f0c9e034bb398915a6617ee4acc62adb87d387d | 2024-12-23T08:35:44+08:00 | Yun Dou | | llama : support InfiniAI Megrez 3b (#10893) |
| 1391 | 7024d59e6a572730626cb11896829d115043a1b1 | 7c0e28585843b366864b43b48f92425e2ea17df6 | 2024-12-22T16:20:11-08:00 | yuri@FreeBSD | | ggml : fix run-time on FreeBSD in get_executable_path() (#10948) |
| 1392 | 7ae33a616f44ecc081f3dcb589be20962d1d4a92 | ebdee9478ca7ba65497b9b96f7457698c6ee5115 | 2024-12-23T01:09:58+03:00 | Billel Mokeddem | | llama : add Falcon3 support (#10883) |
| 1393 | ebdee9478ca7ba65497b9b96f7457698c6ee5115 | 5cd85b5e008de2ec398d6596e240187d627561e3 | 2024-12-22T03:44:01-06:00 | Jeff Bolz | | vulkan: build fixes for 32b (#10927) |
| 1394 | a91a41364b25705dbb81ae996bc35c3440c63b35 | e34c5af43f941f0ddb92466776339897295aca11 | 2024-12-21T01:04:45-06:00 | Jeff Bolz | | vulkan: optimize coopmat2 dequant functions (#10855) |
| 1395 | eb5c3dc64bd967f2e23c87d9dec195f45468de60 | 0ca416c91aea4549d9c77e3efeca403e15aa6c75 | 2024-12-20T21:01:28+05:30 | Akarshan Biswas | | SYCL: Migrate away from deprecated ggml_tensor->backend (#10840) |
| 1396 | 0ca416c91aea4549d9c77e3efeca403e15aa6c75 | 21ae3b9be83820565d1a720999b7f63ce95b4920 | 2024-12-20T14:12:06+01:00 | Xuan Son Nguyen | | server : (UI) fix copy to clipboard function (#10916) |
| 1397 | 21ae3b9be83820565d1a720999b7f63ce95b4920 | 0a11f8b7b5c39fdf6e91ef9674bc68ff08681af7 | 2024-12-20T13:31:28+01:00 | Diego Devesa | | ggml : add test for SVE and disable when it fails (#10906) |
| 1398 | 0a11f8b7b5c39fdf6e91ef9674bc68ff08681af7 | d408bb9268a988c5a60a5746d3a6430386e7604d | 2024-12-20T17:44:58+08:00 | Molly Sophia | | convert : fix RWKV v6 model conversion (#10913) |
| 1399 | 57bb2c40cd94c5a09f5210ed8264cc93b21c4b7e | a3c33b1dce2d4f25040b75f66629104bd1e40128 | 2024-12-19T15:40:08+01:00 | Xuan Son Nguyen | | server : fix logprobs, make it OAI-compatible (#10783) |
| 1400 | a3c33b1dce2d4f25040b75f66629104bd1e40128 | 2fffc52b50992ac5bc64db19d33c39cbc06f52cf | 2024-12-19T14:20:41+01:00 | Adrien Gallouët | | ggml: fix arm build with gcc (#10895) |
| 1401 | 2fffc52b50992ac5bc64db19d33c39cbc06f52cf | 7585edbdebd02861e0994dae67c9338731fb3fc5 | 2024-12-19T06:04:51-07:00 | Sukriti Sharma | | llama : fix Roberta embeddings (#10856) |
| 1402 | 7585edbdebd02861e0994dae67c9338731fb3fc5 | cd920d0ac38ec243605a5a57c50941140a193f9e | 2024-12-19T10:37:12+01:00 | fairydreaming | | convert : Add support for Microsoft Phi-4 model (#10817) |
| 1403 | 7909e8588ddf70820adf1f325490eb3f67b32875 | 9177484f589d770ffc4e655b9819124d6a22c1d9 | 2024-12-19T02:58:00Z | Eric Curtin | | llama-run : improve progress bar (#10821) |
| 1404 | 9177484f589d770ffc4e655b9819124d6a22c1d9 | 0bf2d10c5514ff61b99897a4a5054f846e384e1e | 2024-12-18T23:21:42+01:00 | Diego Devesa | | ggml : fix arm build (#10890) |
| 1405 | 0bf2d10c5514ff61b99897a4a5054f846e384e1e | 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec | 2024-12-18T19:27:21+02:00 | Georgi Gerganov | | tts : add OuteTTS support (#10784) |
| 1406 | 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec | 152610eda91217ac409342cd976d05f5114ad39f | 2024-12-18T04:00:07-10:00 | Gaetan Bisson | | server: avoid overwriting Authorization header (#10878) |
| 1407 | 152610eda91217ac409342cd976d05f5114ad39f | 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd | 2024-12-18T13:01:41+02:00 | Georgi Gerganov | | server : output embeddings for all tokens when pooling = none (#10861) |
| 1408 | 6b064c92b4c0228e333193c167f2c98d2ec8d9bc | 4da69d1abd15263061aff94c10f205836a96a4bc | 2024-12-18T00:35:00-08:00 | redbeard | | docs: Fix HIP (née hipBLAS) in README (#10880) |
| 1409 | 8dd19a48129d578972ea3d98896edbbf492891a9 | 130d0c90bd26b25e3a713b17a61a5d4eb0a66405 | 2024-12-16T19:34:38+09:00 | gn64 | | vulkan : fix soft_max.comp division by zero (whisper/2633) |
| 1410 | 130d0c90bd26b25e3a713b17a61a5d4eb0a66405 | 3919da8e335dbfd0741d239932a9b9e72061bf27 | 2024-12-14T03:23:08+01:00 | Daniel Bevenius | | ggml : remove return from ggml_gallocr_allocate_node (ggml/1048) |
| 1411 | 3919da8e335dbfd0741d239932a9b9e72061bf27 | 0006f5a74a59945f22ff966e723c3d566b3ca8d0 | 2024-12-13T08:19:38+01:00 | Daniel Bevenius | | ggml : add check for grad_accs (ggml/1046) |
| 1412 | 0006f5a74a59945f22ff966e723c3d566b3ca8d0 | 05c3a444b8b017b01b366b725ba22c740aae6b38 | 2024-12-17T18:35:42+02:00 | Georgi Gerganov | | ggml : update ggml_backend_cpu_device_supports_op (#10867) |
| 1413 | 227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 | 7b1ec53f56bb72c49e4c8434157895f94d3709c2 | 2024-12-17T09:52:09+01:00 | Xuan Son Nguyen | | server : (UI) fix missing async generator on safari (#10857) |
| 1414 | 7b1ec53f56bb72c49e4c8434157895f94d3709c2 | 160bc039c862c10b9938269a90ddb09d794a7b0d | 2024-12-17T05:52:55Z | Eve | | vulkan: bugfixes for small subgroup size systems + llvmpipe test (#10809) |
| 1415 | 160bc039c862c10b9938269a90ddb09d794a7b0d | 08ea539df211e46bb4d0dd275e541cb591d5ebc8 | 2024-12-17T05:00:46+08:00 | Zhiyuan Li | | rwkv6: add wkv6 support for Vulkan backend (#10829) |
| 1416 | 644fd71b44c4cdbfc6482fbf0353d289c3bc29e6 | 4ddd199f6f6b980e0a7ed9f9b44efeae2fbdf5c4 | 2024-12-16T12:31:14+02:00 | Georgi Gerganov | | sampling : refactor + optimize penalties sampler (#10803) |
| 1417 | a0974156f334acf8af5858d7ede5ab7d7490d415 | 87cf323cef80f6aa530f047ab05b539ebc6b7e3c | 2024-12-16T00:02:46+07:00 | Valentin Mamedov | | llama : add Deepseek MoE v1 & GigaChat models (#10827) |
| 1418 | 5478bbcd173e7027af7689493c7421719f5c43df | b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 | 2024-12-15T05:55:54-06:00 | Vinesh Janarthanan | | server: (UI) add syntax highlighting and latex math rendering (#10808) |
| 1419 | 89d604f2c87af9db657d8a27a1528bc4b7579c29 | e52aba537a34d51a65cddec6bc6dafc9031edc63 | 2024-12-14T22:29:45Z | Michelle Tan | | server: Fix `has_next_line` in JSON response (#10818) |
| 1420 | ba1cb19cdd0d92e012e0f6e009e0620f854b6afd | 56eea0781cbd2608ed8ff524955495569b9264be | 2024-12-14T20:43:46+08:00 | HimariO | | llama : add Qwen2VL support + multimodal RoPE (#10361) |
| 1421 | 56eea0781cbd2608ed8ff524955495569b9264be | a76c56fa1a3d27467eb97468d8c3b2fe1243b61a | 2024-12-13T23:21:49+01:00 | cduk | | Removes spurious \r in output that causes logging in journalctl to treat lines as binary and therefore hidden by default (#10771) |
| 1422 | a76c56fa1a3d27467eb97468d8c3b2fe1243b61a | c27ac678dd393af0da9b8acf10266e760c8a0912 | 2024-12-13T12:23:52-08:00 | lhez | | Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) |
| 1423 | 11e07fd63bac1cb642380a7a3eac03fd8703e948 | 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 | 2024-12-13T18:23:50+01:00 | Corentin REGAL | | fix: graceful shutdown for Docker images (#10815) |
| 1424 | 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 | 9f35e44592a7646a5803620eb6a3f0ed5ac90553 | 2024-12-13T15:48:44+01:00 | Jett Janiak | | gguf-py : numpy 2 newbyteorder fix (#9772) |
| 1425 | 9f35e44592a7646a5803620eb6a3f0ed5ac90553 | 64ae0655114f84f11a724bc6878c6f8f4a55560b | 2024-12-13T12:56:07Z | 谢乃闻 | | Fix crash caused by ggml_backend_load_all when launching on Android Activity (#10812) |
| 1426 | 64ae0655114f84f11a724bc6878c6f8f4a55560b | 83ed24a97b500ccdb32b90b94e6f9621ad8db79e | 2024-12-13T08:42:04Z | Eve | | vulkan: small mul_mat_vec optimizations (#10665) |
| 1427 | 83ed24a97b500ccdb32b90b94e6f9621ad8db79e | d583cd03f663701858ba152a334cbb467fabe342 | 2024-12-13T12:12:15+05:30 | Akarshan Biswas | | SYCL: Reduce most of the compiler warnings (#10748) |
| 1428 | d583cd03f663701858ba152a334cbb467fabe342 | adffa6ffd59997da59f62b72d2b79fc37e085e84 | 2024-12-13T01:04:19+01:00 | Karol Kontny | | ggml : Fix compilation issues on ARM platform when building without fp16 (#10811) |
| 1429 | cb13ef85a444eb52a3f1b82dce198ceb25606583 | 4064c0e3b6c27440f5d12b7caaf90b4088c28c61 | 2024-12-12T19:02:49+01:00 | Diego Devesa | | remove CMAKE_WINDOWS_EXPORT_ALL_SYMBOLS (#10797) |
| 1430 | dc5301d565b7d0b2c691f7df13099aab3997479c | 9fdb1243049aa7e8211693f116daf2052d47507d | 2024-12-12T18:35:37+01:00 | 0cc4m | | Vulkan: Add VK_EXT_subgroup_size_control support to ensure full subgroups for coopmats (#10721) |
| 1431 | 235f6e14bf0ed0211c51aeff14139038ae1000aa | 1a31d0dc00ba946d448e16ecc915ce5e8355994e | 2024-12-11T20:52:14+01:00 | Xuan Son Nguyen | | server : (UI) add tok/s, get rid of completion.js (#10786) |
| 1432 | 484d2f31aed34ff9f096e3961125762e81d9b7d6 | 4b4d92b0986e3b627b9a9ef4782973108bf47691 | 2024-12-11T22:48:04+09:00 | kallewoof | | bug-fix: snprintf prints NULL in place of the last character (#10419) |
| 1433 | 4b4d92b0986e3b627b9a9ef4782973108bf47691 | 43041d2eb32623d5b6ca734313327abe96f73146 | 2024-12-11T10:47:43Z | CentricStorm | | docs: fix server documentation formatting (#10776) |
| 1434 | 43041d2eb32623d5b6ca734313327abe96f73146 | b685daf3867c54e42a9db484d7b92619021d4510 | 2024-12-11T02:47:21+02:00 | Gilad S. | | ggml: load all backends from a user-provided search path (#10699) |
| 1435 | dafae66cc242eb766797194d3c85c5e502625623 | ae4b922614d452477cf5d2fb8cad247c9c12596c | 2024-12-10T19:33:23Z | Eve | | vulkan: dynamic subgroup size for the remaining k quants (#10745) |
| 1436 | 750cb3e246f7e544124cf18cb0c5e0c8b7e38738 | a86ad841f103e471ac0fd7ee8852d1eb5015ce89 | 2024-12-10T18:23:24+01:00 | Andreas Kieslinger | | CUDA: rename macros to avoid conflicts with WinAPI (#10736) |
| 1437 | a05e2afcc241c1ecd38ec5cb4c579d90cdf3f918 | 26a8406ba9198eb6fdd8329fa717555b4f77f05f | 2024-12-10T11:22:20-06:00 | Jeff Bolz | | vulkan: disable spirv-opt for coopmat shaders (#10763) |
| 1438 | 26a8406ba9198eb6fdd8329fa717555b4f77f05f | c37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b6 | 2024-12-09T20:07:12+01:00 | Johannes Gäßler | | CUDA: fix shared memory access condition for mmv (#10740) |
| 1439 | c37fb4cf62ddf0d33562c4c4a4d6fb45e32ad3b6 | 3d98b4cb226c3140bd1ae6c65ed126b7d90332fa | 2024-12-09T23:10:19+05:30 | Srihari-mcw | | Changes to CMakePresets.json to add ninja clang target on windows (#10668) |
| 1440 | 3d98b4cb226c3140bd1ae6c65ed126b7d90332fa | 1a05004743e00aca400833be625f0ec8cce176a7 | 2024-12-09T01:24:01-06:00 | Jeff Bolz | | vulkan: fix compile warnings (#10731) |
| 1441 | ce8784bdb153ff7794dde5a50b0ebfa51baa6171 | e52522b8694ae73abf12feb18d29168674aa1c1b | 2024-12-08T23:04:29+01:00 | Xuan Son Nguyen | | server : fix format_infill (#10724) |
| 1442 | 06d70147e6480c021e493c442ae0f0d83ae366de | 43ed389a3f102517e6f7d5620d8e451e88afbf27 | 2024-12-08T19:19:19+01:00 | stduhpf | | Vulkan: fix NaN in tanh.comp with AMD proprietary driver on Windows (#10723) |
| 1443 | 43ed389a3f102517e6f7d5620d8e451e88afbf27 | ecc93d0558fc3ecb8a5af69d2ece02fae4710ade | 2024-12-08T12:14:54+01:00 | Diego Devesa | | llama : use cmake for swift build (#10525) |
| 1444 | 3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 | d9c3ba2b7749c00df477599aa141a98b4521aa2c | 2024-12-07T20:21:09+01:00 | Xuan Son Nguyen | | server : (refactor) no more json in server_task input (#10691) |
| 1445 | ce4a7b849388b67d45ad420bdd82d5efcd55647a | 19d8762ab61df8286367588a80b9c7db4cb568db | 2024-12-07T18:02:05+02:00 | Georgi Gerganov | | server : various fixes (#10704) |
| 1446 | 19d8762ab61df8286367588a80b9c7db4cb568db | c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b | 2024-12-07T13:37:50+01:00 | Djip007 | | ggml : refactor online repacking (#10446) |
| 1447 | c2a16c0bdbe2e51adf318918bad82f0c3e3d6f3b | 3df784b3050f657ea681f804187ce5bddb433e88 | 2024-12-07T11:52:44+02:00 | Georgi Gerganov | | server : fix free of spec context and batch (#10651) |
| 1448 | 3df784b3050f657ea681f804187ce5bddb433e88 | 86a1934978ce5daffc7e5b4251f6540ee5e7b47b | 2024-12-07T10:24:15+01:00 | 0cc4m | | Vulkan: VK_KHR_cooperative_matrix support to speed up prompt processing (#10597) |
| 1449 | 6c5bc0625fae6909cb40def15bc4bb45db6f7f4d | 7736837d62efed1dbebfe579472fca041eda12d6 | 2024-12-06T11:14:32+01:00 | Xuan Son Nguyen | | server : (refactoring) do not rely on JSON internally (#10643) |
| 1450 | 7736837d62efed1dbebfe579472fca041eda12d6 | c9c6e01daedac542b174c235872569fce5385982 | 2024-12-05T23:36:41+02:00 | Plamen Minev | | fix(server) : not show alert when DONE is received (#10674) |
| 1451 | f112d198cd9953b633ac662c2705d6e423438717 | 1da7b765692764a8b33b08da61cbee63812a7bd9 | 2024-12-05T03:49:20+05:30 | aryantandon01 | | Update deprecation-warning.cpp (#10619) |
| 1452 | 1da7b765692764a8b33b08da61cbee63812a7bd9 | 59f4db10883a4f3e855cffbf2c3ab68430e95272 | 2024-12-04T22:38:20+02:00 | Georgi Gerganov | | server : fix speculative decoding with context shift (#10641) |
| 1453 | 2803540814bf0a4e44d0960ff6afda6bac971c17 | 253b7fde910731104670724391bfbcb94d97d0c3 | 2024-12-04T14:40:44+01:00 | Diego Devesa | | ggml-cpu : fix HWCAP2_I8MM value (#10646) |
| 1454 | 253b7fde910731104670724391bfbcb94d97d0c3 | 8d0cfd554a9ae545ff94d27e04458f537b4e8c0e | 2024-12-04T09:45:48Z | ltoniazzi | | Fix HF repo commit to clone lora test models (#10649) |
| 1455 | 98036d5670f21e9b9a99d5e3dbb3bf7589f5c4e3 | cd2f37b304f8e88b9de8424b31078b97f9cf7c60 | 2024-12-04T09:22:50+08:00 | Wang Ran (汪然) | | fix typo of README.md (#10605) |
| 1456 | 91c36c269bca75b2d08119c653512cd20b4ea2ba | 1cd3df46bd49a0c1c78da8b68c956448a73b7476 | 2024-12-03T19:38:44+01:00 | Xuan Son Nguyen | | server : (web ui) Various improvements, now use vite as bundler (#10599) |
| 1457 | efb6ae963031709fc331e6e48cc4606ac8f9c3a7 | 667d70d1704dfa6977505f5d01d4638669b90dce | 2024-12-02T19:27:24+01:00 | PAB | | feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019) |
| 1458 | 82bca2257b3cec72676abb26011f1b99fcdab29d | 0115df2f65ac7c64dd0e5915c72ecc4a9343a130 | 2024-12-03T12:50:08+02:00 | Nikolaos Pothitos | | readme : add option, update default value, fix formatting (#10271) |
| 1459 | 515d4e53727924e48774f45ecb15bdacbf851e13 | 844e2e1feec887c803845a3b8762f3b15979b095 | 2024-12-03T11:21:43+02:00 | Georgi Gerganov | | github : minify link [no ci] (revert) |
| 1460 | 70b98fadbc8c07a0144f3b50a4d7ab7e2aeff878 | 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e | 2024-12-03T11:20:00+02:00 | Georgi Gerganov | | server : fix default draft model parameters (#10586) |
| 1461 | 642330ac7cea11dc1f9d3df2b8f3dbd10b5e3f3e | 8648c521010620c2daccfa1d26015c668ba2c717 | 2024-12-02T22:10:19+01:00 | Xuan Son Nguyen | | llama : add enum for built-in chat templates (#10623) |
| 1462 | 8648c521010620c2daccfa1d26015c668ba2c717 | 64ed2091b24b2f9747148fdf49a34ed5938762c3 | 2024-12-02T21:22:53+02:00 | Georgi Gerganov | | make : deprecate (#10514) |
| 1463 | 991f8aabeec89d801300bb179e52013fb0eb0584 | 4cb003dd8d1f37523120a21e4b1a50a2adcb8c84 | 2024-12-02T12:34:11+05:30 | Akarshan Biswas | | SYCL: Fix and switch to GGML_LOG system instead of fprintf (#10579) |
| 1464 | 917786f43d0f29b7c77a0c56767c0fa4df68b1c5 | 5e1ed95583ca552a98d8528b73e1ff81249c2bf9 | 2024-12-01T22:09:49Z | Juk Armstrong | | Add `mistral-v1`, `mistral-v3`, `mistral-v3-tekken` and `mistral-v7` chat template types (#10572) |
| 1465 | 5c7a5aa0c32eb19ce03e178560797db5875d7692 | 3420909dffa50e70660524797a1e715a717684d2 | 2024-12-01T10:11:42-08:00 | Wang Qin | | ci: add error handling for Python venv creation in run.sh (#10608) |
| 1466 | 3420909dffa50e70660524797a1e715a717684d2 | 86dc11c5bcf34db2749d8bd8d4fa07a542c94f84 | 2024-12-01T16:12:41+01:00 | Diego Devesa | | ggml : automatic selection of best CPU backend (#10606) |
| 1467 | 43957ef203b4c9ceaee42c176b3ef44ea4359c85 | 0c39f44d70d058940fe2afe50cfc789e3e44d756 | 2024-11-30T19:19:44-08:00 | Wang Qin | | build: update Makefile comments for C++ version change (#10598) |
| 1468 | abadba05be52cccf6c0da49534e37f6062ce8ded | 0533e7fb3842a523f64dc533bd7bd7147ec2c63a | 2024-11-30T09:47:07+02:00 | Georgi Gerganov | | readme : refresh (#10587) |
| 1469 | 0533e7fb3842a523f64dc533bd7bd7147ec2c63a | 7cc2d2c88908fc92b97b28acafb82f7d6e425b85 | 2024-11-30T07:00:02Z | Eve | | vulkan: Dynamic subgroup size support for Q6_K mat_vec (#10536) |
| 1470 | b782e5c7d453b3f1fa8dc6c34cde7e2fa946af93 | 3a8e9af402f7893423bdab444aa16c5d9a2d429a | 2024-11-29T21:48:56+01:00 | Xuan Son Nguyen | | server : add more test cases (#10569) |
| 1471 | f0678c5ff4cb8873d6ff48801475ff270db656fa | 4b3242bbea172ac0980378496fbc676d44c4f459 | 2024-11-29T16:25:39+02:00 | Georgi Gerganov | | ggml : fix I8MM Q4_1 scaling factor conversion (#10562) |
| 1472 | 4b3242bbea172ac0980378496fbc676d44c4f459 | 0f77aae5608f16780a49926b67be6d56ec4b09bd | 2024-11-29T21:49:02+08:00 | Shupei Fan | | ggml-cpu: fix typo in gemv/gemm iq4_nl_4_4 (#10580) |
| 1473 | 266b8519ee6d21e7ba2bf56f5629e20a181fee8b | 938f6087421889a3af7d0786c64406ced2be81b8 | 2024-11-29T09:49:43Z | Alberto Cabrera Pérez | | sycl : Reroute permuted mul_mats through oneMKL (#10408) |
| 1474 | f095a649ec390e04dfab1b04e646ae8549dafaef | 678d7994f4da0af3d29046be99950ac999ee9762 | 2024-11-29T00:18:02-06:00 | Jeff Bolz | | vulkan: get the first command buffer submitted sooner (#10499) |
| 1475 | 890719311b6535e572f15965c6d7ec4ac2537f60 | 7281cf13addfae9b64bb2be87e3b5b1914505d63 | 2024-11-28T18:15:25+01:00 | Johannes Gäßler | | common: fix warning message when no GPU found (#10564) |
| 1476 | 7281cf13addfae9b64bb2be87e3b5b1914505d63 | e90688edd004fdb7063f463bd18408ba9ae008dd | 2024-11-28T23:03:11+08:00 | Random Fly | | docs: fix outdated usage of llama-simple (#10565) |
| 1477 | e90688edd004fdb7063f463bd18408ba9ae008dd | 76b27d29c22af03172cf211a8a31025c7c828a57 | 2024-11-28T15:58:54+01:00 | Diego Devesa | | ci : fix tag name in cuda and hip releases (#10566) |
| 1478 | 76b27d29c22af03172cf211a8a31025c7c828a57 | eea986f215e1dc490654d012ccf2ab62fe8f606d | 2024-11-28T14:56:37+02:00 | Georgi Gerganov | | ggml : fix row condition for i8mm kernels (#10561) |
| 1479 | eea986f215e1dc490654d012ccf2ab62fe8f606d | c202cef1686182a78f8f4e253ab8d0c0ffe2fcc8 | 2024-11-28T14:56:23+02:00 | Georgi Gerganov | | cmake : fix ARM feature detection (#10543) |
| 1480 | 605fa66c509f9f117bd654cf0b9b3ea08bb86e80 | b7420131bf8ab3e067bc660439ab1ab18be7edbd | 2024-11-28T15:25:24+08:00 | leo-pony | | CANN: Fix SOC_TYPE compile bug (#10519) |
| 1481 | 9f912511bc9414fa7a3c521378b6388cd932b58d | 3ad5451f3b75809e3033e4e577b9f60bcaf6676a | 2024-11-27T22:30:52+01:00 | Xuan Son Nguyen | | common : fix duplicated file name with hf_repo and hf_file (#10550) |
| 1482 | 9e2301f4a4ef1690bd99360c11de43fe830b1c8d | fee824a1a1e35b5c49d482f654613addade61764 | 2024-11-27T11:22:14+02:00 | Georgi Gerganov | | metal : fix group_norm support condition (#0) |
| 1483 | 5b3466bedfa84aa29c6871c7254467550186ecc6 | 249a7902ec710c8d027b9cc0ed10219d2b4184f8 | 2024-11-27T01:30:27-06:00 | Jeff Bolz | | vulkan: Handle GPUs with less shared memory (#10468) |
| 1484 | c9b00a70b080d5c0668608024afc3e0e2fed822f | de5097351caffb3deaea3393633609df49ef41d0 | 2024-11-26T22:12:10+01:00 | Diego Devesa | | ci : fix cuda releases (#10532) |
| 1485 | de5097351caffb3deaea3393633609df49ef41d0 | 5a349f2809dc825960dfcfdf8f76b19cd0345be7 | 2024-11-26T12:55:29-08:00 | Shane A | | Add OLMo 2 model in docs (#10530) |
| 1486 | be0e350c8b69632b27d5fb41fa064fa256dd7fbf | 249cd93da3df9c8fa78869b0522526d1625aca91 | 2024-11-26T19:27:28+01:00 | Tristan Druyen | | Fix HIP flag inconsistency & build docs (#10524) |
| 1487 | 904109ed0d97c9b656a5e8bf612925f739bb8166 | 45abe0f74ee281aea6e5283c1e738061256cfcae | 2024-11-26T09:45:05-06:00 | Jeff Bolz | | vulkan: fix group_norm (#10496) |
| 1488 | 45abe0f74ee281aea6e5283c1e738061256cfcae | 0bbd2262a3263f37385297b30de37941836e57f7 | 2024-11-26T16:20:18+01:00 | Xuan Son Nguyen | | server : replace behave with pytest (#10416) |
| 1489 | ab96610b1e58684bc5e8b810130c4cf6d8252e21 | 7db3846a94ce7683b3e8120abe427457edf840c9 | 2024-11-26T14:18:08+02:00 | Georgi Gerganov | | cmake : enable warnings in llama (#10474) |
| 1490 | 84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 | 811872a59daefb25fc0c4326bcb6d8ae893c2f7c | 2024-11-26T13:36:40+02:00 | Georgi Gerganov | | server : fix parallel speculative decoding (#10513) |
| 1491 | 0eb4e12beebabae46d37b78742f4c5d4dbe52dc1 | 0cc63754b831d3a6c37bc5d721d12ce9540ffe76 | 2024-11-26T10:47:20+09:00 | Junil Kim | | vulkan: Fix a vulkan-shaders-gen arugment parsing error (#10484) |
| 1492 | 9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 | 47f931c8f9a26c072d71224bc8013cc66ea9e445 | 2024-11-25T22:28:27+02:00 | Georgi Gerganov | | server : add more information about error (#10455) |
| 1493 | 47f931c8f9a26c072d71224bc8013cc66ea9e445 | 106964e3d266740f571b5aad7b57545b4a901ac9 | 2024-11-25T21:50:07+02:00 | Georgi Gerganov | | server : enable cache_prompt by default (#10501) |
| 1494 | 10bce0450f0c4d80087e06312b9dbbab3e87f16b | 1f922254f0c984a8fb9fbaa0c390d7ffae49aedb | 2024-11-25T19:30:06+01:00 | Diego Devesa | | llama : accept a list of devices to use to offload a model (#10497) |
| 1495 | 1f922254f0c984a8fb9fbaa0c390d7ffae49aedb | a9a678a6b2264e5895533217b0cf8f250534cc58 | 2024-11-25T19:18:37+01:00 | Johannes Gäßler | | Github: update issue templates [no ci] (#10489) |
| 1496 | f6d12e7df8fe64384f1939976871252e6422a01e | b756441104ca8384640d6df22ba4ea6dab7ad799 | 2024-11-25T15:17:32+02:00 | Georgi Gerganov | | tests : fix compile warning |
| 1497 | 5a8987793f3e7c1fbfa6806bfcd17d578071b6c9 | d9d54e498d38ec99bbc0031022f9c92711e97bbc | 2024-11-25T17:31:10+08:00 | Neo Zhang Jianyu | | [SYCL] Fix building Win package for oneAPI 2025.0 update (#10483) |
| 1498 | d9d54e498d38ec99bbc0031022f9c92711e97bbc | cce5a9007572c6e9fa522296b77571d2e5071357 | 2024-11-25T09:58:41+02:00 | Georgi Gerganov | | speculative : refactor and add a simpler example (#10362) |
| 1499 | dc39012cbaf8752fabecaeb60af78ccdd1dfb73b | 9336db462c0c34bbe2055413fe4e16442626c38b | 2024-11-24T16:10:26+01:00 | Diego Devesa | | llama : fix op mul check with command-r-plus (#10476) |
| 1500 | 96fa2c5e2d6cb5319f34c3a7fb0cec05694b22f1 | 55ed008b2de01592659b9eba068ea01bb2f72160 | 2024-11-24T09:09:22+09:00 | momonga | | fix gguf-py: Conversion error when multiple licenses are configured (#9807) |
| 1501 | 599b3e0cd40432cd1975a8906f3db70bbe53b627 | c18610b4ee29ca056bb4f2d375a4ad1b16f44ef7 | 2024-11-22T08:32:40+01:00 | Johannes Gäßler | | GitHub: ask for more info in issue templates (#10426) |
| 1502 | a5e47592b6171ae21f3eaa1aba6fb2b707875063 | 1bb30bf28cb5a7adf111bc41c935bdaf128397e7 | 2024-11-21T18:18:50+01:00 | Diego Devesa | | cuda : optimize argmax (#10441) |
| 1503 | 02e4eaf22f229a114054b053a9eff61483653670 | 9abe9eeae98b11fa93b82632b264126a010225ff | 2024-11-20T14:56:04+01:00 | Johannes Gäßler | | ggml-opt: fix data corruption (ggml/1022) |
| 1504 | 9abe9eeae98b11fa93b82632b264126a010225ff | f95caa79546271722ada703da20ffb1cfcd21fed | 2024-11-20T13:47:36-06:00 | Jeff Bolz | | vulkan: predicate max operation in soft_max shaders/soft_max (#10437) |
| 1505 | 1bacb9f62514b520bdf74ed6feb46c80508dad38 | ad21c9e1f14d82b8c15ae369a8839019e3d498b4 | 2024-11-20T01:11:00-06:00 | Jeff Bolz | | vulkan: further optimize mul_mat_vec using larger loads (#10387) |
| 1506 | 3952a221af54b8a6549bc2bd4a7363ef7ad3081e | 42ae10bbcd7b56f29a302c86796542a6dadf46c9 | 2024-11-19T23:18:17+01:00 | Anthony Van de Gejuchte | | Fix missing file renames in Makefile due to changes in commit ae8de6d50a (#10413) |
| 1507 | 3ee6382d48b07b31e64983969c16019490e19740 | 8e752a777b272606f22cb741b03e062de4ddb8fe | 2024-11-19T14:29:38+01:00 | Diego Devesa | | cuda : fix CUDA_FLAGS not being applied (#10403) |
| 1508 | 557924f22237c76387a39c4db5abae154d57e754 | d3481e631661b5e9517f78908cdd58cee63c4903 | 2024-11-19T00:50:04Z | Alberto Cabrera Pérez | | sycl: Revert MUL_MAT_OP support changes (#10385) |
| 1509 | f139d2ea611c5604395c95160d3c53f7c4eaf220 | 2eb76b2a5e4ea395b971a419c95b473ab6f253e4 | 2024-11-18T08:28:42-06:00 | Jeff Bolz | | vulkan: remove use of null initializer (#10372) |
| 1510 | 9b75f03cd2ec9cc482084049d87a0f08f9f01517 | 75207b3a887f91f813de1eb6e9fd135d3cb2b8c6 | 2024-11-18T11:02:43+01:00 | 0cc4m | | Vulkan: Fix device info output format specifiers (#10366) |
| 1511 | 76e9e58b7847112848aa1f40b65d1cbcd6d5f5a3 | ce2e59ba107cf71ed566040ff20a15d1c58e09c2 | 2024-11-17T23:20:42+01:00 | Johannes Gäßler | | CUDA: fix MMV kernel being used for FP16 src1 (#10357) |
| 1512 | ce2e59ba107cf71ed566040ff20a15d1c58e09c2 | be5caccef945546ee9fd25a151330a88d785faf9 | 2024-11-17T12:59:38+01:00 | Johannes Gäßler | | CMake: fix typo in comment [no ci] (#10360) |
| 1513 | be5caccef945546ee9fd25a151330a88d785faf9 | 20a780c7b64c38071fe70ad23e16e80c23c0147b | 2024-11-17T12:25:45+01:00 | Diego Devesa | | llama : only use default buffer types for the KV cache (#10358) |
| 1514 | a43178299c2f74f14bcfc659bfd9fd32d931d1f4 | c3ea58aca406911eb4d409cdbfc76683393442b6 | 2024-11-17T21:39:22+13:00 | FirstTimeEZ | | ggml : fix undefined reference to 'getcpu' (#10354) |
| 1515 | 467576b6cc7d2b9220f55bc635aa51469cf26fb5 | eda7e1d4f54711de1c9b40502d6c88bbc217da60 | 2024-11-17T09:06:34+01:00 | Johannes Gäßler | | CMake: default to -arch=native for CUDA build (#10320) |
| 1516 | eda7e1d4f54711de1c9b40502d6c88bbc217da60 | 24203e9dd7355a4a10bc32d959fd0148d37bf666 | 2024-11-17T07:31:17+01:00 | Diego Devesa | | ggml : fix possible buffer use after free in sched reserve (#9930) |
| 1517 | 68fcb4759c0ca2874b59d9c1e6a35ceca1cc04ce | 8a43e940ab0daaff198809bf9277289994ec62f5 | 2024-11-16T21:32:41+02:00 | Georgi Gerganov | | ggml : fix compile warnings (#0) |
| 1518 | db4cfd5dbc31c90f0d5c413a2e182d068b8ee308 | 8ee0d09ae6928d0501765cfc4e430b9236730caf | 2024-11-16T17:58:56+02:00 | Georgi Gerganov | | llamafile : fix include path (#0) |
| 1519 | f245cc28d4eb900efad0bc740145f58d713c6e4f | 772703c8fffdd83d2e28f60119e83525f1189412 | 2024-11-16T10:32:50+02:00 | Georgi Gerganov | | scripts : fix missing key in compare-llama-bench.py (#10332) |
| 1520 | dd3a6ce9f84d21ba05fe98af9f983bdea0398e6c | 1e58ee1318429a3e97aa66f3034cdfd65ffc6c34 | 2024-11-16T14:59:33+13:00 | FirstTimeEZ | | vulkan : add cmake preset debug/release (#10306) |
| 1521 | 89e4caaaf081f4712af61a3e08cb67b406c02b80 | 74d73dc85cc2057446bf63cc37ff649ae7cebd80 | 2024-11-16T13:42:13+13:00 | FirstTimeEZ | | llama : save number of parameters and the size in llama_model (#10286) |
| 1522 | 74d73dc85cc2057446bf63cc37ff649ae7cebd80 | 4047be74da398acb8717a4d21b77b929ad7ed4f7 | 2024-11-16T02:57:00+05:30 | Srihari-mcw | | Make updates to fix issues with clang-cl builds while using AVX512 flags (#10314) |
| 1523 | 883d206fbd2c5b2b9b589a9328503b9005e146c9 | 09ecbcb596ed8fa97d503d7440f0b3eff872e8f1 | 2024-11-15T20:20:54+01:00 | slaren | | ggml : fix some build issues |
| 1524 | 09ecbcb596ed8fa97d503d7440f0b3eff872e8f1 | 3225008973579cc6a784890c237e1bfc9de41819 | 2024-11-15T15:35:22+02:00 | Georgi Gerganov | | cmake : fix ppc64 check (whisper/0) |
| 1525 | 18429220bdb344da1bc7df9bc580c7b41b3cd57b | f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7 | 2024-11-15T11:47:58Z | Eve | | AVX BF16 and single scale quant optimizations (#10212) |
| 1526 | 9901068ac78838745e604fffb4601d315a610456 | 231f9360d94446cd083b6b116f63991b1328c484 | 2024-11-15T05:48:49-04:00 | Xuan Son Nguyen | | server : (web UI) add copy button for code block, fix api key (#10242) |
| 1527 | 4802ad350b8e19cbc7a77269b4494c896f6e0896 | 5a54af4d4f588f109f31e456483fdf77096399d9 | 2024-11-15T08:38:43+02:00 | Georgi Gerganov | | scripts : fix regex in sync [no ci] |
| 1528 | 5a54af4d4f588f109f31e456483fdf77096399d9 | 1607a5e5b08f4e55f118af3d7de325949d8f1835 | 2024-11-15T04:09:12+01:00 | Romain Biessy | | sycl: Use syclcompat::dp4a (#10267) |
| 1529 | 2a82891a853db908679f7b24b04586e6f6393fe0 | af148c9386da825a60c7038549c121c35ca56b50 | 2024-11-14T11:44:15+02:00 | Georgi Gerganov | | speculative : fix out-of-bounds access (#10289) |
| 1530 | fb4a0ec0833c71cff5a1a367ba375447ce6106eb | 5ea926dad7f62ebccff7b24784bd1e01a06d13ae | 2024-11-13T20:00:35+02:00 | Michael Podvitskiy | | llama : propagate the results of `graph_compute` (#9525) |
| 1531 | 0e712a5acbbdd1593e5aeb86d4f6b896a11b438c | a0ec17b32ec6077f5ca22fe833ebdc9b86795a4d | 2024-11-13T19:15:23+08:00 | Jhen-Jie Hong | | server : fix incorrect res in validate_model_chat_template (#10272) |
| 1532 | 2e82ffa4af29f87e7d3d6dff8060a2a79613b72f | 80dd7ff22fd050fed58b552cc8001aaf968b7ebf | 2024-11-13T09:40:57Z | Alberto Cabrera Pérez | | sycl : Fixes to broken builds and test-backend-ops (#10257) |
| 1533 | 80dd7ff22fd050fed58b552cc8001aaf968b7ebf | 54ef9cfc726a799e6f454ac22c4815d037716eda | 2024-11-13T00:58:57-06:00 | Jeff Bolz | | vulkan: Optimize contiguous copies (#10254) |
| 1534 | 54ef9cfc726a799e6f454ac22c4815d037716eda | b0cefea58a20020754b7431e3c725625274372a5 | 2024-11-11T11:13:51-06:00 | Jeff Bolz | | vulkan: Throttle the number of shader compiles during the build step. (#10222) |
| 1535 | b141e5f6efbab3a00633df88c4f9425bfe8b78ab | 4b3a9212b602be3d4e2e3ca26efd796cef13c55e | 2024-11-11T08:38:43+02:00 | Georgi Gerganov | | server : enable KV cache defrag by default (#10233) |
| 1536 | 505f33274d60676320216b662a97672a76ec600e | 160687b3ed002eee83a04de83a9cd752f928ced1 | 2024-11-11T00:42:25+05:00 | MaggotHATE | | server : (web UI) Add back sampler settings (#10239) |
| 1537 | 160687b3ed002eee83a04de83a9cd752f928ced1 | 6423c65aa8be1b98f990cf207422505ac5a441a1 | 2024-11-10T05:37:56-06:00 | Jeff Bolz | | vulkan: Fix newly added tests for permuted mul_mat and 1D im2col (#10226) |
| 1538 | 39a334a9aaf2000f93a899d9f43d889e460640ee | bb38cdd8baf37de1fadab3e867c6ba4ae452eff6 | 2024-11-09T11:53:02+02:00 | Georgi Gerganov | | metal : fix build and some more comments (#10229) |
| 1539 | bb38cdd8baf37de1fadab3e867c6ba4ae452eff6 | f018acba22095b8995bf6c5ef815b16a3ce4cf1b | 2024-11-09T11:52:45+02:00 | Georgi Gerganov | | metal : fix F32 accumulation in FA vec kernel (#10232) |
| 1540 | f018acba22095b8995bf6c5ef815b16a3ce4cf1b | 46323fa9efd5e6c8aeef8d6eb6c332ee0d95eb13 | 2024-11-09T11:26:34+02:00 | Georgi Gerganov | | llama : fix Qwen model type strings |
| 1541 | 46323fa9efd5e6c8aeef8d6eb6c332ee0d95eb13 | 5b359bb1e3585de45bec79fd6c18934897662cdf | 2024-11-09T11:21:49+02:00 | Georgi Gerganov | | metal : hide debug messages from normal log |
| 1542 | 5b359bb1e3585de45bec79fd6c18934897662cdf | e89213492d3e01705739789733f0f2d250b4c449 | 2024-11-09T15:35:46+08:00 | SXX | | ggml: fix zero division in ‘dne’ calculation in CUDA COUNT_EQUAL operator when ‘ne’ is small (#10213) |
| 1543 | e89213492d3e01705739789733f0f2d250b4c449 | 8fc393f246c550d2481e53323a47644a94e8d01f | 2024-11-09T12:47:50+05:30 | amritahs-ibm | | ggml : optimize llamafile cpu matrix multiplication for ppc64le (#10156) |
| 1544 | 8fc393f246c550d2481e53323a47644a94e8d01f | ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf | 2024-11-09T15:06:54+08:00 | haopeng | | scripts : fix pattern and get n_tokens in one go (#10221) |
| 1545 | ec450d3bbf9fdb3cd06b27c00c684fd1861cb0cf | 695ad752b2631af84ba321177656705b30c6e401 | 2024-11-08T21:59:46+02:00 | Georgi Gerganov | | metal : opt-in compile flag for BF16 (#10218) |
| 1546 | 841f27abdbbcecc9daac14dc540ba6202e4ffe40 | d05b3127bd30515955aa4ee2bacdb68ebafe88f4 | 2024-11-08T13:47:22+02:00 | Georgi Gerganov | | metal : optimize FA kernels (#10171) |
| 1547 | 76c6e7f10551960e4ec9e14e0535b72081f1c7ad | a71d81cf8c1afb26b166f897c94ee1581f9fac7d | 2024-11-07T18:44:38-04:00 | Xuan Son Nguyen | | server : minor UI fix (#10207) |
| 1548 | a71d81cf8c1afb26b166f897c94ee1581f9fac7d | eec4d71737b32f312e0082b671629a0368e1a20d | 2024-11-07T17:31:10-04:00 | Xuan Son Nguyen | | server : revamp chat UI with vuejs and daisyui (#10175) |
| 1549 | 5107e8cea35be46a27cfc940e6841c0cf81c0525 | 2319126a70b541f8670225a04a38202bbdccbedb | 2024-11-07T08:20:25-07:00 | wwoodsTM | | DRY: Fixes clone functionality (#10192) |
| 1550 | 2319126a70b541f8670225a04a38202bbdccbedb | 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 | 2024-11-07T02:02:08-06:00 | snadampal | | fix q4_0_8_8 format for corrupted tokens issue (#10198) |
| 1551 | 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 | 5c333e014059122245c318e7ed4ec27d1085573c | 2024-11-07T18:19:10+11:00 | Zhiyuan Li | | Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133) |
| 1552 | 5c333e014059122245c318e7ed4ec27d1085573c | b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 | 2024-11-06T19:53:51+02:00 | Georgi Gerganov | | metal : add BF16 support (#8439) |
| 1553 | 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 | 1dc04b2deed2d2f2ae3aff9b14ae29674dee1fb8 | 2024-11-06T12:10:07+01:00 | Diego Devesa | | metal : fix from ptr buffer name (#10189) |
| 1554 | a1eaf6a9600bb1608753420ba886a3b0a208ffc0 | b8deef0ec0af5febac1d2cfd9119ff330ed0b762 | 2024-11-06T10:24:23+02:00 | Georgi Gerganov | | metal : add quantized FA support (#10149) |
| 1555 | a9e8a9a0306a8093eef93b0022d9f45510490072 | 340736477651095a98a3b10e19b038ec62593a1d | 2024-11-04T23:17:01+01:00 | Diego Devesa | | ggml : fix arch check in bf16_to_fp32 (#10164) |
| 1556 | d5a409e57fe8bd24fef597ab8a31110d390a6392 | 401558b7ba7a08175c153cd3607230f63c8a528e | 2024-11-04T20:06:58+01:00 | Diego Devesa | | ggml : fix gelu tables initialization (#10172) |
| 1557 | 401558b7ba7a08175c153cd3607230f63c8a528e | 9e0ecfb697d297355e43c20559d29bcc71beb0c3 | 2024-11-04T17:34:08+01:00 | Diego Devesa | | ggml : fix q4xx mat mul, increase ggml_aligned_malloc alignment (#10167) |
| 1558 | 9e0ecfb697d297355e43c20559d29bcc71beb0c3 | 6a066b9978533e2ab9890b7f4f8c0262d91798b3 | 2024-11-04T16:33:29+01:00 | Xuan Son Nguyen | | server : clarify /slots endpoint, add is_processing (#10162) |
| 1559 | 6a066b9978533e2ab9890b7f4f8c0262d91798b3 | ea02c753ebf9342114cb173f10b3ffc2af1e7d04 | 2024-11-04T09:08:33-06:00 | snadampal | | fix build break on arm64 linux (#10166) |
| 1560 | ea02c753ebf9342114cb173f10b3ffc2af1e7d04 | 05697f670b1ea28b80c39854832ea53527f75c55 | 2024-11-04T13:10:23+01:00 | Diego Devesa | | cuda : clear error after changing peer access (#10153) |
| 1561 | e2292aaa17cf8530b0d0d899909588c3a095799d | 9f409893519b4a6def46ef80cd6f5d05ac0fb157 | 2024-11-01T16:55:10+02:00 | Plamen Minev | | metal : fix minor string leaks (ggml/1004) |
| 1562 | 08828a6d7d0006a487c9655ba8ace0ebe35ecad1 | 1839f69130151ceeac4d01c0ef8964e1fb43bba6 | 2024-11-03T15:18:40+02:00 | Georgi Gerganov | | metal : minor fixup in FA kernel (#10143) |
| 1563 | 42cadc74bda60afafb45b71b1a39d150ede0ed4d | 45950415ed985830c59bf42cf9c9216b20cf08ef | 2024-11-02T16:34:56Z | sasha0552 | | server : fix slot selection by lru (#10126) |
| 1564 | 45950415ed985830c59bf42cf9c9216b20cf08ef | 1926d6e39d6f6358bc1a4c52316a560178be7233 | 2024-11-02T18:34:00+02:00 | Georgi Gerganov | | server : fix endpoint checks (#10135) |
| 1565 | 1926d6e39d6f6358bc1a4c52316a560178be7233 | b634f8a26fef65210fd9fb2f87e83a2809535e89 | 2024-11-02T15:18:56+02:00 | Georgi Gerganov | | llama : adjust default context size + print warnings (#10136) |
| 1566 | 7554aa4655f44b33a29068f2b18c5976fae45f9d | a6744e43e80f4be6398fc7733a01642c846dce1d | 2024-11-02T12:53:17+01:00 | Xuan Son Nguyen | | convert-lora : make `--base` optional (#10110) |
| 1567 | 418f5eef262cea07c2af4f45ee6a88d882221fcb | ba6f62eb793d6617892d252f5c04d7685d908a38 | 2024-11-02T02:33:14+08:00 | Shupei Fan | | vulkan : improve ggml_vk_create_buffer error handling (#9898) |
| 1568 | d865d1478cd4e403f82d793c2afcd0f943412f05 | 1804adb0cfee4811eaf633741503d683a46e4c77 | 2024-11-01T13:33:14Z | sasha0552 | | server : fix smart selection of available slot (#10120) |
| 1569 | e597e50794f07ec8dc24b9efb18f94ec6386fda0 | 85679d37f34f66783cc04664a06c405b28e8e035 | 2024-11-01T11:09:59+08:00 | Zhenwei Jin | | build: fix build error in Windows env with OneAPI setup (#10107) |
| 1570 | 1e9f94994ef908d964cf81069f03d9d3668beb7d | c02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce7 | 2024-11-01T00:45:34+01:00 | Diego Devesa | | quantize : fix --keep-split (#10114) |
| 1571 | c02e5ab2a675c8bc1abc8b1e4cb6a93b26bdcce7 | ab3d71f97f5b2915a229099777af00d3eada1d24 | 2024-10-31T22:54:23+01:00 | Diego Devesa | | llama : fix buffer checks for mamba and rwk (#10111) |
| 1572 | b9e02e8184f5e6094a9e87eaf040becd404bfc90 | 6763f713bb692910e9b2d9d1a82d6959cee2dcf3 | 2024-10-30T14:51:21+01:00 | Diego Devesa | | ggml : fix memory leaks when loading invalid gguf files (#10094) |
| 1573 | fc83a9e58479e4dd70054daa7afe5184c1bbe545 | c5b0f4b5d90297f3e729fca7f78ddb25fcab5ddc | 2024-10-30T15:00:40+08:00 | xctan | | ggml : add Q4_0_8_8 RISC-V GEMV and GEMM kernels (#10029) |
| 1574 | 8f275a7c4593aa34147595a90282cf950a853690 | 8d8ff715367480b856ad86ac3888e9742b13a6fa | 2024-10-29T17:52:56+09:00 | Changyeon Kim | | ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763) |
| 1575 | 61715d5cc83a28181df6a641846e4f6a740f3c74 | 07028f9d74d895da2ca4a1956624e3f07e04e620 | 2024-10-28T10:45:33-07:00 | arch-btw | | llama : Add IBM granite template (#10013) |
| 1576 | 8841ce3f439de6e770f70319b7e08b6613197ea7 | cc2983d3753c94a630ca7257723914d4c4f6122b | 2024-10-27T20:59:58+02:00 | Georgi Gerganov | | llama : switch KQ multiplication to F32 precision by default (#10015) |
| 1577 | 9e4a2563eadf34e9432d248224d4f43e8495e8fe | 668750357e66bfa3d1504b65699f5a0dfe3cb7cb | 2024-10-26T10:33:31+03:00 | Georgi Gerganov | | scripts : fix amx sync [no ci] |
| 1578 | ff252ea48e90e6552010fd74584334fb41bdd387 | d80fb71f8b8bf69ec095ba281f8248d136d21c76 | 2024-10-25T10:07:34-06:00 | wwoodsTM | | llama : add DRY sampler (#9702) |
| 1579 | d80fb71f8b8bf69ec095ba281f8248d136d21c76 | 2f8bd2b90133cf37ae752015e1bfd738cc6d0112 | 2024-10-25T17:57:54+02:00 | Michael Podvitskiy | | llama: string_split fix (#10022) |
| 1580 | 958367bf530d943a902afa1ce1c342476098576b | 40f2555797f97314de749873cdc29dc102be66e2 | 2024-10-24T21:51:22+02:00 | Xuan Son Nguyen | | server : refactor slot input data, move tokenizer to HTTP thread (#10023) |
| 1581 | 40f2555797f97314de749873cdc29dc102be66e2 | 167a515651a4b065a16225ffc69564c5674f3d0f | 2024-10-24T21:23:33+03:00 | Georgi Gerganov | | ci : fix cmake flags for SYCL |
| 1582 | 167a515651a4b065a16225ffc69564c5674f3d0f | c39665f589091903396a442a6ee56613303e0350 | 2024-10-24T14:40:23+02:00 | Johannes Gäßler | | CUDA: fix insufficient buffer clearing for MMQ (#10032) |
| 1583 | c39665f589091903396a442a6ee56613303e0350 | 0a1c750c80147687df267114c81956757cc14382 | 2024-10-24T11:09:36+02:00 | Johannes Gäßler | | CUDA: fix MMQ for non-contiguous src0, add tests (#10021) |
| 1584 | 80273a306d07ed95059d6130389deacb3b2d7196 | c19af0acb1fe6d0fdbecadd8483c1fbe5d68d095 | 2024-10-18T09:24:44+02:00 | Johannes Gäßler | | CUDA: fix 1D im2col, add tests (ggml/993) |
| 1585 | c19af0acb1fe6d0fdbecadd8483c1fbe5d68d095 | ac113a0feee0935b2018312f7bc8d7a646b117ed | 2024-10-16T20:10:01+02:00 | Daniel Bevenius | | ggml : remove redundant set of contexts used field (ggml/978) |
| 1586 | ac113a0feee0935b2018312f7bc8d7a646b117ed | 4c9388fb96ac2415fbb1239b7ba8346616606e2e | 2024-10-23T07:09:26-04:00 | Michael Coppola | | llama.vim : add classic vim support (#9995) |
| 1587 | 4c9388fb96ac2415fbb1239b7ba8346616606e2e | 873279b1592e433c4d9eb5065091cc98473c7bee | 2024-10-23T19:33:45+09:00 | Jun Hee Yoo | | metal : add POOL2D and fix IM2COL (#9943) |
| 1588 | c8c07d658a6cefc5a50cfdf6be7d726503612303 | 19d900a7565b8f6b0a708836a57d26966cb9efe2 | 2024-10-22T16:59:02+02:00 | Xuan Son Nguyen | | llama : fix empty batch causing llama_batch_allocr to crash (#9966) |
| 1589 | 19d900a7565b8f6b0a708836a57d26966cb9efe2 | 11d47057a51f3d9b9231e6b57d0ca36020c0ee99 | 2024-10-22T15:31:06+02:00 | Daniel Bevenius | | llama : rename batch to ubatch (#9950) |
| 1590 | 11d47057a51f3d9b9231e6b57d0ca36020c0ee99 | c421ac072d46172ab18924e1e8be53680b54ed3b | 2024-10-22T21:22:26+08:00 | Molly Sophia | | Rwkv chat template fix (#10001) |
| 1591 | 4ff7fe1fb36b04ddd158b2de881c348c5f0ff5e4 | 6b8447352df3d662b56280c8fc38d7f092885787 | 2024-10-22T18:33:37+08:00 | Molly Sophia | | llama : add chat template for RWKV-World + fix EOT (#9968) |
| 1592 | 6b8447352df3d662b56280c8fc38d7f092885787 | 674804a99617b4f90292b4080ecab450ea3d30ba | 2024-10-22T16:16:01+08:00 | leo-pony | | [CANN] Adapt to dynamically loadable backends mechanism (#9970) |
| 1593 | 674804a99617b4f90292b4080ecab450ea3d30ba | e94a138d644a9b34da61805f7aeb8af595c61b53 | 2024-10-22T09:40:02+02:00 | Daniel Bevenius | | arg : fix typo in embeddings argument help [no ci] (#9994) |
| 1594 | e94a138d644a9b34da61805f7aeb8af595c61b53 | e01c67affe450638162a1a457e2e57859ef6ebf0 | 2024-10-22T00:35:25+03:00 | Georgi Gerganov | | llama.vim : fix info text display [no ci] (#9787) |
| 1595 | 94008cc76075fb4a29ee371e7ac255378d1bce6c | dbd5f2f5736aec6ff8fd63df3b351dae23c43e2f | 2024-10-21T20:12:52+02:00 | Daniel Bevenius | | arg : fix attention non-causal arg value hint (#9985) |
| 1596 | 55e47786e373c90fc7803e718e3e1dd6d53c3db6 | bc219750845a59166d79f0d4ee3da1993b369b8a | 2024-10-21T09:46:40+03:00 | Georgi Gerganov | | llama : default sampling changes + greedy update (#9897) |
| 1597 | bc219750845a59166d79f0d4ee3da1993b369b8a | 1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31 | 2024-10-21T09:37:12+03:00 | Georgi Gerganov | | speculative : fix handling of some input params (#9963) |
| 1598 | 1db8c84fc62857e1e45c1c7ea93bcd5344cb3d31 | 45f097645efb11b6d09a5b4adbbfd7c312ac0126 | 2024-10-21T14:26:09+08:00 | Neo Zhang Jianyu | | fix mul_mat_vec_q and *_vec_q error (#9939) |
| 1599 | cda0e4b648dde8fac162b3430b14a99597d3d74f | afd9909a6481402844aecefa8a8908afdd7f52f1 | 2024-10-18T23:18:01+02:00 | Xuan Son Nguyen | | llama : remove all_pos_0, all_pos_1, all_seq_id from llama_batch (#9745) |
| 1600 | 60ce97c9d809f4b040e90b597468b839df5728d0 | 8901755ba328643c9ab071c20e1939ea52951a0e | 2024-10-18T13:34:36+08:00 | Ma Mingfei | | add amx kernel for gemm (#8998) |
| 1601 | 9f45fc1e9950a496febc575cdd196cd5cad000cc | 99bd4ac28c32cd17c0e337ff5601393b033dc5fc | 2024-10-17T23:26:32+03:00 | Georgi Gerganov | | llama : change warning to debug log |
| 1602 | 21942002780352b4a54f4bd3e5eefa3bc7f14fe6 | 73afe681aa76e818733fc1f30de082c1d6910bcd | 2024-10-17T02:34:22+03:00 | Gilad S. | | fix: allocating CPU buffer with size `0` (#9917) |
| 1603 | 73afe681aa76e818733fc1f30de082c1d6910bcd | 9e041024481f6b249ab8918e18b9477f873b5a5e | 2024-10-17T01:36:51+03:00 | Gilad S. | | fix: use `vm_allocate` to allocate CPU backend buffer on macOS (#9875) |
| 1604 | 9e041024481f6b249ab8918e18b9477f873b5a5e | dbf18e4de9e7aa496871f1555f9f0c8d84567108 | 2024-10-16T19:34:28+02:00 | Daniel Bevenius | | llama : suppress conversion from 'size_t' to 'int' (#9046) |
| 1605 | dbf18e4de9e7aa496871f1555f9f0c8d84567108 | 66c2c93082289325199ae1f773f3b0ab2e399a47 | 2024-10-16T19:24:05+02:00 | Daniel Bevenius | | llava : fix typo in error message [no ci] (#9884) |
| 1606 | 66c2c93082289325199ae1f773f3b0ab2e399a47 | 10433e8b457c4cfd759cbb41fc55fc398db4a5da | 2024-10-16T09:03:24-07:00 | Joe Eli McIlvain | | grammar : fix JSON Schema for string regex with top-level alt. (#9903) |
| 1607 | 1f66b699c48cb5ab3265ed72c48e8549b1674291 | 0e41b300ed28f7fe185d938b2e3d56a0bf7411ed | 2024-10-16T08:35:53Z | Alexey Parfenov | | server : fix the disappearance of the end of the text (#9867) |
| 1608 | becfd387f6919d99ec34b76c2522f90ac250c489 | 755a9b2bf00fbae988e03a47e852b66eaddd113a | 2024-10-16T08:51:46+08:00 | leo-pony | | [CANN] Fix cann compilation error (#9891) |
| 1609 | fbc98b748e7b075e327bcf13237057f647678049 | dcdd535302fc9702a4709be25f56540d65163a44 | 2024-10-15T15:54:55+05:00 | MaggotHATE | | sampling : add XTC sampler (#9742) |
| 1610 | 1bde94dd024b632f98428f4bf2ce483295130779 | 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 | 2024-10-12T16:06:31+03:00 | Georgi Gerganov | | server : remove self-extend features (#9860) |
| 1611 | 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 | 11ac9800aff532715a5bc7991062c68ba3472e6e | 2024-10-12T14:51:54+03:00 | Georgi Gerganov | | server : remove legacy system_prompt feature (#9857) |
| 1612 | 96776405a17034dcfd53d3ddf5d142d34bdbb657 | 7eee341bee09957139789c2d828995953f0fc7ff | 2024-10-11T15:34:45+02:00 | Diego Devesa | | ggml : move more prints to the ggml log system (#9839) |
| 1613 | 7eee341bee09957139789c2d828995953f0fc7ff | 0e9f760eb12546704ef8fa72577bc1a3ffe1bc04 | 2024-10-10T22:57:42+02:00 | Diego Devesa | | common : use common_ prefix for common library functions (#9805) |
| 1614 | c81f3bbb051f8b736e117dfc78c99d7c4e0450f6 | e7022064ab637ccb5f37867196f1802c4a453c91 | 2024-10-09T18:49:52+02:00 | Diego Devesa | | cmake : do not build common library by default when standalone (#9804) |
| 1615 | e7022064ab637ccb5f37867196f1802c4a453c91 | 3dc48fe75ad48f8856118520a267c96f74df8e90 | 2024-10-09T17:00:18+03:00 | Georgi Gerganov | | perplexity : fix integer overflow (#9783) |
| 1616 | dca1d4b58a7f1acf1bd253be84e50d6367f492fd | 458367a90606448a9c0262b276947c9e536086e0 | 2024-10-08T14:21:43+02:00 | Diego Devesa | | ggml : fix BLAS with unsupported types (#9775) |
| 1617 | 458367a90606448a9c0262b276947c9e536086e0 | fa42aa6d8902cc4eaf31866b3b3b7b61b69da930 | 2024-10-08T13:27:04+02:00 | Xuan Son Nguyen | | server : better security control for public deployments (#9776) |
| 1618 | fa42aa6d8902cc4eaf31866b3b3b7b61b69da930 | 6374743747b14db4eb73ce82ae449a2978bc3b47 | 2024-10-08T15:19:53+09:00 | standby24x7 | | scripts : fix spelling typo in messages and comments (#9782) |
| 1619 | 6374743747b14db4eb73ce82ae449a2978bc3b47 | f1af42fa8c925096407c61ff0a3d5d5d669cc535 | 2024-10-07T21:55:08+02:00 | Diego Devesa | | ggml : add backend registry / device interfaces to BLAS backend (#9752) |
| 1620 | d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 | 96b69121033d2b6b951d1b6b1b43f8b4f97dac99 | 2024-10-07T18:27:51+03:00 | Georgi Gerganov | | ggml : add metal backend registry / device (#9713) |
| 1621 | f4b2dcdf4992ef11a854abc9b662624490e37b4c | b6d6c5289f1c9c677657c380591201ddb210b649 | 2024-10-06T13:49:41+03:00 | Georgi Gerganov | | readme : fix typo [no ci] |
| 1622 | 8c475b97b8ba7d678d4c9904b1161bd8811a9b44 | 58b16695e146628481c6b9b8a3b101c0c9bac00f | 2024-10-05T15:55:04+03:00 | Georgi Gerganov | | rerank : use [SEP] token instead of [BOS] (#9737) |
| 1623 | 55951c018d7c107b6ef0a4c8561a6e68183d19d9 | ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee | 2024-10-04T15:46:18+02:00 | Daniel Bevenius | | ggml : fix typo in example usage ggml_gallocr_new (ggml/984) |
| 1624 | ff565769f289c6adcc91ed1b8fdabaf9a0d4f6ee | f3fdcfaa79afa12047def3a8793d4a566e0532d4 | 2024-10-04T08:41:40+02:00 | Diego Devesa | | ggml : fixes after sync (ggml/983) |
| 1625 | 133c7b46b3482f7c126c0c4ba14265f684138306 | d5ed2b929d85bbd7dbeecb690880f07d9d7a6077 | 2024-10-04T10:54:44+02:00 | Daniel Kleine | | Fixed RNG seed docs (#9723) |
| 1626 | 5d5ab1e5cca0d6d63701a1cb85dbe26cb57d2c4e | a7ad553513a5d70b4ceacd36f64705cf3654dc97 | 2024-10-03T11:01:46-07:00 | Jack Mousseau | | metal : fix compute pass descriptor autorelease crash (#9718) |
| 1627 | d6fe7abf04e8ec5240dead6e2773ed1b7e7495d3 | e3c355ba654d4164c1c09e5d0dcacecb8b214af8 | 2024-10-03T12:39:03-03:00 | bandoti | | ggml: unify backend logging mechanism (#9709) |
| 1628 | 5639971466ed74386a1811938022f0c333007b55 | c83ad6d01e7b89ec71080d97c7e5db7ac1f4fda6 | 2024-10-03T07:50:44+01:00 | Ouadie EL FAROUKI | | Fixed dequant precision issues in Q4_1 and Q5_1 (#9711) |
| 1629 | a39ab216aa624308fda7fa84439c6b61dc98b87a | f536f4c4391bec74c432a924625c04e8c484d3ee | 2024-10-02T15:49:55+02:00 | Xuan Son Nguyen | | llama : reduce compile time and binary size (#9712) |
| 1630 | e98c1c188ebbeb55d0cd6389ad03f0cbf995b451 | cb00020504416606601f8cb35f55ee07b710b4b7 | 2024-09-30T09:55:23+02:00 | Johannes Gäßler | | test: fix OPT_STEP_ADAMW for test-backend-ops (ggml/974) |
| 1631 | cb00020504416606601f8cb35f55ee07b710b4b7 | 6c5322481a75f1be54e58a000c3f78484d07f948 | 2024-09-30T09:14:09+02:00 | Salvatore Mesoraca | | vulkan : mul_mat: fix UB with small warps (ggml/952) |
| 1632 | 6c5322481a75f1be54e58a000c3f78484d07f948 | 7254cdf7e8d6312840509ca8d766358c687c6266 | 2024-09-30T10:11:41+03:00 | Borislav Stanimirov | | ggml : fix ggml_cast (ggml/973) |
| 1633 | 7254cdf7e8d6312840509ca8d766358c687c6266 | cad341d88924788b940997c55e7bef000c99e784 | 2024-09-29T23:18:02+02:00 | Johannes Gäßler | | ggml: fix gradient allocation logic (ggml/966) |
| 1634 | 1927378bcce20ba72b6c89d5977b854a4bcaeb5d | 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 | 2024-10-01T02:31:36-04:00 | compilade | | convert : refactor rope_freqs generation (#9396) |
| 1635 | 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 | 511636df0c90826b4dd1fc21ff260c19d69a3b5d | 2024-09-30T21:57:12+03:00 | serhii-nakon | | Fix Docker ROCM builds, use AMDGPU_TARGETS instead of GPU_TARGETS (#9641) |
| 1636 | 8277a817f18967581b02b2248989d773e8e99998 | c919d5db39c8a7fcb64737f008e4b105ee0acd20 | 2024-09-30T13:53:42+05:30 | Ruchira Hasaranga | | console : utf-8 fix for windows stdin (#9690) |
| 1637 | 0de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c | 544f409b4bd8fc98a3e87820f0ac934e00402de7 | 2024-09-27T02:58:01-05:00 | Jeff Bolz | | vulkan : fix build for GGML_VULKAN_RUN_TESTS, add TFLOPS to log (ggml/961) |
| 1638 | 544f409b4bd8fc98a3e87820f0ac934e00402de7 | 6084bfb261b03f812de2255b05b6b5bb8d1c7171 | 2024-09-26T08:59:42+02:00 | Salvatore Mesoraca | | vulkan : argsort barriers must be under uniform control flow (ggml/951) |
| 1639 | 6084bfb261b03f812de2255b05b6b5bb8d1c7171 | faac0bae265449fd988c57bf894018edc36fbe1e | 2024-09-24T13:23:59+03:00 | Georgi Gerganov | | ggml : fix GGML_MAX_N_THREADS + improve formatting (ggml/969) |
| 1640 | faac0bae265449fd988c57bf894018edc36fbe1e | f99d3f8367174f7aba73c07fd87de687d4a0ece1 | 2024-09-29T05:25:00-07:00 | matiaslin | | common : ensure llama_batch size does not exceed max size (#9668) |
| 1641 | f4d2b8846a6b34419ff9e9491aee6cd95e444bfc | 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 | 2024-09-28T17:42:03+03:00 | Georgi Gerganov | | llama : add reranking support (#9510) |
| 1642 | 6102037bbb55521880ae78a6ee6c2a0c00c901df | 9a913110cf471a8287ac06c43cbe307d3cf6df99 | 2024-09-28T20:10:58+08:00 | Zhenwei Jin | | vocab : refactor tokenizer to reduce init overhead (#9449) |
| 1643 | 9a913110cf471a8287ac06c43cbe307d3cf6df99 | 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 | 2024-09-28T12:08:43Z | nopperl | | llama : add support for Chameleon (#8543) |
| 1644 | ea9c32be71b91b42ecc538bd902e93cbb5fb36cb | 1e436302188a704ac9ea044af03193648806f19c | 2024-09-25T17:26:01+02:00 | Xuan Son Nguyen | | ci : fix docker build number and tag name (#9638) |
| 1645 | 1e436302188a704ac9ea044af03193648806f19c | afbbfaa537a96f562c34df4542930fa951b40d9e | 2024-09-25T15:12:20+02:00 | Charles Xu | | ggml : remove assert for AArch64 GEMV and GEMM Q4 kernels (#9217) |
| 1646 | 3d6bf6919f7b10726421779cd344f2da05421c68 | 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 | 2024-09-25T01:06:52-06:00 | Gabe Goodhart | | llama : add IBM Granite MoE architecture (#9438) |
| 1647 | 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 | 70392f1f81470607ba3afef04aa56c9f65587664 | 2024-09-25T11:30:38+08:00 | Dou Xinpeng | | cann: fix crash when llama-bench is running on multiple cann devices (#9627) |
| 1648 | c038931615d2525d732943fa8661e29aa361b192 | 31ac5834fe75c296476658a124c06c84772aa641 | 2024-09-20T21:50:16+03:00 | Georgi Gerganov | | examples : adapt to ggml.h changes (ggml/0) |
| 1649 | b0f27361f3539a81d983a8b045f3c61e682d9fc0 | c087b6f11d3385f4293b6841ebfb755063479490 | 2024-09-24T09:03:17+03:00 | Georgi Gerganov | | sampling : avoid expensive softmax during greedy sampling (#9605) |
| 1650 | c087b6f11d3385f4293b6841ebfb755063479490 | 116efee0eef09d8c3c4c60b52fa01b56ddeb432c | 2024-09-23T21:18:48-07:00 | Max Krasnyansky | | threads: fix msvc build without openmp (#9615) |
| 1651 | 116efee0eef09d8c3c4c60b52fa01b56ddeb432c | 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 | 2024-09-24T03:14:24+03:00 | Ivan | | cuda: add q8_0->f32 cpy operation (#9571) |
| 1652 | 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 | f0c7b5edf82aa200656fd88c11ae3a805d7130bf | 2024-09-23T22:23:54+02:00 | Xuan Son Nguyen | | server : add --no-context-shift option (#9607) |
| 1653 | f0c7b5edf82aa200656fd88c11ae3a805d7130bf | 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 | 2024-09-23T11:42:43-07:00 | Max Krasnyansky | | threads: improve ggml_barrier scaling with large number of threads (#9598) |
| 1654 | 912c331d3dba3a079815844208dc36164baa8cc7 | a5b57b08ce1998f7046df75324e86b9e2561c7af | 2024-09-22T21:26:50+08:00 | Molly Sophia | | Fix merge error in #9454 (#9589) |
| 1655 | d09770cae71b416c032ec143dda530f7413c4038 | 41f477879fd5ccc31211634292e8e293ec700e85 | 2024-09-21T14:24:23+02:00 | slaren | | ggml-alloc : fix list of allocated tensors with GGML_ALLOCATOR_DEBUG (#9573) |
| 1656 | 41f477879fd5ccc31211634292e8e293ec700e85 | e948a7da7af7f2dbfdcd695b3ba903ab12575f78 | 2024-09-21T01:41:07+01:00 | agray3 | | Update CUDA graph on scale change plus clear nodes/params (#9550) |
| 1657 | 63351143b2ea5efe9f8b9c61f553af8a51f1deff | d13edb17ed1ce3b961016cbdb616b1c8d161c026 | 2024-09-20T20:55:36+02:00 | slaren | | quantize : improve type name parsing (#9570) |
| 1658 | d13edb17ed1ce3b961016cbdb616b1c8d161c026 | 27609c49b94766a136764ce7919c8a082bf71548 | 2024-09-20T20:12:52+03:00 | Georgi Gerganov | | ggml : fix builds (#0) |
| 1659 | 27609c49b94766a136764ce7919c8a082bf71548 | 43015353262de835215103475055b74045cb9f49 | 2024-09-20T19:13:02+03:00 | Georgi Gerganov | | ggml : fix trailing whitespace (#0) |
| 1660 | 424c5d00a9b97dd5559635872db9b57f87c23b02 | a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 | 2024-09-20T19:04:44+03:00 | Johannes Gäßler | | ggml/examples: add backend support for numerical optimization (ggml/949) |
| 1661 | a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 | 5cb12f68395a5ec00b357e408883ce124a11dcdb | 2024-09-08T11:10:43+03:00 | Georgi Gerganov | | examples : add null threadpool args where needed (ggml/0) |
| 1662 | 5cb12f68395a5ec00b357e408883ce124a11dcdb | d39e26741f9f02340651dbc640c9776e1a1128ef | 2024-09-20T18:35:35+02:00 | Johannes Gäßler | | CUDA: fix sum.cu compilation for CUDA < 11.7 (#9562) |
| 1663 | 722ec1eb51ed53be2ab1ef31c6a1da8261803c71 | 6026da52d6942b253df835070619775d849d0258 | 2024-09-20T08:38:10+02:00 | Sigbjørn Skjæret | | perplexity : do not escape input data by default (#9548) |
| 1664 | eca0fab44eb449ed34e17a9b651ae7398b494117 | 64c6af3195c3cd4aa3328a1282d29cd2635c34c9 | 2024-09-19T09:58:14+02:00 | Sigbjørn Skjæret | | imatrix : disable prompt escape by default (#9543) |
| 1665 | 64c6af3195c3cd4aa3328a1282d29cd2635c34c9 | 0d2f22e45c3c3b6f8222acb6284d0c8c93443ba1 | 2024-09-18T19:13:08+02:00 | slaren | | ggml : fix n_threads_cur initialization with one thread (#9538) |
| 1666 | 6443ddd98576a9da904ef9f07df4e4398bb6a01a | 8a308354f6520df6bea851b435bd8054ee5617b4 | 2024-09-18T13:42:36+02:00 | Daniel Bevenius | | llama : use reserve/emplace_back in sampler_sample (#9534) |
| 1667 | f799155ab8279cfa668086ce584aa52ecc05f5e5 | faf67b3de4688f47c3b1019c89df255df2fd59b4 | 2024-09-18T14:28:20+08:00 | Eric Zhang | | server : fix OpenSSL build (remove obsolete `LOG_INFO`) (#9529) |
| 1668 | faf67b3de4688f47c3b1019c89df255df2fd59b4 | 7be099fa817e9c53ffb4c3ed7d063e1cffcd675a | 2024-09-18T08:30:31+08:00 | Neo Zhang Jianyu | | [SYCL]set context default value to avoid memory issue, update guide (#9476) |
| 1669 | 7be099fa817e9c53ffb4c3ed7d063e1cffcd675a | 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb | 2024-09-17T22:41:38+02:00 | Michael Podvitskiy | | llama-bench: correct argument parsing error message (#9524) |
| 1670 | 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 | 0226613853133c081b55bb892a41bb5eacc0bc94 | 2024-09-17T12:18:22+02:00 | Michael Podvitskiy | | llama : fix n_vocab init for 'no_vocab' case (#9511) |
| 1671 | 0226613853133c081b55bb892a41bb5eacc0bc94 | 503147a9f9d195d6a14e7c998df23b6eb61f2bae | 2024-09-17T01:19:46-07:00 | Max Krasnyansky | | threadpool : skip polling for unused threads (#9461) |
| 1672 | 0d2ec438330271d201c2e9224aca23d0d5c908bf | 37f3a3810e545be6ac835c726f97956c1403ea02 | 2024-09-17T00:44:58-06:00 | Gabe Goodhart | | llama : support IBM Granite architecture (#9412) |
| 1673 | acb2c32c336ce60d765bb189563cc216e57e9fc2 | a6a3a5c531c73aef85750a847d21e7d4671e723d | 2024-09-16T13:07:13+02:00 | Daniel Bevenius | | llama : rename n_embed to n_embd in rwkv6_time_mix (#9504) |
| 1674 | 5c3d0f1824714e9a97fc9b06e046eefcb6ecc721 | 0aadac10c7dd704f8285ddf5a63d6f764cb340aa | 2024-09-16T06:48:24Z | Eve | | ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422) |
| 1675 | 441b72b91f818fe69497e5816f87969e90c73c43 | c4965a64f72ac9434c21cf0e1c3421d13e889155 | 2024-09-16T01:20:01-05:00 | Vinesh Janarthanan | | main : option to disable context shift (#9484) |
| 1676 | e6deac31f7e62db43b6afbc3be814f764fd5a187 | 6988da94a261444859f78595899212eeedc5ff9d | 2024-09-15T19:02:27+02:00 | slaren | | gguf-split : add basic checks (#9499) |
| 1677 | d6b37c881f056bd32b681dcd7658a37ea6ec3a1e | 7596487bebd58eade3cd0133d42a9008aaaf9d09 | 2024-09-15T10:36:53+03:00 | OSecret | | readme : update tools list (#9475) |
| 1678 | 7596487bebd58eade3cd0133d42a9008aaaf9d09 | 822b6322dea704110797a5671fc80ae39ee6ac97 | 2024-09-15T09:06:38+02:00 | Michael Podvitskiy | | cmake : try to fix sycl+intel build (#9487) |
| 1679 | 1f4111e540bacec8d00ca9fd96417bf4c1339394 | befaf1197fa447f61714de041828852a270659d2 | 2024-09-14T10:55:05+03:00 | Georgi Gerganov | | cmake : use list(APPEND ...) instead of set() + dedup linker (#9463) |
| 1680 | befaf1197fa447f61714de041828852a270659d2 | feff4aa8461da7c432d144c11da4802e41fef3cf | 2024-09-14T09:50:12+02:00 | Daniel Bevenius | | llama : make cell_id const in inp_s_mask block (#9470) |
| 1681 | feff4aa8461da7c432d144c11da4802e41fef3cf | 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 | 2024-09-13T14:23:11+02:00 | Xuan Son Nguyen | | server : add loading html page while model is loading (#9468) |
| 1682 | 0abc6a2c25272d5cf01384dda8ee8bfec4ba8745 | bd35cb0ae357185c173345f10dc89a4ff925fc25 | 2024-09-13T09:53:38+03:00 | Georgi Gerganov | | llama : llama_perf + option to disable timings during decode (#9355) |
| 1683 | bd35cb0ae357185c173345f10dc89a4ff925fc25 | 78203641fee3b1f82abaff0c7f667e1b4a286390 | 2024-09-13T04:54:49+03:00 | Gilad S. | | feat: remove a sampler from a chain (#9445) |
| 1684 | 78203641fee3b1f82abaff0c7f667e1b4a286390 | e6b7801bd189d102d901d3e72035611a25456ef1 | 2024-09-12T22:30:11+02:00 | Mathijs Henquet | | server : Add option to return token pieces in /tokenize endpoint (#9108) |
| 1685 | e6b7801bd189d102d901d3e72035611a25456ef1 | e665744317c77fc3483fc5224fe6d586b5166b33 | 2024-09-12T19:46:43+08:00 | Dou Xinpeng | | cann: Add host buffer type for Ascend NPU (#9406) |
| 1686 | e665744317c77fc3483fc5224fe6d586b5166b33 | d4c3c10fad1bd6adec72d2f1f236761a8d6a07f8 | 2024-09-12T19:34:22+08:00 | fengerhu1 | | llava : fix the script error in MobileVLM README (#9054) |
| 1687 | d4c3c10fad1bd6adec72d2f1f236761a8d6a07f8 | 2a825116b6f7f3a9b1726e5e0c3eb22f7768bd33 | 2024-09-12T13:33:57+02:00 | Xuan Son Nguyen | | lora : raise error if lm_head is ignored (#9103) |
| 1688 | 2a825116b6f7f3a9b1726e5e0c3eb22f7768bd33 | 4dc4f5f14ae522494649d82ad06b031cf9501038 | 2024-09-12T13:30:01+02:00 | Michael Podvitskiy | | cmake : fix for builds without `GGML_CDEF_PUBLIC` (#9338) |
| 1689 | ff76e18516dbe269b35ba1bb500524ed5e39225c | 39f852f44039b058fdd0611ee127c6efa7ba4a04 | 2024-09-12T13:27:14+02:00 | Michael Podvitskiy | | cmake : fixed the order of linking libraries for llama-quantize (#9450) |
| 1690 | d6a04f872dea8ade92527bb1488d4b0b90cc49f0 | c9c8575a1a8a170329afca4c4df4c005806efb1d | 2024-09-12T14:23:49+03:00 | Georgi Gerganov | | ggml : hide ggml_object, ggml_cgraph, ggml_hash_set (#9408) |
| 1691 | c9c8575a1a8a170329afca4c4df4c005806efb1d | df4b7945aeccae2a71348e5a9c1eab5241e3e0ef | 2024-09-12T17:44:17+08:00 | Neo Zhang Jianyu | | enhance run script to be easy to change the parameters (#9448) |
| 1692 | df4b7945aeccae2a71348e5a9c1eab5241e3e0ef | 449ccfb6f5f1bbd70e04f75a330d9d7c1af82187 | 2024-09-12T09:02:35+08:00 | Xinpeng Dou | | cann: Fix error when running a non-exist op (#9424) |
| 1693 | 8db003a19d7055b5bd248ce2afff9324e5b8da95 | 0996c5597f680effacc046832bb807c14900e22d | 2024-09-11T15:29:51+03:00 | Pavel Zloi | | py : support converting local models (#7547) |
| 1694 | 67155ab7f5e47c01b62aa989eab30f517bf6dc67 | 5af118efdaf1098798a06b24fd8a557760e99631 | 2024-09-11T12:52:37+03:30 | Farbod Bijary | | feat: Implements retrying logic for downloading models using --model-url flag (#9255) |
| 1695 | 5af118efdaf1098798a06b24fd8a557760e99631 | d2b496bff4f353a6429f8e833448f071bd237ba7 | 2024-09-11T10:22:40+02:00 | Johannes Gäßler | | CUDA: fix --split-mode row race condition (#9413) |
| 1696 | 00ba2ff78100e187ae17987bacd1c916211718b2 | 83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1 | 2024-09-10T10:17:03+03:00 | Georgi Gerganov | | metal : fix compile warning with GGML_METAL_NDEBUG (#0) |
| 1697 | 83008b7cfe90ad89d0c0ed2c2424fd75edc25ac1 | 0b4ac75772b744bb0a0d674927587621d1057884 | 2024-09-10T09:03:21+02:00 | Daniel Bevenius | | llama : update llm_build_copy_mask_state comment [no ci] (#9385) |
| 1698 | bfe76d4a17228bfd1565761f203123bc4914771b | 293bebe0773c907c0c866213856eeba41b035df1 | 2024-09-09T23:36:09+02:00 | Xuan Son Nguyen | | common : move arg parser code to `arg.cpp` (#9388) |
| 1699 | 293bebe0773c907c0c866213856eeba41b035df1 | 5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2 | 2024-09-09T18:40:10+03:00 | Radoslav Gerganov | | rpc : fix segfault with nkvo (#9389) |
| 1700 | 5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2 | 5fb5e24811cb01d48b482c15a974bfbd9f433e1d | 2024-09-09T21:07:18+05:30 | Prashant Vithule | | ggml : vector length agnostic SVE support (#9290) |
| 1701 | 8e6e2fbe1458ac91387266241262294a964d6b95 | 5ed087573e1f326cfa70e29c1895d074a7a1a00c | 2024-09-09T14:22:53+02:00 | Johannes Gäßler | | CUDA: fix variable name conflict for Windows build (#9382) |
| 1702 | 5ed087573e1f326cfa70e29c1895d074a7a1a00c | 54f376d0b92c6ff6feb1fa2ef8ed2022348100ba | 2024-09-09T14:21:38+03:00 | Antonis Makropoulos | | readme : add LLMUnity to UI projects (#9381) |
| 1703 | daa9623ab051a8162ae750b150b9522571b55f21 | e079bffb6678e1b5ded21c719600bedd7175e726 | 2024-09-08T21:43:48+02:00 | Markus Tavenrath | | Overlap cmdbuffer creation and cmdbuffer execution in Vulkan backend by submitting smaller cmdbuffers early. (#9118) |
| 1704 | e079bffb6678e1b5ded21c719600bedd7175e726 | 3f7ccfd649abc83d059b5462221ac14de4ede6b7 | 2024-09-08T22:01:02+03:00 | Georgi Gerganov | | cuda : fix FA Q src index (1 -> 0) (#9374) |
| 1705 | 3f7ccfd649abc83d059b5462221ac14de4ede6b7 | a249843d89bd6373772eede26d7f2aa708b26600 | 2024-09-08T18:08:55+02:00 | Xuan Son Nguyen | | common : bring back missing args, add env var duplication check (#9375) |
| 1706 | 00b02bb249406ec0123757a67a5b714c3f33a699 | a8768614558262b6762fc0feeddcc6f7ce4bc5fc | 2024-09-08T12:12:17+02:00 | Xuan Son Nguyen | | imatrix : fix arg parser for imatrix (#9366) |
| 1707 | a8768614558262b6762fc0feeddcc6f7ce4bc5fc | 385decbd632f70db9f1fbd93dbb2b908853e135c | 2024-09-08T09:57:57+03:00 | Georgi Gerganov | | metal : update support condition for im2col + fix warning (#0) |
| 1708 | 406c1a32a18807b9b5711aa2fa1859527106bc1d | 9cb9260861e464e40d38764cfb021856786c7202 | 2024-09-06T14:34:25+02:00 | Salvatore Mesoraca | | vulkan: add dryrun support to sin and cos ops (ggml/947) |
| 1709 | 9cb9260861e464e40d38764cfb021856786c7202 | 202084d31d4247764fc6d6d40d2e2bda0c89a73a | 2024-09-06T14:34:07+02:00 | Salvatore Mesoraca | | vulkan: correctly report support for OP_CONT (ggml/946) |
| 1710 | dbbebcab339c7d63d3806e8f32574bb9aad9a694 | ba1cf846edeb94fc567a9ab0f7ef705282e6d7d3 | 2024-08-31T14:35:42+02:00 | Johannes Gäßler | | ggml: fix ggml_graph_cpy undefined behavior (ggml/943) |
| 1711 | ba1cf846edeb94fc567a9ab0f7ef705282e6d7d3 | d2d3200b385970cb2a4658fd9342a3b1212bdb46 | 2024-08-28T18:45:01+03:00 | Georgi Gerganov | | cann : fix doxy (ggml/0) |
| 1712 | efe6a83e3046a94cda38c8be5a7801eadc21d78d | fbb7fcffbcfc50009c275e75982b1603a6cb6b80 | 2024-08-28T10:23:02+02:00 | Salvatore Mesoraca | | ggml : fix cont with transposed tensors when one dimension is 1 (ggml/934) |
| 1713 | a5b5d9a1014248f385939e6739e9db9de7147e55 | f12295b8a9336962bf02a359beb1be0d322b4be7 | 2024-09-08T00:33:50+03:00 | Georgi Gerganov | | llama.android : fix build (#9350) |
| 1714 | f12295b8a9336962bf02a359beb1be0d322b4be7 | faf69d4237c9ae4d7f572b4674d1002463e8acd3 | 2024-09-08T00:33:33+03:00 | Georgi Gerganov | | llama : fix empty ring buffer push (#9358) |
| 1715 | faf69d4237c9ae4d7f572b4674d1002463e8acd3 | e536426ded3fb4a8cd13626e53508cd92928d6c2 | 2024-09-08T00:33:13+03:00 | Georgi Gerganov | | llama : sanitize invalid tokens (#9357) |
| 1716 | 1b9ae5189cd279c6b45e36d43e4f9ccae628d02f | e32d0816edfd247784f6780b0bb9ae0bceef5e47 | 2024-09-07T20:43:51+02:00 | Xuan Son Nguyen | | common : refactor arg parser (#9308) |
| 1717 | 947538acb8617756a092042ff7e58db18dde05ec | 6c89eb0b4749184f4d19e96ada5dcb8847129b9c | 2024-09-07T12:01:34+02:00 | Xuan Son Nguyen | | ggml : fix missing `cpu_set_t` on emscripten (#9336) |
| 1718 | 9b2c24c0993487d3b34a873980e292da571481f3 | 134bc38ecf3e2c5460581badce289a1ffa680453 | 2024-09-06T23:21:29+02:00 | Xuan Son Nguyen | | server : simplify state machine for slot (#9283) |
| 1719 | 409dc4f8bb5185786087f52259ee4626be93f54d | 4a1411b4f17b6569dc0a067e5914dcc0f738b370 | 2024-09-06T21:54:50+09:00 | Changyeon Kim | | ggml : fix build break for the vulkan-debug (#9265) |
| 1720 | 4a1411b4f17b6569dc0a067e5914dcc0f738b370 | 8ebe8ddebd68526757c631cd019de009697c63c2 | 2024-09-06T14:06:04+02:00 | Xuan Son Nguyen | | server : fix missing lock (#9334) |
| 1721 | 8ebe8ddebd68526757c631cd019de009697c63c2 | 9bc6db28d011d47a5f318dc4aebbe7927fac4629 | 2024-09-06T08:56:17+02:00 | Markus Tavenrath | | Improve Vulkan shader build system (#9239) |
| 1722 | 9bc6db28d011d47a5f318dc4aebbe7927fac4629 | 32b2ec88bc44b086f3807c739daf28a1613abde1 | 2024-09-05T21:48:47-04:00 | compilade | | ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151) |
| 1723 | 1031771faaba28d07b4ec6a812cb21532efc8c31 | 4db04784f96757d74f74c8c110c2a00d55e33514 | 2024-09-06T00:14:12+02:00 | Michael Podvitskiy | | CMake fix: host for msvc compiler can only be x86 or x64 (#8624) |
| 1724 | 4db04784f96757d74f74c8c110c2a00d55e33514 | bdf314f38a2c90e18285f7d7067e8d736a14000a | 2024-09-05T11:13:11+02:00 | slaren | | cuda : fix defrag with quantized KV (#9319) |
| 1725 | bdf314f38a2c90e18285f7d7067e8d736a14000a | 581c305186a0ff93f360346c57e21fe16e967bb7 | 2024-09-05T02:19:39+02:00 | slaren | | llama-bench : fix NUL terminators in CPU name (#9313) |
| 1726 | 581c305186a0ff93f360346c57e21fe16e967bb7 | 5910ea942772ab6cbc21d0ad2d1208750ba39e1d | 2024-09-04T22:21:22+05:30 | Srihari-mcw | | ggml : AVX2 support for Q4_0_8_8 (#8713) |
| 1727 | 5910ea942772ab6cbc21d0ad2d1208750ba39e1d | c8671ae28214b29920b86c66a5d36fd6dd0db870 | 2024-09-04T16:26:33+01:00 | Ouadie EL FAROUKI | | [SYCL] Fix DMMV dequantization (#9279) |
| 1728 | c8671ae28214b29920b86c66a5d36fd6dd0db870 | 82e3b03c11826d20a24ab66d60f4de58f48ddcdb | 2024-09-04T19:45:28+08:00 | 杨朱 · Kiki | | Fix broken links in docker.md (#9306) |
| 1729 | f1485161e58d562099dd050f8ac3a9ea9f4cd765 | 048de848ee4baad4531fcd6239438f5d55be365c | 2024-09-03T01:53:23+08:00 | Zhenwei Jin | | src: make tail invalid when kv cell is intersection for mamba (#9249) |
| 1730 | 048de848ee4baad4531fcd6239438f5d55be365c | f771d064a95d212ddadea452ad0cc1e42b2c3db3 | 2024-09-02T18:11:13+02:00 | slaren | | docker : fix missing binaries in full-cuda image (#9278) |
| 1731 | 6e7d133a5f9409dd257fad90d7f320721b07a1b2 | b60074f1c26d8354053a952844ef3f7ebefd8803 | 2024-09-02T17:11:51+02:00 | Xuan Son Nguyen | | server : refactor multitask handling (#9274) |
| 1732 | 9c1ba557335c3cab46807e6478eb7d17a63361f1 | c6d4cb46559b359d2682cf2a002e7fe01bb7a767 | 2024-09-02T16:51:01+05:30 | Tushar | | build(nix): Package gguf-py (#5664) |
| 1733 | 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c | a47667cff41f5a198eb791974e0afcc1cddd3229 | 2024-09-01T22:38:17+08:00 | Molly Sophia | | llama : support RWKV v6 models (#8980) |
| 1734 | a47667cff41f5a198eb791974e0afcc1cddd3229 | ea5d7478b1edcfc83f8ea8f9f0934585cc0b92e3 | 2024-08-22T17:19:14-04:00 | Echo Nolan | | nix: fix CUDA build - replace deprecated autoAddOpenGLRunpathHook |
| 1735 | 49271efbaf3f7a4ae52c4ca299b6d4e82598a97d | 0ab30f8d82fc7156b750c194d64a887e80cbfb82 | 2024-08-31T09:50:22+02:00 | Daniel Bevenius | | llama : fix typo in xcda_array_view comment [no ci] (#9132) |
| 1736 | 0ab30f8d82fc7156b750c194d64a887e80cbfb82 | cddae4884c853b1a7ab420458236d666e2e34423 | 2024-08-31T03:08:10+09:00 | Sutou Kouhei | | llama : fix llama_split_mode enum values in main_gpu document (#9057) |
| 1737 | 42c76d1358021ccdbe8ba89109c143dd7ae166df | 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b | 2024-08-29T19:20:53-04:00 | Faisal Zaghloul | | Threadpool: take 2 (#8672) |
| 1738 | 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b | 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 | 2024-08-27T18:28:06+08:00 | Jan Boon | | server : fix crash when error handler dumps invalid utf-8 json (#9195) |
| 1739 | 20f1789dfb4e535d64ba2f523c64929e7891f428 | 231cff5f6f1c050bcb448a8ac5857533b4c05dc7 | 2024-08-27T22:10:58+03:00 | Georgi Gerganov | | vulkan : fix build (#0) |
| 1740 | 3246fe84d78c8ccccd4291132809236ef477e9ea | 78eb487bb0038eae95506d3d832b94c979185b09 | 2024-08-27T20:33:08+08:00 | Xie Yanbo | | Fix minicpm example directory (#9111) |
| 1741 | 78eb487bb0038eae95506d3d832b94c979185b09 | a77feb5d71831c61e455541e8a655b9f0337ea8c | 2024-08-27T06:09:23-04:00 | compilade | | llama : fix qs.n_attention_wv for DeepSeek-V2 (#9156) |
| 1742 | 2e59d61c1b321431c597c1f12249273427d5640d | 75e1dbbaaba5d762223370f3dab9db24a7f53465 | 2024-08-27T14:58:22+08:00 | CausalLM | | llama : fix ChatGLM4 wrong shape (#9194) |
| 1743 | 75e1dbbaaba5d762223370f3dab9db24a7f53465 | ad76569f8e78ab6ca921bda25cef25a157361719 | 2024-08-27T08:53:40+02:00 | Carsten Kragelund Jørgensen | | llama : fix llama3.1 rope_freqs not respecting custom head_dim (#9141) |
| 1744 | ad76569f8e78ab6ca921bda25cef25a157361719 | 7d787ed96c32be18603c158ab0276992cf0dc346 | 2024-08-26T22:58:50-07:00 | arch-btw | | common : Update stb_image.h to latest version (#9161) |
| 1745 | 7d787ed96c32be18603c158ab0276992cf0dc346 | 06658ad7c37f440502de2b9486ce43c47b4ec710 | 2024-08-26T19:44:43+02:00 | slaren | | ggml : do not crash when quantizing q4_x_x with an imatrix (#9192) |
| 1746 | 879275ac984235373dd44ed780d5e3a3883cb558 | 7a3df798fc43e1b366146b1ad99137a9e95c87dd | 2024-08-26T16:30:25+03:00 | Georgi Gerganov | | tests : fix compile warnings for unreachable code (#9185) |
| 1747 | 436787f170329b3f549e6c2c46593d2af8482e7c | 93bc3839f980ff14be86efe408b4cd7e89b26835 | 2024-08-25T23:09:53-07:00 | Justine Tunney | | llama : fix time complexity of string replacement (#9163) |
| 1748 | 93bc3839f980ff14be86efe408b4cd7e89b26835 | f91fc5639be1e272194303ea26e1d4c226ec981b | 2024-08-25T22:54:37Z | Herman Semenov | | common: fixed not working find argument --n-gpu-layers-draft (#9175) |
| 1749 | f91fc5639be1e272194303ea26e1d4c226ec981b | e11bd856d538e44d24d8cad4b0381fba0984d162 | 2024-08-25T22:11:48+02:00 | Johannes Gäßler | | CUDA: fix Gemma 2 numerical issues for FA (#9166) |
| 1750 | 8f824ffe8ee1feadd14428f1dda1283fa3b933be | 3ba780e2a8f0ffe13f571b27f0bbf2ca5a199efc | 2024-08-24T07:22:45+01:00 | João Dinis Ferreira | | quantize : fix typo in usage help of `quantize.cpp` (#9145) |
| 1751 | 3ba780e2a8f0ffe13f571b27f0bbf2ca5a199efc | a07c32ea54850c989f0ef6989da5b955b77b7172 | 2024-08-23T12:58:53+02:00 | Xuan Son Nguyen | | lora : fix llama conversion script with ROPE_FREQS (#9117) |
| 1752 | a1631e53f6763e17da522ba219b030d8932900bd | fc54ef0d1c138133a01933296d50a36a1ab64735 | 2024-08-21T17:58:11-04:00 | compilade | | llama : simplify Mamba with advanced batch splits (#8526) |
| 1753 | b40eb84895bf723c7b327a1e3bf6e0e2c41877f8 | f63f603c879c2232eaeded8c0aeba4244471d720 | 2024-08-21T12:06:36+04:00 | Younes Belkada | | llama : support for `falcon-mamba` architecture (#9074) |
| 1754 | 2f3c1466ff46a2413b0e363a5005c46538186ee6 | 50addec9a532a6518146ab837a85504850627316 | 2024-08-21T04:00:00+09:00 | Changyeon Kim | | llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984) |
| 1755 | 4f8d19ff17faa601f456ee1db7d8b8a15fa3f90b | 90db8146d56d83a605f2c475eca39bcda29cf16d | 2024-08-20T23:06:51+08:00 | zhentaoyu | | [SYCL] Fix SYCL `im2col` and `convert` Overflow with Large Dims (#9052) |
| 1756 | 1b6ff90ff8301d9fe2027be2bb9fea26177d775e | 18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 | 2024-08-19T10:11:45+03:00 | Radoslav Gerganov | | rpc : print error message when failed to connect endpoint (#9042) |
| 1757 | 18eaf29f4c5f7c8e89412f3a9a0392a9e4e01d75 | 554b049068de24201d19dde2fa83e35389d4585d | 2024-08-19T10:10:21+03:00 | Radoslav Gerganov | | rpc : prevent crashes on invalid input (#9040) |
| 1758 | 2339a0be1c8e31fcf4531427183b94f2ef019e56 | 2fb9267887d24a431892ce4dccc75c7095b0d54d | 2024-08-18T10:58:04+01:00 | ltoniazzi | | tests : add integration test for lora adapters (#8957) |
| 1759 | 2fb9267887d24a431892ce4dccc75c7095b0d54d | 8b3befc0e2ed8fb18b903735831496b8b0c80949 | 2024-08-17T06:34:21-07:00 | Yoshi Suhara | | Fix incorrect use of ctx_split for bias tensors (#9063) |
| 1760 | 8b3befc0e2ed8fb18b903735831496b8b0c80949 | d565bb2fd5a2a58b9924a7a34e77a87c78c52137 | 2024-08-16T17:19:05+02:00 | Xuan Son Nguyen | | server : refactor middleware and /health endpoint (#9056) |
| 1761 | d565bb2fd5a2a58b9924a7a34e77a87c78c52137 | ee2984bdaf10c14d440ad873a049bcc09b786d9b | 2024-08-16T21:34:41+08:00 | tc-mb | | llava : support MiniCPM-V-2.6 (#8967) |
| 1762 | ee2984bdaf10c14d440ad873a049bcc09b786d9b | c8ddce85606d9fb6e30745b6e4fe103eecadc73f | 2024-08-16T14:06:30+03:30 | Farbod Bijary | | py : fix wrong input type for raw_dtype in ggml to gguf scripts (#8928) |
| 1763 | c8ddce85606d9fb6e30745b6e4fe103eecadc73f | 23fd4535445e3e859ded2f02d6142b6e93b43890 | 2024-08-16T19:08:59+10:00 | Aisuko | | Fix inference example lacks required parameters (#9035) |
| 1764 | c679e0cb5c378bfb63643c44a453345ba8b90126 | fb487bb5671b37267f35ff43fe8849ddccd925cd | 2024-08-16T15:35:18+09:00 | Minsoo Cheong | | llama : add EXAONE model support (#9025) |
| 1765 | fb487bb5671b37267f35ff43fe8849ddccd925cd | 2a24c8caa6d10a7263ca317fa7cb64f0edc72aae | 2024-08-16T14:23:12+08:00 | Liu Jia | | common : add support for cpu_get_num_physical_cores() on Windows (#8771) |
| 1766 | 2a24c8caa6d10a7263ca317fa7cb64f0edc72aae | e3f6fd56b1ab3c426596217d786910d641ae6ce0 | 2024-08-15T19:23:33-07:00 | Yoshi Suhara | | Add Nemotron/Minitron GGUF Conversion & Inference Support (#8922) |
| 1767 | e3f6fd56b1ab3c426596217d786910d641ae6ce0 | 4b9afbbe9037f8a2d659097c0c7d9fce32c6494c | 2024-08-16T04:22:55+02:00 | Nico Bosshard | | ggml : dynamic ggml_sched_max_splits based on graph_size (#9047) |
| 1768 | 4b9afbbe9037f8a2d659097c0c7d9fce32c6494c | 37501d9c79ed5897db4b73ea7502211d25b3f763 | 2024-08-15T15:40:12+08:00 | gtygo | | retrieval : fix memory leak in retrieval query handling (#8955) |
| 1769 | 37501d9c79ed5897db4b73ea7502211d25b3f763 | 4af8420afba39de4968adf2695ce12fd42422a13 | 2024-08-15T15:28:05+08:00 | Riceball LEE | | server : fix duplicated n_predict key in the generation_settings (#8994) |
| 1770 | 234b30676a97ce227b604c38beb9dcaca406dea9 | 5fd89a70ead34d1a17015ddecad05aaa2490ca46 | 2024-08-15T08:21:57+02:00 | Jiří Podivín | | server : init stop and error fields of the result struct (#9026) |
| 1771 | 5fd89a70ead34d1a17015ddecad05aaa2490ca46 | 98a532d474c73d3494a5353024cb6a4fbbabbb35 | 2024-08-14T18:32:53+02:00 | 0cc4m | | Vulkan Optimizations and Fixes (#8959) |
| 1772 | 98a532d474c73d3494a5353024cb6a4fbbabbb35 | 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 | 2024-08-14T02:51:02-04:00 | compilade | | server : fix segfault on long system prompt (#8987) |
| 1773 | 06943a69f678fb32829ff06d9c18367b17d4b361 | 828d6ff7d796f48b2c345f6be2805a3c531a089c | 2024-08-13T21:13:15+02:00 | Daniel Bevenius | | ggml : move rope type enum to ggml.h (#8949) |
| 1774 | 828d6ff7d796f48b2c345f6be2805a3c531a089c | fc4ca27b25464a11b3b86c9dbb5b6ed6065965c2 | 2024-08-13T11:41:14+02:00 | Xuan Son Nguyen | | export-lora : throw error if lora is quantized (#9002) |
| 1775 | fc4ca27b25464a11b3b86c9dbb5b6ed6065965c2 | 1f67436c5ee6f4c99e71a8518bdfc214c27ce934 | 2024-08-12T13:28:23-03:00 | Diogo Teles Sant'Anna | | ci : fix github workflow vulnerable to script injection (#9008) |
| 1776 | 1262e7ed13ac197c944f15e1ddb083cb4f36cf65 | df5478fbea7e652cfad4ee7974ac3b624fd6c7f6 | 2024-08-12T13:36:41+01:00 | DavidKorczynski | | grammar-parser : fix possible null-deref (#9004) |
| 1777 | df5478fbea7e652cfad4ee7974ac3b624fd6c7f6 | 2589292cde038ba876c041bcd7b3f0c81f3f11fe | 2024-08-12T13:21:41+01:00 | DavidKorczynski | | ggml: fix div-by-zero (#9003) |
| 1778 | 2589292cde038ba876c041bcd7b3f0c81f3f11fe | d3ae0ee8d75033921a076131d4d0fa1c6ec579a7 | 2024-08-12T17:46:03+08:00 | Liu Jia | | Fix a spelling mistake (#9001) |
| 1779 | d3ae0ee8d75033921a076131d4d0fa1c6ec579a7 | 5ef07e25ac39e62297a67208c5bcced50835a2dd | 2024-08-12T11:02:01+03:00 | Georgi Gerganov | | py : fix requirements check '==' -> '~=' (#8982) |
| 1780 | a21c6fd45032a20180e026773582d21294c85619 | 33309f661a93c9c0ab65a79e5e7e30fa6162992e | 2024-08-11T16:37:43+08:00 | Neo Zhang | | update guide (#8909) |
| 1781 | 7c5bfd57f83fd3630934cfa70892aa4022d3faf7 | 6e02327e8b7837358e0406bf90a4632e18e27846 | 2024-08-11T10:09:09+02:00 | Markus Tavenrath | | Optimize Vulkan backend for better CPU performance and less GPU synchronization overhead. (#8943) |
| 1782 | 6e02327e8b7837358e0406bf90a4632e18e27846 | 7eb23840ed0f388e10c4bbc4d65802fdfb977b40 | 2024-08-10T15:42:10+02:00 | slaren | | metal : fix uninitialized abort_callback (#8968) |
| 1783 | 7eb23840ed0f388e10c4bbc4d65802fdfb977b40 | 7c3f55c10051c634546247387c5c359c9d499360 | 2024-08-10T13:04:40+02:00 | Xuan Son Nguyen | | llama : default n_swa for phi-3 (#8931) |
| 1784 | 911b437f228e75aa3d235acec21bfddd23ecce2f | b72942fac998672a79a1ae3c03b340f7e629980b | 2024-08-10T07:58:49+02:00 | Matteo Mortari | | gguf-py : fix double call to add_architecture() (#8952) |
| 1785 | 272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a | 45a55b91aa87958a75d691be64b070266d4fbb94 | 2024-08-09T18:24:30+03:00 | Georgi Gerganov | | make : fix llava obj file race (#8946) |
| 1786 | 3071c0a5f218f107dabd13b73f6090af683ef5ec | 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 | 2024-08-09T18:33:53+08:00 | tc-mb | | llava : support MiniCPM-V-2.5 (#7599) |
| 1787 | 70c0ea35609a2ab87a358e25f4ffad1aad408992 | 5b2c04f4925e152c362b824f4b41eb2a081fa623 | 2024-07-16T03:21:09-04:00 | Matt Stephenson | | whisper : use vulkan as gpu backend when available (whisper/2302) |
| 1788 | 5b2c04f4925e152c362b824f4b41eb2a081fa623 | 6f6496bb0999d1bce5daff0cfc55ceb0dd13c888 | 2024-08-09T08:33:30+02:00 | Daniel Bevenius | | embedding : add --pooling option to README.md [no ci] (#8934) |
| 1789 | 6f6496bb0999d1bce5daff0cfc55ceb0dd13c888 | daef3ab233fc02e4c53afd9b07366379876f00d1 | 2024-08-09T08:32:23+02:00 | Daniel Bevenius | | llama : fix typo in llama_tensor_get_type comment [no ci] (#8937) |
| 1790 | 3a14e00366399040a139c67dd5951177a8cb5695 | afd27f01fe832ece3d07ef03b7d34a9e80c4a895 | 2024-08-08T13:33:09-04:00 | compilade | | gguf-py : simplify support for quant types (#8838) |
| 1791 | 366d486c163ea883442313cff1a3b154ab93e168 | e44a561ab090b11d3a6fe539b768404663e4c3d2 | 2024-08-08T14:40:12+03:00 | Georgi Gerganov | | scripts : fix sync filenames (#0) |
| 1792 | 5b33ea1ee72fadfa4f96d86dc614631739758cce | 85fca8deb6273b956bc9184bc9d70a07e1d50d07 | 2024-08-07T09:57:00+03:00 | Georgi Gerganov | | metal : fix struct name (ggml/912) |
| 1793 | be55695eff44784a141a863f273661a6bce63dfc | 0478174d5959b66096ae6609fcb0df14cab66b51 | 2024-08-07T13:29:02+02:00 | slaren | | ggml-backend : fix async copy from CPU (#8897) |
| 1794 | 0478174d5959b66096ae6609fcb0df14cab66b51 | a8dbc6f753f296108121d50f78f67463403dd6fc | 2024-08-07T11:25:36+01:00 | Ouadie EL FAROUKI | | [SYCL] Updated SYCL device filtering (#8901) |
| 1795 | a8dbc6f753f296108121d50f78f67463403dd6fc | 506122d854c5d05b4a3d45a294f14bd4c02d9868 | 2024-08-07T09:07:52+02:00 | Johannes Gäßler | | CUDA/HIP: fix tests/test-backend-ops (#8896) |
| 1796 | 1e6f6554aa11fa10160a5fda689e736c3c34169f | 641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5 | 2024-08-06T17:33:39+02:00 | Xuan Son Nguyen | | server : add lora hotswap endpoint (WIP) (#8857) |
| 1797 | 641f5dd2a6422941faa9f32ab5cb50fc1b24c1f5 | 5f4dcb1e60bbfe936b45778dad177a5b9a09b066 | 2024-08-06T17:13:55+02:00 | Johannes Gäßler | | CUDA: fix padding logic for FP16/FP32 (#8884) |
| 1798 | db20f50cf4710c46e3a996919a26858cae8c80ed | efda90c93a62274ec0b0bfa80c4eee4bdb6966d0 | 2024-08-06T17:21:47+04:00 | Jaeden Amero | | cmake : Link vulkan-shaders-gen with pthreads (#8835) |
| 1799 | efda90c93a62274ec0b0bfa80c4eee4bdb6966d0 | 0bf16de07b0692e7df26b9a633e232bbd66e0360 | 2024-08-06T16:32:03+05:00 | MaggotHATE | | [Vulkan] Fix compilation of `vulkan-shaders-gen` on w64devkit after `e31a4f6` (#8880) |
| 1800 | cdd1889de62a7140c8c016405ec917464bde8bd3 | c21a896405de4cdf4207eb8130555ceaac0ab110 | 2024-08-06T02:20:54-05:00 | Douglas Hanley | | convert : add support for XLMRoberta embedding models (#8658) |
| 1801 | c21a896405de4cdf4207eb8130555ceaac0ab110 | d4ff847153e9cf7220d1b39aa21172069e6e8cea | 2024-08-06T12:42:42+08:00 | Mengqing Cao | | [CANN]: Fix ggml_backend_cann_buffer_get_tensor (#8871) |
| 1802 | 0a4ce786814b123096d18aadca89cd352b9e590b | bc0f887e159c0d78c28121e2c8b5c58094170875 | 2024-08-06T00:14:10+08:00 | Liu Jia | | common : Changed tuple to struct (TODO fix) (#8823) |
| 1803 | bc0f887e159c0d78c28121e2c8b5c58094170875 | b42978e7e4d56eaaa93588414e804d9fbbc3cae2 | 2024-08-05T21:10:37+08:00 | wangshuai09 | | cann: fix buffer_num and runtime speed slowly error (#8865) |
| 1804 | b9dfc25ca385a83bde9e9456c4d4fae15377bc7b | 1ef14b30075da594cb24f0ab858a14bf1d8d1797 | 2024-08-05T05:43:40-07:00 | Justine Tunney | | ggml : fix overflows in elu function (#8866) |
| 1805 | 1ef14b30075da594cb24f0ab858a14bf1d8d1797 | d3f0c7166adfa952237e0f437a5344362d8256d4 | 2024-08-05T21:15:28+10:00 | Brian | | py: Add more authorship metadata from model card (#8810) |
| 1806 | e31a4f679779220312c165b0f5994c680a610e38 | 400ae6f65f0b55babd48d1e3ec7fd663a97fc8d0 | 2024-08-05T08:18:27+02:00 | stduhpf | | cmake: fix paths for vulkan shaders compilation on Windows (#8573) |
| 1807 | 064cdc265fb63590c7c8f04a609d36ef200d55a7 | 5587e57a76630651752031223cc7024cb32cf308 | 2024-08-05T07:52:55+02:00 | 0cc4m | | vulkan : fix Qantized Mat-Vec Mul on AMD GPUs for ncols < 64 (#8855) |
| 1808 | a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e | 655858ace0cf2720e56eb01f84ad05e0c94ada3c | 2024-08-04T17:28:08+02:00 | 0cc4m | | vulkan : implement Stable Diffusion operators (ggml/904) |
| 1809 | ecf6b7f23e664afd7ff856ec39034240ce438daa | 01aae2b4975b57a265ce8194928fd87f2d71027e | 2024-08-04T03:55:03-07:00 | Brian Cunnie | | batched-bench : handle empty `-npl` (#8839) |
| 1810 | 76614f352e94d25659306d9e97321f204e5de0d3 | b72c20b85c1029d135022d39e9a20d4807c11893 | 2024-08-04T01:34:41+09:00 | jdomke | | ggml : reading the runtime sve config of the cpu (#8709) |
| 1811 | b72c20b85c1029d135022d39e9a20d4807c11893 | e09a800f9a9b19c73aa78e03b4c4be8ed988f3e6 | 2024-08-02T21:11:39+02:00 | Sigbjørn Skjæret | | Fix conversion of unnormalized BF16->BF16 weights (#7843) |
| 1812 | e09a800f9a9b19c73aa78e03b4c4be8ed988f3e6 | 0fbbd884589d585c3b43cae8c16938ffffb863b9 | 2024-08-02T16:50:53+08:00 | Mengqing Cao | | cann: Fix ggml_cann_im2col for 1D im2col (#8819) |
| 1813 | 0fbbd884589d585c3b43cae8c16938ffffb863b9 | afbb4c1322a747d2a7b4bf67c868148f8afcc6c8 | 2024-08-02T01:55:17+01:00 | Ouadie EL FAROUKI | | [SYCL] Fixing wrong VDR iq4nl value (#8812) |
| 1814 | afbb4c1322a747d2a7b4bf67c868148f8afcc6c8 | b7a08fd5e0e7c898c68d1743066ea495202d9608 | 2024-08-01T23:28:28+02:00 | matteo | | ggml-cuda: Adding support for unified memory (#8035) |
| 1815 | b7a08fd5e0e7c898c68d1743066ea495202d9608 | 7a11eb3a260915aee16101808f291a244e2facc7 | 2024-08-01T12:53:46-04:00 | Alex O'Connell | | Build: Only include execinfo.h on linux systems that support it (#8783) |
| 1816 | 7a11eb3a260915aee16101808f291a244e2facc7 | c8a0090922bad576623de4aae227717085249262 | 2024-08-01T15:26:22+02:00 | slaren | | cuda : fix dmmv cols requirement to 2*GGML_CUDA_DMMV_X (#8800) |
| 1817 | afbbcf3c04e3c6420cad3d72571478cd62ac176c | ed9d2854c9de4ae1f448334294e61167b04bec2a | 2024-07-31T18:59:09-05:00 | Igor Okulist | | server : update llama-server embedding flag documentation (#8779) |
| 1818 | ed9d2854c9de4ae1f448334294e61167b04bec2a | 398ede5efeb07b9adf9fbda7ea63f630d476a792 | 2024-07-31T15:51:06-04:00 | Clint Herron | | Build: Fix potential race condition (#8781) |
| 1819 | 44d28ddd5caaa5e9de573bdaaa5b5b2448a29ace | 268c5660062270a2c19a36fc655168aa287aaec2 | 2024-07-31T16:40:08+03:00 | Borislav Stanimirov | | cmake : fix use of external ggml (#8787) |
| 1820 | 75af08c475e285888f66556d0f459c533b7deb95 | 439b3fc75a8deb42899ac47a8f52aae75e0339fe | 2024-07-30T00:38:34+08:00 | CarterLi999 | | ggml: bugfix: fix the inactive elements is agnostic for risc-v vector (#8748) |
| 1821 | 4730faca618ff9cee0780580145e3cbe86f24876 | 4c676c85e59ef8f771f3a129e6eb217552139231 | 2024-07-28T03:52:42-04:00 | Austin | | chore : Fix vulkan related compiler warnings, add help text, improve CLI options (#8477) |
| 1822 | 4c676c85e59ef8f771f3a129e6eb217552139231 | e54c35e4fb5777c76316a50671640e6e144c9538 | 2024-07-28T00:42:05-04:00 | compilade | | llama : refactor session file management (#8699) |
| 1823 | e54c35e4fb5777c76316a50671640e6e144c9538 | 5e2727fe0321c38d1664d26173c654fa1801dc5f | 2024-07-28T07:41:25+08:00 | R0CKSTAR | | feat: Support Moore Threads GPU (#8383) |
| 1824 | 203b7f1531303a060730ec1d1e01920e70302398 | d2b851bfa131478665315bc5c7c707506c14d703 | 2024-07-20T20:49:44+02:00 | Tony Wasserka | | vulkan : initialize vk_buffer_struct members to VK_NULL_HANDLE (ggml/893) |
| 1825 | 9d03d085dd6cb275c078690bb64073b9b043e95f | bfb4c74981f0a40d757b450b596a9fe4ca983d26 | 2024-07-27T12:45:02+02:00 | Daniel Bevenius | | common : add --no-warmup option for main/llama-cli (#8712) |
| 1826 | bfb4c74981f0a40d757b450b596a9fe4ca983d26 | 2b1f616b208a4a21c4ee7a7eb85d822ff1d787af | 2024-07-27T16:36:44+08:00 | wangshuai09 | | cann: Fix Multi-NPU execution error (#8710) |
| 1827 | 2b1f616b208a4a21c4ee7a7eb85d822ff1d787af | 01245f5b1629075543bc4478418c7d72a0b4b3c7 | 2024-07-27T04:41:55+02:00 | slaren | | ggml : reduce hash table reset cost (#8698) |
| 1828 | 01245f5b1629075543bc4478418c7d72a0b4b3c7 | 01aec4a6310ab0160483196db0e726d78d4c94b6 | 2024-07-26T16:38:12+08:00 | Judd | | llama : fix order of parameters (#8706) |
| 1829 | 01aec4a6310ab0160483196db0e726d78d4c94b6 | 41cd47caab88c442edc50e90c8d8d0ac3e82768d | 2024-07-25T18:10:16-04:00 | Yaiko | | server : add Speech Recognition & Synthesis to UI (#8679) |
| 1830 | 41cd47caab88c442edc50e90c8d8d0ac3e82768d | 49ce0ab6d45402e8bb622bf86f86529f2b0ba552 | 2024-07-25T23:49:39+02:00 | Xuan Son Nguyen | | examples : export-lora : fix issue with quantized base models (#8687) |
| 1831 | 49ce0ab6d45402e8bb622bf86f86529f2b0ba552 | 4226a8d10e3904db3a1297919fe6c7f06beba6c0 | 2024-07-25T22:23:05+01:00 | DavidKorczynski | | ggml: handle ggml_init failure to fix NULL pointer deref (#8692) |
| 1832 | 4226a8d10e3904db3a1297919fe6c7f06beba6c0 | bf5a81df375f1c71e41462e1f48d57db359c9e80 | 2024-07-25T19:57:31+03:00 | Georgi Gerganov | | llama : fix build + fix fabs compile warnings (#8683) |
| 1833 | bf5a81df375f1c71e41462e1f48d57db359c9e80 | 88954f7fbd31aeb8c75140edee03e7a8ad5e2d9c | 2024-07-25T18:01:00+02:00 | Andreas (Andi) Kunar | | ggml : fix build on Windows with Snapdragon X (#8531) |
| 1834 | 88954f7fbd31aeb8c75140edee03e7a8ad5e2d9c | ed67bcb24f2d6ac0072cae72620b2bd971741b98 | 2024-07-25T18:57:44+03:00 | Georgi Gerganov | | tests : fix printfs (#8068) |
| 1835 | ed67bcb24f2d6ac0072cae72620b2bd971741b98 | eddcb5238b2e09a37798b87cde1244017a194bcc | 2024-07-25T11:45:18Z | Chen Xi | | [SYCL] fix multi-gpu issue on sycl (#8554) |
| 1836 | be6d7c079173d941b4f784500f9148f46cec2724 | 4b0eff3df58d8d86e47348fb73d54da3194d416d | 2024-07-25T10:39:04+02:00 | Xuan Son Nguyen | | examples : remove `finetune` and `train-text-from-scratch` (#8669) |
| 1837 | 4b0eff3df58d8d86e47348fb73d54da3194d416d | 8a4bad50a8ed24ed1e9df003521468dcc37320e8 | 2024-07-25T13:43:27+05:30 | Ujjawal Panchal | | docs : Quantum -> Quantized (#8666) |
| 1838 | 8a4bad50a8ed24ed1e9df003521468dcc37320e8 | 68504f0970db5a3602d176953690f503059906b1 | 2024-07-25T15:21:09+08:00 | Fan Shupei | | llama: use sliding window for phi3 (#8627) |
| 1839 | 96952e7181929c6001b2bc69a33f240de731cc3a | 79167d9e49aef9caa98e13ee7ca067ec9f88b4b5 | 2024-07-24T13:48:46+02:00 | Xuan Son Nguyen | | llama : fix `llama_chat_format_single` for mistral (#8657) |
| 1840 | de280085e7917dbb7f5753de5842ff4455f82a81 | b841d0740855c5af1344a81f261139a45a2b39ee | 2024-07-23T23:48:37+02:00 | Xuan Son Nguyen | | examples : Fix `llama-export-lora` example (#8607) |
| 1841 | b841d0740855c5af1344a81f261139a45a2b39ee | 64cf50a0ed62d41e4f6c13e08a9b6b0816f46c6e | 2024-07-23T17:37:42+03:00 | Vali Malinoiu | | server : fix URL.parse in the UI (#8646) |
| 1842 | 938943cdbf4dd79005a394d732bc226f9e34e0ff | 751fcfc6c33ea5f43cadd4d976f8fb176871df5e | 2024-07-23T13:10:17+03:00 | Georgi Gerganov | | llama : move vocab, grammar and sampling into separate files (#8508) |
| 1843 | 751fcfc6c33ea5f43cadd4d976f8fb176871df5e | 46e47417aa4f18c08738afd4d9a3e838e97ca03f | 2024-07-23T10:56:49+02:00 | 0cc4m | | Vulkan IQ4_NL Support (#8613) |
| 1844 | e7e6487ba06634edf58dfdf9673bad9df41b445a | 063d99ad11f1295046610ce5b97e105849a4b573 | 2024-07-23T11:28:38+03:00 | Georgi Gerganov | | contrib : clarify PR squashing + module names (#8630) |
| 1845 | 063d99ad11f1295046610ce5b97e105849a4b573 | 081fe431aa8fb6307145c4feb3eed4f48cab19f8 | 2024-07-23T07:43:28Z | luoyu-intel | | [SYCL] fix scratch size of softmax (#8642) |
| 1846 | 081fe431aa8fb6307145c4feb3eed4f48cab19f8 | d94c6e0ccbd29ee1ba4f44e9caa8682ad94df9fa | 2024-07-23T00:43:43+08:00 | Keke Han | | llama : fix codeshell support (#8599) |
| 1847 | 04bab6b7da0ed2b0a57174a57784d602aabb6c10 | b7c11d36e605b35206901d0e21905f1b99508e33 | 2024-07-22T15:56:45+08:00 | Mark Zhuang | | ggml: fix compile error for RISC-V (#8623) |
| 1848 | b7c11d36e605b35206901d0e21905f1b99508e33 | 45f2c19cc57286eead7b232ce8028273a817aa4d | 2024-07-22T14:54:42+08:00 | devojony | | examples: fix android example cannot be generated continuously (#8621) |
| 1849 | 22f281aa16f44d8f6ec2c180a0685ff27e04e714 | 328884f4219c0228673cf1870ac63987fb4f9fd0 | 2024-07-20T22:09:17-04:00 | M-A | | examples : Rewrite pydantic_models_to_grammar_examples.py (#8493) |
| 1850 | 328884f4219c0228673cf1870ac63987fb4f9fd0 | c69c63039cd75f8f33f253ab7485d82a8b4cd403 | 2024-07-20T21:58:49-04:00 | compilade | | gguf-py : fix some metadata name extraction edge cases (#8591) |
| 1851 | c69c63039cd75f8f33f253ab7485d82a8b4cd403 | 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 | 2024-07-20T21:53:01-04:00 | compilade | | convert_hf : fix Gemma v1 conversion (#8597) |
| 1852 | 07283b1a90e1320aae4762c7e03c879043910252 | 940362224d20e35f13aa5fd34a0d937ae57bdf7d | 2024-07-20T17:15:42+03:00 | Georgi Gerganov | | gguf : handle null name during init (#8587) |
| 1853 | 940362224d20e35f13aa5fd34a0d937ae57bdf7d | 69b9945b44c3057ec17cb556994cd36060455d44 | 2024-07-20T09:43:51-04:00 | Michael Coppola | | llama : add support for Tekken pre-tokenizer (#8579) |
| 1854 | 69b9945b44c3057ec17cb556994cd36060455d44 | c3776cacabce2ee35f172fb72be7a519752125fa | 2024-07-20T09:09:37-04:00 | Huifeng Ou | | llama.swiftui: fix end of generation bug (#8268) |
| 1855 | c3776cacabce2ee35f172fb72be7a519752125fa | 87e397d00bdcedd5cbf6dfda06a7b0f302462728 | 2024-07-20T17:35:25+10:00 | Brian | | gguf_dump.py: fix markddown kv array print (#8588) |
| 1856 | 87e397d00bdcedd5cbf6dfda06a7b0f302462728 | 57b1d4f9eb6f2c139b31ea79626d954b261e1051 | 2024-07-19T17:17:27+02:00 | slaren | | ggml : fix quant dot product with odd number of blocks (#8549) |
| 1857 | be0cfb41752551a4680ee7dfd29f2a05b50db442 | b57eb9ca4fb79f3163c6a69e154ff76157a4f716 | 2024-07-19T14:34:55+03:00 | Georgi Gerganov | | readme : fix server badge |
| 1858 | b57eb9ca4fb79f3163c6a69e154ff76157a4f716 | f299aa98ecc19cbc574e9d698e03999e89de3d3d | 2024-07-19T07:05:45-04:00 | Clint Herron | | ggml : add friendlier error message to fopen errors (#8575) |
| 1859 | f299aa98ecc19cbc574e9d698e03999e89de3d3d | 3d0e4367d99087892e355ddbeebd232a0b2f40de | 2024-07-19T17:44:41+08:00 | Frank Mai | | fix: typo of chatglm4 chat tmpl (#8586) |
| 1860 | a15ef8f8a08e12f9c5162c221e67779e71182073 | 705b7ecf60e667ced57c15d67aa86865e3cc7aa7 | 2024-07-18T23:48:47+02:00 | Johannes Gäßler | | CUDA: fix partial offloading for ne0 % 256 != 0 (#8572) |
| 1861 | 705b7ecf60e667ced57c15d67aa86865e3cc7aa7 | 0d2c7321e9678e91b760ebe57f0d063856bb018b | 2024-07-18T07:47:12-07:00 | 65a | | cmake : install all ggml public headers (#8480) |
| 1862 | 0d2c7321e9678e91b760ebe57f0d063856bb018b | 672a6f101839a150180fc28891ebed379c8f2353 | 2024-07-18T18:43:49+08:00 | Eric Zhang | | server: use relative routes for static files in new UI (#8552) |
| 1863 | 672a6f101839a150180fc28891ebed379c8f2353 | 3807c3de04cde853418033c95e96642876545f3e | 2024-07-18T20:40:15+10:00 | Brian | | convert-*.py: GGUF Naming Convention Refactor and Metadata Override Refactor (#7499) |
| 1864 | e02b597be3702174e7b47b44cd03e1da1553284b | b3283448ce9a5098226afe1d8648ccc578511fe4 | 2024-07-17T23:35:44+02:00 | Johannes Gäßler | | lookup: fibonacci hashing, fix crashes (#8548) |
| 1865 | b3283448ce9a5098226afe1d8648ccc578511fe4 | 30f80ca0bcee58669ada7a94244eeccc8c4807cc | 2024-07-17T20:21:55+02:00 | Al Mochkin | | build : Fix docker build warnings (#8535) (#8537) |
| 1866 | 1bdd8ae19f50bc6f108fa247e90688e5c60559fc | da3913d8f9475b0d4bcbeb4936c724af4eade092 | 2024-07-17T19:23:50+08:00 | hipudding | | [CANN] Add Ascend NPU backend (#6035) |
| 1867 | da3913d8f9475b0d4bcbeb4936c724af4eade092 | d65a8361fed8be97389776fb94217e937ec6b03c | 2024-07-17T16:34:28+09:00 | Masaya, Kato | | batched: fix n_predict parameter (#8527) |
| 1868 | 37b12f92ab696d70f9a65d7447ce721b094fb32e | 0efec57787cb8d8d76b17cd3765e6521e22c1f19 | 2024-07-16T00:04:45-07:00 | Steve Bonds | | export-lora : handle help argument (#8497) |
| 1869 | 7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc | 97bdd26eee11fe109dec00de75690ceef61c03f2 | 2024-07-15T23:13:10-04:00 | compilade | | convert_hf : faster lazy safetensors (#8482) |
| 1870 | 97bdd26eee11fe109dec00de75690ceef61c03f2 | 4db8f60fe79a391e82b0464013ada123baced96a | 2024-07-15T20:50:47+02:00 | Xuan Son Nguyen | | Refactor lora adapter support (#8332) |
| 1871 | 4db8f60fe79a391e82b0464013ada123baced96a | 8fac431b0692e88cdc55250f29f8d4386be82c5d | 2024-07-15T19:23:10+02:00 | Xuan Son Nguyen | | fix ci (#8494) |
| 1872 | f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 | 9104bc20edf47f74dc49379b7d61d0c6e85a4882 | 2024-07-15T08:04:56-04:00 | M-A | | server: update README.md with llama-server --help output [no ci] (#8472) |
| 1873 | fc690b018e459012cd82c37f1343e9bb658987d1 | 16bdfa42acb09175e88cf97e9d9e4e48f616d120 | 2024-07-15T04:46:39-07:00 | NikolaiLyssogor | | docs: fix links in development docs [no ci] (#8481) |
| 1874 | bda62d7999caa8c222b6c354ac1e7c7442508539 | 090fca7a073efe9ad3dd2b9ac12491a4f20ac957 | 2024-07-15T09:38:52+02:00 | 0cc4m | | Vulkan MMQ Fix (#8479) |
| 1875 | 090fca7a073efe9ad3dd2b9ac12491a4f20ac957 | aaab2419eaa17ab3aa38f4ba49c7eea406999e99 | 2024-07-14T19:51:21-04:00 | compilade | | pydantic : replace uses of __annotations__ with get_type_hints (#8474) |
| 1876 | 73cf442e7bc9baca7b3e213b261551812f1676c9 | e236528e7628a0e59751eee9addf21fc3c33d376 | 2024-07-14T14:05:09+03:00 | Georgi Gerganov | | llama : fix Gemma-2 Query scaling factors (#8473) |
| 1877 | fa79495bb4897953a75607addd9d2cdd2ec63222 | 17eb6aa8a992cda37ee65cf848d9289bd6cad860 | 2024-07-13T23:35:10-04:00 | compilade | | llama : fix pre-tokenization of non-special added tokens (#8228) |
| 1878 | 17eb6aa8a992cda37ee65cf848d9289bd6cad860 | c917b67f06c42d8ca8391b9bc73f5fe62c83bf70 | 2024-07-13T13:12:39-03:00 | bandoti | | vulkan : cmake integration (#8119) |
| 1879 | 6af51c0d96e6268769fc05c98d5b1a5e832c0017 | f53226245f421bd01b47cce43a47e791de82c636 | 2024-07-12T14:48:04+03:00 | Georgi Gerganov | | main : print error on empty input (#8456) |
| 1880 | c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b | 8a4441ea1a2564578134404f31158c318e9c0bf3 | 2024-07-12T03:14:12-05:00 | Douglas Hanley | | server : ensure batches are either all embed or all completion (#8420) |
| 1881 | 8a4441ea1a2564578134404f31158c318e9c0bf3 | 5aefbce27a66473d4b1263ba3f7bdd3d14245975 | 2024-07-12T04:08:19-04:00 | Armen Kaleshian | | docker : fix filename for convert-hf-to-gguf.py in tools.sh (#8441) |
| 1882 | 370b1f7e7a7514d9a63daf15f7b0f00319b7f908 | b549a1bbefb2f1fbb8b558bac1f2ae7967e60964 | 2024-07-12T10:46:02+03:00 | Georgi Gerganov | | ggml : minor naming changes (#8433) |
| 1883 | b549a1bbefb2f1fbb8b558bac1f2ae7967e60964 | 368645698ab648e390dcd7c00a2bf60efa654f57 | 2024-07-12T00:52:04Z | Chen Xi | | [SYCL] fix the mul_mat_id ut issues (#8427) |
| 1884 | b078c619aa4e97fe726d61b0b5499a2e19a418a4 | 808aba39161e5d7ca2ff24110b5aa14d2e536988 | 2024-07-11T17:53:42+02:00 | Daniel Bevenius | | cuda : suppress 'noreturn' warn in no_device_code (#8414) |
| 1885 | 278d0e18469aacf505be18ce790a63c7cc31be26 | dd07a123b79f9bd9e8a4ba0447427b3083e9347a | 2024-07-10T20:08:17-04:00 | Clint Herron | | Initialize default slot sampling parameters from the global context. (#8418) |
| 1886 | 0f1a39f3439825acf7e3a1663566d410be152170 | 83321c6958acf20747d288031174cc1bf8816e33 | 2024-07-10T07:14:51-05:00 | Dibakar Gope | | ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) |
| 1887 | e4dd31ff892627665d3c53c5d1a03c0d282d9d45 | 8f0fad42b9589f9b11362c74ea5338c51e4c7e61 | 2024-07-10T19:26:40+08:00 | RunningLeon | | py : fix converter for internlm2 (#8321) |
| 1888 | 8f0fad42b9589f9b11362c74ea5338c51e4c7e61 | a59f8fdc85e1119d470d8766e29617962549d993 | 2024-07-10T19:19:10+08:00 | laik | | py : fix extra space in convert_hf_to_gguf.py (#8407) |
| 1889 | a59f8fdc85e1119d470d8766e29617962549d993 | fd560fe680c72fd0a0af2bc8881add20ad919071 | 2024-07-09T18:26:40-04:00 | Clint Herron | | Server: Enable setting default sampling parameters via command-line (#8402) |
| 1890 | fd560fe680c72fd0a0af2bc8881add20ad919071 | e500d6135ac42c4a23baf6a9a1a934dc023e5c7d | 2024-07-09T11:58:44-07:00 | Andy Salerno | | Update README.md to fix broken link to docs (#8399) |
| 1891 | e500d6135ac42c4a23baf6a9a1a934dc023e5c7d | a03e8dd99d3954e7547137936c5a2a3b348bdb7f | 2024-07-09T11:54:43-04:00 | Clint Herron | | Deprecation warning to assist with migration to new binary names (#8283) |
| 1892 | 9beb2dda038e2107a39a95def94a4cf971e048ea | 7d0e23d72ef4540d0d4409cb63ae682c17d53926 | 2024-07-09T09:16:00+03:00 | daghanerdonmez | | readme : fix typo [no ci] (#8389) |
| 1893 | c4dd11d1d3903e1922c06242e189f6310fc4d8c3 | 2ec846d558f6385ea647f7b8e665eb249c1ebce7 | 2024-07-08T22:19:24+08:00 | b4b4o | | readme : fix web link error [no ci] (#8347) |
| 1894 | 2ec846d558f6385ea647f7b8e665eb249c1ebce7 | 3f2d538b817112ad8429341c7e8657dcd660f4d3 | 2024-07-08T14:22:41+01:00 | Alberto Cabrera Pérez | | sycl : fix powf call in device code (#8368) |
| 1895 | 3f2d538b817112ad8429341c7e8657dcd660f4d3 | 2ee44c9a1865a928ccbbc16a2d7841d7513f31c1 | 2024-07-08T13:51:31+03:00 | Georgi Gerganov | | scripts : fix sync for sycl |
| 1896 | 6847d54c4f72f8bf6767b6feae7a95394654335e | fde13b3bb9f569f07fd8af74696ee48a43d05131 | 2024-07-08T10:39:36+03:00 | Georgi Gerganov | | tests : fix whitespace (#0) |
| 1897 | fde13b3bb9f569f07fd8af74696ee48a43d05131 | 470939d483d1c89b7292f78bac1fd27c42c171ce | 2024-07-02T11:09:52-05:00 | John Balis | | feat: cuda implementation for `ggml_conv_transpose_1d` (ggml/854) |
| 1898 | 6f0dbf6ab087bcd286fb78560099ca0458316735 | ffd00797d81ef7db1528b9e10adbdc333ade6495 | 2024-07-08T09:34:35+03:00 | Georgi Gerganov | | infill : assert prefix/suffix tokens + remove old space logic (#8351) |
| 1899 | 3fd62a6b1c9ca7b7c0093e984cc9c133c6f2726d | a8db2a9ce64cd4417f6a312ab61858f17f0f8584 | 2024-07-07T15:04:39-04:00 | compilade | | py : type-check all Python scripts with Pyright (#8341) |
| 1900 | a8db2a9ce64cd4417f6a312ab61858f17f0f8584 | 4090ea5501c702cd858095c394ba068919c56cc8 | 2024-07-07T09:08:28-06:00 | Denis Spasyuk | | Update llama-cli documentation (#8315) |
| 1901 | f1948f1e108157d5e7eb60fc8f24a10412e5d4ff | f7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c | 2024-07-07T06:21:37-07:00 | Andy Tai | | readme : update bindings list (#8222) |
| 1902 | f7cab35ef9e66c57b4a416d09eb6c814e0ba4e4c | 905942abdba5ba0b28a1b0805e51e4f818c54bc9 | 2024-07-07T22:58:43+10:00 | Brian | | gguf-hash: model wide and per tensor hashing using xxhash and sha1 (#8048) |
| 1903 | 905942abdba5ba0b28a1b0805e51e4f818c54bc9 | b5040086d436e7345e4fa33a5b9558060c75603f | 2024-07-07T20:52:10+08:00 | toyer | | llama : support glm3 and glm4 (#8031) |
| 1904 | b5040086d436e7345e4fa33a5b9558060c75603f | d39130a3985ce0747d7229a6b7ebebb6376b5abf | 2024-07-07T14:59:02+03:00 | Georgi Gerganov | | llama : fix n_rot default (#8348) |
| 1905 | 210eb9ed0ac3979a93e37568d96447ec3e95ad05 | cb4d86c4d723af87d3d7e3177e9485f200391384 | 2024-07-07T19:37:47+09:00 | standby24x7 | | finetune: Rename an old command name in finetune.sh (#8344) |
| 1906 | cb4d86c4d723af87d3d7e3177e9485f200391384 | 86e7299ef5dff0f388922dc6fcbce009e99d8005 | 2024-07-07T11:10:38+02:00 | Bjarke Viksøe | | server: Retrieve prompt template in /props (#8337) |
| 1907 | 86e7299ef5dff0f388922dc6fcbce009e99d8005 | 60d83a0149849e9217e4b8ae26e277a41aea906e | 2024-07-06T15:32:04-05:00 | Derrick T. Woolworth | | added support for Authorization Bearer tokens when downloading model (#8307) |
| 1908 | 87e25a1d1bd26eb06d1cab9e2ee4e14a7a0be33c | 213701b51a17175d0d326b566efc03f30ec7fbe6 | 2024-07-06T09:22:16+02:00 | Daniel Bevenius | | llama : add early return for empty range (#8327) |
| 1909 | 213701b51a17175d0d326b566efc03f30ec7fbe6 | be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d | 2024-07-05T19:01:35+02:00 | jaime-m-p | | Detokenizer fixes (#8039) |
| 1910 | be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d | 7ed03b8974269b6c48e55c4245d12fb3264a6cf5 | 2024-07-05T18:08:32+02:00 | Xuan Son Nguyen | | Reorganize documentation pages (#8325) |
| 1911 | 7ed03b8974269b6c48e55c4245d12fb3264a6cf5 | 1d894a790e62b10d066adcdd9c9feb559455b7d2 | 2024-07-05T17:32:09+03:00 | Georgi Gerganov | | llama : fix compile warning (#8304) |
| 1912 | 0a423800ffe4e5da3d83527ef3473da88cd78146 | d12f781074b92589a72a36ffabb583933f7b9dc0 | 2024-07-05T07:06:09Z | Daniele | | CUDA: revert part of the RDNA1 optimizations (#8309) |
| 1913 | bcefa03bc01a41aace2e200ee8e77827d6d39b4f | 5a7447c5692c9e3dde1161e8e69edb76d3d34714 | 2024-07-05T09:05:34+02:00 | Johannes Gäßler | | CUDA: fix MMQ stream-k rounding if ne00 % 128 != 0 (#8311) |
| 1914 | 5a7447c5692c9e3dde1161e8e69edb76d3d34714 | 61ecafa3905a02a299b7ae889b5578cfeb8d79df | 2024-07-05T02:58:41-04:00 | Pieter Ouwerkerk | | readme : fix minor typos [no ci] (#8314) |
| 1915 | aa5898dc53afcf77f16222cd719e10b29049f95a | 6c05752c507f51b88348f16d9e2c8df49f66c028 | 2024-07-05T09:10:03+03:00 | Georgi Gerganov | | llama : prefer n_ over num_ prefix (#8308) |
| 1916 | a9554e20b66546b0549aebe2e1034bc8afe9d809 | e235b267a2539d043734ff340eff74107722eb57 | 2024-07-05T05:06:13Z | luoyu-intel | | [SYCL] Fix WARP_SIZE=16 bug of Intel GPU (#8266) |
| 1917 | e235b267a2539d043734ff340eff74107722eb57 | f09b7cb609d80b8031803f89255991dc8b35db69 | 2024-07-05T07:53:33+03:00 | Georgi Gerganov | | py : switch to snake_case (#8305) |
| 1918 | d7fd29fff16456ce9c3a23fd2d09a66256b05aff | 6f63d646c1a06a6e09f721009a2676864ae04e31 | 2024-07-05T05:14:21+12:00 | Icecream95 | | llama : add OpenELM support (#7359) |
| 1919 | 6f63d646c1a06a6e09f721009a2676864ae04e31 | 51d2ebadbbf365b894f3888361df42dbacb12b7a | 2024-07-04T18:38:58+02:00 | Daniel Bevenius | | tokenize : add --show-count (token) option (#8299) |
| 1920 | 07786a61a2097306ee496f565f78796f1aa205e6 | de14e2ea2b542386dcb800226eb360be76f433fd | 2024-07-02T15:35:43+05:30 | ditsuke | | chore: Fixup requirements and build |
| 1921 | 821922916f95cc3853fc7f58ea2f1e15a0ffa669 | b1c3f26e5e882fa46d7a6704d893b31a025e9000 | 2024-03-10T23:21:46+05:30 | ditsuke | | fix: Update script paths in CI scripts |
| 1922 | b1c3f26e5e882fa46d7a6704d893b31a025e9000 | b0a46993dfbf8b8127598f319d4dcfdd83824ba8 | 2024-02-29T01:47:15+05:30 | ditsuke | | fix: Actually include scripts in build |
| 1923 | f8c4c0738d72d2162736edd72dd5db8b269adca1 | 402d6feffa0572d1c7a957901b6d1702bd188484 | 2024-07-04T12:53:42+02:00 | Daniel Bevenius | | tests : add _CRT_SECURE_NO_WARNINGS for WIN32 (#8231) |
| 1924 | 20fc3804bfb727074bc270b6eacb60af8d0bf7d4 | f619024764e72261f14d7c31d892b8fb976603b4 | 2024-07-04T10:41:03+03:00 | Georgi Gerganov | | convert : fix gemma v1 tokenizer convert (#8248) |
| 1925 | 5f2d4e60e202aabee10051e6615bb821e51787be | 916248af1f3c16abd7408de848e025da095c621c | 2024-07-03T19:33:31+02:00 | slaren | | ppl : fix n_seq_max for perplexity (#8277) |
| 1926 | 916248af1f3c16abd7408de848e025da095c621c | f8d6a23804f3798ff2869da68c1223b618df09ec | 2024-07-03T16:01:54+02:00 | Xuan Son Nguyen | | fix phi 3 conversion (#8262) |
| 1927 | f8d6a23804f3798ff2869da68c1223b618df09ec | fadde6713506d9e6c124f5680ab8c7abebe31837 | 2024-07-03T20:40:16+08:00 | Judd | | fix typo (#8267) |
| 1928 | a27152b602b369e76f85b7cb7b872a321b7218f7 | 3e2618bc7bf9e9fbf58c32cc3c8dd7d5df1de27e | 2024-07-02T22:56:46+02:00 | MistApproach | | fix: add missing short command line argument -mli for multiline-input (#8261) |
| 1929 | 023b8807e10bc3ade24a255f01c1ad2a01bb4228 | 0e0590adab9f367b15ae2bf090a6d24f9df47ff1 | 2024-07-02T08:40:49+02:00 | Daniel Bevenius | | convert-hf : print output file name when completed (#8181) |
| 1930 | a9f3b102157ba992cfe058909b7f6e1906d2d647 | d08c20eddedb24515a3212e2de66bdff41a26b8c | 2024-07-02T04:50:07Z | luoyu-intel | | [SYCL] Fix win build conflict of math library (#8230) |
| 1931 | d08c20eddedb24515a3212e2de66bdff41a26b8c | 5fac350b9cc49d0446fc291b9c4ad53666c77591 | 2024-07-02T02:16:00Z | luoyu-intel | | [SYCL] Fix the sub group size of Intel (#8106) |
| 1932 | 5fac350b9cc49d0446fc291b9c4ad53666c77591 | cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846 | 2024-07-02T01:07:23+02:00 | Xuan Son Nguyen | | Fix gemma2 tokenizer convert (#8244) |
| 1933 | cb5fad4c6c2cbef92e9b8b63449e1cb7664e4846 | dae57a1ebc1c9bd5693ab999e19d77c5506ae559 | 2024-07-01T20:39:06+02:00 | Johannes Gäßler | | CUDA: refactor and optimize IQ MMVQ (#8215) |
| 1934 | 49122a873f54615626d1b49a2a39013ed4be98d5 | 0ddeff10230b88f1fa9866bbe5fe0d71ba2323a0 | 2024-07-01T18:48:34+02:00 | Xuan Son Nguyen | | gemma2: add sliding window mask (#8227) |
| 1935 | 9ef07800622e4c371605f9419864d15667c3558f | 1c5eba6f8e628fb0a98afb27d8aaeb3b0e136451 | 2024-06-30T20:27:13+02:00 | Xuan Son Nguyen | | Fix new line issue with chat template, disable template when in-prefix/suffix is set (#8203) |
| 1936 | 1c5eba6f8e628fb0a98afb27d8aaeb3b0e136451 | 72272b83a3878e91251218c981b4c6ec16c33912 | 2024-06-29T20:44:08-07:00 | Andrei | | llama: Add attention and final logit soft-capping, update scaling factor to Gemma2 (#8197) |
| 1937 | 72272b83a3878e91251218c981b4c6ec16c33912 | 8748d8ac6f172b99826ab18f01d9a3a165987d54 | 2024-06-29T00:14:20+02:00 | Xuan Son Nguyen | | fix code typo in llama-cli (#8198) |
| 1938 | 26a39bbd6b0bbd66118bb68569f0276d7fe7df6c | 38373cfbab5397cc2ab5c3694a3dee12a9e58f45 | 2024-06-28T15:11:44+02:00 | Xuan Son Nguyen | | Add MiniCPM, Deepseek V2 chat template + clean up `llama_chat_apply_template_internal` (#8172) |
| 1939 | b851b3fba0a1b06a1129189bac300e07dd1648c8 | 139cc621e90b4f61830515c3c124cf35b3d7a6dc | 2024-06-28T12:37:45+02:00 | slaren | | cmake : allow user to override default options (#8178) |
| 1940 | 139cc621e90b4f61830515c3c124cf35b3d7a6dc | e57dc62057d41211ac018056c19c02cd544694df | 2024-06-28T09:26:45+01:00 | Olivier Chafik | | `json`: restore default additionalProperties to false, fix some pattern escapes (#8180) |
| 1941 | e57dc62057d41211ac018056c19c02cd544694df | a27aa50ab7e07fe46aae619076b6e31d5663e914 | 2024-06-28T00:00:43-04:00 | pculliton | | llama: Add support for Gemma2ForCausalLM (#8156) |
| 1942 | cb0b06a8a613f7a2ccb7253b2a3c00fdd397ba1c | 558f44bf83d78242d4e5c4ab98d0be9125cb9780 | 2024-06-27T22:08:42+01:00 | Olivier Chafik | | `json`: update grammars/README w/ examples & note about additionalProperties (#8132) |
| 1943 | 558f44bf83d78242d4e5c4ab98d0be9125cb9780 | 8172ee9da9921ca53d698c7438c2d792b3f3f2c8 | 2024-06-27T15:01:23-04:00 | loonerin | | CI: fix release build (Ubuntu+Mac) (#8170) |
| 1944 | 8172ee9da9921ca53d698c7438c2d792b3f3f2c8 | 16791b8f0b4526aafbf5d0e5bbbd2e99c2253418 | 2024-06-27T20:04:39+02:00 | slaren | | cmake : fix deprecated option names not working (#8171) |
| 1945 | 97877eb10bd8e7f8023420b5b5300bcbdadd62dc | 387952651a8fc493f8c85ea4c9774bd4a5694f87 | 2024-06-27T15:48:07+01:00 | jukofyork | | Control vector loading fixes (#8137) |
| 1946 | 387952651a8fc493f8c85ea4c9774bd4a5694f87 | 6030c61281c8a7eb94eceb7396a608fac8b71555 | 2024-06-27T20:09:29+05:30 | Raj Hammeer Singh Hada | | Delete examples/llama.android/llama/CMakeLists.txt (#8165) |
| 1947 | 85a267daaa1c6f8fd69160445bcb88717031d10c | f675b20a3b7f878bf3be766b9a737e2c8321ff0d | 2024-06-27T16:26:05+02:00 | Johannes Gäßler | | CUDA: fix MMQ stream-k for --split-mode row (#8167) |
| 1948 | 911e35bb8bb2fd1c7d3f40f27e96ff432eae7e14 | ac146628e47451c531a3c7e62e6a973a2bb467a0 | 2024-06-27T09:46:41+02:00 | Sigbjørn Skjæret | | llama : fix CodeLlama FIM token checks (#8144) |
| 1949 | 9b31a40c6ddabe552875b811d7127aa039ca9703 | c70d117c37cc7876e775d1e2722208a50c52edb3 | 2024-06-27T01:50:09+02:00 | Daniel Bevenius | | clip : suppress unused variable warnings (#8105) |
| 1950 | c70d117c37cc7876e775d1e2722208a50c52edb3 | ae5d0f4b899ff2842bfca561370c945ad8d4368b | 2024-06-26T23:25:22+03:00 | Georgi Gerganov | | scripts : fix filename sync |
| 1951 | ae5d0f4b899ff2842bfca561370c945ad8d4368b | 31ec3993f6e050322a249c07af79dbde66ea6ddc | 2024-06-26T21:59:28+02:00 | slaren | | ci : publish new docker images only when the files change (#8142) |
| 1952 | c7ab7b612cbdce04499575e713076a026af4b9c5 | f2d48fffde76d959fdb0da37316bdc09e5518eb1 | 2024-06-26T20:20:22+02:00 | slaren | | make : fix missing -O3 (#8143) |
| 1953 | f3f65429c44bb195a9195bfdc19a30a79709db7b | 88540445615e77a0177fcca43aaa8e9d8eea6864 | 2024-06-26T18:33:02+03:00 | Georgi Gerganov | | llama : reorganize source code + improve CMake (#8006) |
| 1954 | 88540445615e77a0177fcca43aaa8e9d8eea6864 | c8771ab5f89387cdd7d9a8a69280dac46b45e02f | 2024-06-26T02:29:28-04:00 | Isaac McFadyen | | Clarify default MMQ for CUDA and LLAMA_CUDA_FORCE_MMQ flag (#8115) |
| 1955 | c8771ab5f89387cdd7d9a8a69280dac46b45e02f | 494165f3b6c4cbcd793123cb57fb3e1f5477f1db | 2024-06-26T08:28:02+02:00 | Johannes Gäßler | | CUDA: fix misaligned shared memory read (#8123) |
| 1956 | 6777c544bdd8c5d9de3220d6e2557957bbbf2a4f | 163d50adaf8897d8b734d701ff332de6be63d484 | 2024-06-26T01:45:58+01:00 | Olivier Chafik | | `json`: fix additionalProperties, allow space after enum/const (#7840) |
| 1957 | 163d50adaf8897d8b734d701ff332de6be63d484 | 6fcbf6823553efabe52ed83e3c2a3329aa3387d1 | 2024-06-25T21:47:40+01:00 | jukofyork | | fixes #7999 (adds control vectors to all `build_XXX()` functions in `llama.cpp` [needs testing] (#8060) |
| 1958 | e6bf007744eb06336a231ef39cf08146dd16d2ce | 84631fe1504de40427dc4b4cdac92fa7ebf65955 | 2024-06-25T21:07:28+02:00 | Daniel Bevenius | | llama : return nullptr from llama_grammar_init (#8093) |
| 1959 | 84631fe1504de40427dc4b4cdac92fa7ebf65955 | dd047b476c8b904e0c25e5dbc5bee6ffde2f6e17 | 2024-06-25T20:06:20+01:00 | Olivier Chafik | | `json`: support integer minimum, maximum, exclusiveMinimum, exclusiveMaximum (#7797) |
| 1960 | 48e6b92cc378c937e59719f2c0f482bf76c9ca81 | 3791ad219323389106dc3fd80814eb5bbb7b80de | 2024-06-25T13:56:49+02:00 | Xuan Son Nguyen | | Add chat template support for llama-cli (#8068) |
| 1961 | 2df373ac40ea581ccca8a58c713f03ad9d4b658d | 3b099bcd9cbf2434f90cbe40eba6fa2189ed1d02 | 2024-06-25T01:22:33+02:00 | Johannes Gäßler | | CUDA: fix matrix multiplication algorithm choice (#8102) |
| 1962 | 3b099bcd9cbf2434f90cbe40eba6fa2189ed1d02 | a818f3028d1497a51cb2b8eb7d993ad58784940e | 2024-06-24T22:15:33+02:00 | Johannes Gäßler | | CUDA: fix MMQ writeback for int8 tensor cores (#8100) |
| 1963 | a818f3028d1497a51cb2b8eb7d993ad58784940e | d62e4aaa02540c89be8b59426340b909d02bbc9e | 2024-06-24T17:43:42+02:00 | Johannes Gäßler | | CUDA: use MMQ instead of cuBLAS by default (#8075) |
| 1964 | d62e4aaa02540c89be8b59426340b909d02bbc9e | 9a590c82262dd518137f85406e65e452fdf2aca3 | 2024-06-24T14:13:39+02:00 | fairydreaming | | gguf-py : fix tensor groups for encoder-decoder models in gguf-dump.py (#8090) |
| 1965 | 52fc8705a0617452df08333e1161838726c322b4 | 8cb508d0d5c024e12692370d85237b45469a004b | 2024-06-24T05:42:03-04:00 | Christian Zhou-Zheng | | Option to split during conversion (#6942) |
| 1966 | 646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 | de0d6a68ac99f307fe889c48e21124bc3b7ca29a | 2024-06-24T13:30:24+08:00 | Yann Follet | | embedding : more cli arguments (#7458) |
| 1967 | e112b610a1a75cb7fa8351e1a933e2e7a755a5ce | 6a2f298bd784403c5c33eebb822217ec5d9b5590 | 2024-06-24T02:27:57+08:00 | Eddie-Wang | | llama : add support for BitnetForCausalLM (#7931) |
| 1968 | 6a2f298bd784403c5c33eebb822217ec5d9b5590 | 11318d9aa1f668aa10407a5cb9614371af32f3ce | 2024-06-23T18:03:08+03:00 | Aarni Koskela | | server : fix JSON-Scheme typo (#7975) |
| 1969 | 11318d9aa1f668aa10407a5cb9614371af32f3ce | b6b9a8e606da7764bd3649c2ea574979c85abd43 | 2024-06-23T15:39:45+02:00 | Daniel Bevenius | | Fix typo in llama_set_embeddings comment (#8077) |
| 1970 | b6b9a8e606da7764bd3649c2ea574979c85abd43 | 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc | 2024-06-23T13:14:45+02:00 | slaren | | fix CI failures (#8066) |
| 1971 | 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc | b5a5f34efadec8d8f0057b35cb04742abfeb2ef5 | 2024-06-23T10:21:25+02:00 | 0cc4m | | Refactor Vulkan backend to allow multiple contexts (#7961) |
| 1972 | 3e58b0ee355f78be41cf5211b68426761339bc3c | adf480c3ab3abedc964c8ae381476257583ae134 | 2024-06-22T18:11:30+02:00 | Xuan Son Nguyen | | cvector: fix CI + correct help message (#8064) |
| 1973 | adf480c3ab3abedc964c8ae381476257583ae134 | 3aa184a8c7c553b5dfcc142d919f3db695df297a | 2024-06-22T17:19:37+02:00 | HatsuneMikuUwU33 | | cvector-generator: Moe Moe Fixie-Fixie for Lots of Formats~! ♡(ᐢ ᴥ ᐢ)♡ (#8052) |
| 1974 | 3aa184a8c7c553b5dfcc142d919f3db695df297a | 5b48cd53a87928db0c6447f0c9dac4db5802102d | 2024-06-22T09:37:41-04:00 | 0xspringtime | | convert-hf : change assert to exception (#8015) |
| 1975 | c5a8d4b749352645afd4c024f85d6eca2ca72c6d | 557b653dc9ed91e8c313e87500e0050c775f81b6 | 2024-06-21T23:18:36-04:00 | Clint Herron | | JSON Schema to GBNF integration tests (#7790) |
| 1976 | 557b653dc9ed91e8c313e87500e0050c775f81b6 | 7d5e8777ae1d21af99d4f95be10db4870720da91 | 2024-06-21T16:28:20+08:00 | k.h.lai | | vulkan: detect multiple devices by deviceUUID instead of deviceID (#8022) |
| 1977 | 7d5e8777ae1d21af99d4f95be10db4870720da91 | a927b0f3dd9a86ee042cd2bdcc8c9da4a855926b | 2024-06-21T05:57:36Z | Eve | | ggml : AVX IQ quants (#7845) |
| 1978 | 17b291a6a581c47f24f99bad926b42617894f99f | abd894ad96a242043b8e197ec130d8649eead22e | 2024-06-20T20:59:59+01:00 | Hamdoud Hakem | | convert-hf : Fix the encoding in the convert-hf-to-gguf-update.py (#8040) |
| 1979 | abd894ad96a242043b8e197ec130d8649eead22e | de391e4c803383bbea054b6edd016e78c024a74d | 2024-06-20T16:40:13+02:00 | Johannes Gäßler | | common: fix warning (#8036) |
| 1980 | de391e4c803383bbea054b6edd016e78c024a74d | d50f8897a797a5a03f31228d1b5a7b8130ee1bc2 | 2024-06-20T13:19:05Z | luoyu-intel | | [SYCL] Fix windows build and inference (#8003) |
| 1981 | d50f8897a797a5a03f31228d1b5a7b8130ee1bc2 | 2075a66a96cc1b04eabec7cf4b3051193d6f719e | 2024-06-20T14:39:21+02:00 | Johannes Gäßler | | CUDA: stream-k decomposition for MMQ (#8018) |
| 1982 | 2075a66a96cc1b04eabec7cf4b3051193d6f719e | ba5899315283eb1df3902363daf79bdc5eefe426 | 2024-06-19T22:32:01-07:00 | Michael de Gans | | metal : fix `ggml_metal_supports_op` for BF16 (#8021) |
| 1983 | ba5899315283eb1df3902363daf79bdc5eefe426 | a7854743c5e6216a6178824a603aa9479728ddd5 | 2024-06-19T23:57:10Z | sasha0552 | | server : fix smart slot selection (#8020) |
| 1984 | a7854743c5e6216a6178824a603aa9479728ddd5 | 9c77ec1d74874ee22bdef8f110e8e8d41389abf2 | 2024-06-19T13:10:42-07:00 | Michael de Gans | | un-ignore `build-info.cmake` and `build-info.sh` (#7996) |
| 1985 | 623494a478134432fd2d7ee40135770a3340674f | 37bef8943312d91183ff06d8f1214082a17344a5 | 2024-06-19T09:11:51+08:00 | Meng, Hengyu | | [SYCL] refactor (#6408) |
| 1986 | 37bef8943312d91183ff06d8f1214082a17344a5 | 91c188d6c296bd3384f2a02a83b71187aa3d18b3 | 2024-06-18T18:40:52+02:00 | jaime-m-p | | tokenizer : BPE fixes (#7530) |
| 1987 | 84f6de17f6a8602e7ff7f7c7bda36a73f510a2dd | 61665277afde2add00c0d387acb94ed5feb95917 | 2024-06-18T09:18:32-03:00 | jojorne | | Fix no gcc pragma on Windows (#7751) |
| 1988 | 61665277afde2add00c0d387acb94ed5feb95917 | b96f9afb0d58b003ac8d1d0c94cd99393a3bc437 | 2024-06-18T14:00:14+02:00 | Ulrich Drepper | | Allow compiling with CUDA without CUDA runtime installed (#7989) |
| 1989 | e6ecc2be470e3c5c6c5c9d8b90aa83a1f7725084 | a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f | 2024-06-18T09:37:20+03:00 | Georgi Gerganov | | whisper : use ggml_backend_sched (whisper/2239) |
| 1990 | a94e6ff8774b7c9f950d9545baf0ce35e8d1ed2f | 5b6da187508f49a9fa9d95fa22ae804a0780d256 | 2024-06-17T22:08:46+03:00 | Ștefan-Gabriel Muscalu | | update: support Qwen2-57B-A14B (#7835) |
| 1991 | c637fcd34d135a9ff4f97d3a53ad03a910a4a31f | 6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 | 2024-06-17T22:11:08+08:00 | Frank Mai | | fix: divide 0 exception in mamba (#7932) |
| 1992 | 6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 | 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 | 2024-06-17T16:10:15+02:00 | Markus Tavenrath | | Implement non-mapped async IO for CUDA on Windows. (#7896) |
| 1993 | 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 | 006167aaf6b6aaa4daa52961035f7460af19f469 | 2024-06-17T11:09:20+03:00 | Georgi Gerganov | | rpc : fix load/store misaligned addresses (#7948) |
| 1994 | 006167aaf6b6aaa4daa52961035f7460af19f469 | df68d4fa5dc929217d3e64d673e099d7a417b206 | 2024-06-17T15:25:20+10:00 | Brian | | gguf-dump.py: add --markdown dump output (#7853) |
| 1995 | 43b35e38ba371f9a7faa6dca4c5d1e8f698ffd87 | 19b7a836f6658e18e973af532a5cc6ad6b3a27f8 | 2024-06-16T15:23:04-07:00 | Calvin Laurenson | | Add support for sqrt on CUDA (#7953) |
| 1996 | 19b7a836f6658e18e973af532a5cc6ad6b3a27f8 | b5fcf8ef5c29df53cfff60e180b4992a3b2332a6 | 2024-06-11T17:39:01+03:00 | Georgi Gerganov | | cuda : fix bounds check for src0 rows in MMVQ kernel (whisper/2231) |
| 1997 | b5fcf8ef5c29df53cfff60e180b4992a3b2332a6 | 398105ff4373eea385ea8e8625cb417b2ae51134 | 2024-06-16T16:53:11+08:00 | Hong Bo PENG | | ggml : fix and optimize ppc64le (ggml/849) |
| 1998 | cddaf028adc738b5a7ecc60809cb78e0ba0f97c1 | c8a82194a888f68f259e0d0fa96f3332ac7c5cb6 | 2024-06-16T14:50:12+03:00 | Georgi Gerganov | | ggml : fix handling of zero blocks in IQ quants (#7955) |
| 1999 | 7c7836d9d4062d6858e3fb337b135c417ccee6ce | 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 | 2024-06-16T07:17:31+02:00 | 0cc4m | | Vulkan Shader Refactor, Memory Debugging Option (#7947) |
| 2000 | 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 | 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 | 2024-06-15T18:53:40+02:00 | Xuan Son Nguyen | | Add `cvector-generator` example (#7514) |
| 2001 | f8ec8877b75774fc6c47559d529dac423877bcad | 76d66ee0be91e2bec93206e821ee1db8d023cff5 | 2024-06-14T20:28:34+03:00 | olexiyb | | ci : fix macos x86 build (#7940) |
| 2002 | 76d66ee0be91e2bec93206e821ee1db8d023cff5 | 66ef1ceedf983773c8ceb4d925285d41d4e50e2a | 2024-06-14T18:41:49+02:00 | Johannes Gäßler | | CUDA: faster q2_K, q3_K MMQ + int8 tensor cores (#7921) |
| 2003 | e65bbf606c61f49dc06c7ac060cd5ba7ae446025 | 6fcd1331efbfbb89c8c96eba2321bb7b4d0c40e4 | 2024-06-14T16:47:41+03:00 | Radoslav Gerganov | | llama-bench : fix RPC indication (#7936) |
| 2004 | 41b9260f18eb7f325c952006ac46afc1d0d8ad2f | 172c8256840ffd882ab9992ecedbb587d9b21f15 | 2024-06-14T13:16:49+03:00 | Elaine | | convert : add Poro-34B-chat tokenizer support (#7713) |
| 2005 | 172c8256840ffd882ab9992ecedbb587d9b21f15 | a55eb1bf0fa2fd84147bdfd384391e029d988253 | 2024-06-13T15:18:44+03:00 | Radoslav Gerganov | | rpc : fix ggml_backend_rpc_supports_buft() (#7918) |
| 2006 | f578b86b2123d0f92afbaa98a031df4d4464e582 | 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 | 2024-06-13T03:11:35+02:00 | slaren | | move BLAS to a separate backend (#6210) |
| 2007 | 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 | 963552903f51043ee947a8deeaaa7ec00bc3f1a4 | 2024-06-13T00:41:52+01:00 | Olivier Chafik | | `build`: rename main → llama-cli, server → llama-server, llava-cli → llama-llava-cli, etc... (#7809) |
| 2008 | 963552903f51043ee947a8deeaaa7ec00bc3f1a4 | a9cae48003dfc4fe95b8f5c81682fc6e63425235 | 2024-06-12T17:41:51+02:00 | Johannes Gäßler | | CUDA: fix broken oob check for FA vec f32 kernel (#7904) |
| 2009 | dcf752707d96eb305f546526c7bc5d01f0831130 | f2b5764beb35583295e2475479c18f249b139b58 | 2024-06-12T17:05:35+08:00 | Meng, Hengyu | | update intel docker oneapi-basekit to 2024.1.1-devel-ubuntu22.04 (#7894) |
| 2010 | f2b5764beb35583295e2475479c18f249b139b58 | 73bac2b11d7d3e20982fc9ee607625836387db8b | 2024-06-12T03:18:16+02:00 | Patrice Ferlet | | Fix a typo and add Fedora 40 pacakge to install for Vulkan (#7794) [no ci] |
| 2011 | ef52d1d16afc695d798396cdd13594ea5e45a9dd | 14f83526cd27f638c856ea6eff08110b9860eb2a | 2024-06-11T21:20:29+02:00 | 0cc4m | | Update Vulkan RoPE implementation (#7818) |
| 2012 | 14f83526cd27f638c856ea6eff08110b9860eb2a | 6fe42d073f0554eada93ac9d40574025aeedb703 | 2024-06-11T12:18:58-04:00 | Deven Mistry | | fix broken link in pr template (#7880) [no ci] |
| 2013 | c2ce6c47e4f2d891bf29d8810832a3b310a8f205 | b61eb9644d64e90123ac805436d95b94b3b4cc3f | 2024-06-11T07:59:20+02:00 | slaren | | fix CUDA CI by using a windows-2019 image (#7861) |
| 2014 | 396b18dfec2c56846e80362db70af09b9e1d70ba | 864a99e7a01d9422d2f55618dbe62c8099a2175c | 2024-06-11T01:00:30+01:00 | Olivier Chafik | | `json`: document schema conversion in GBNF readme, align manual grammar examples & converters (#7841) |
| 2015 | 864a99e7a01d9422d2f55618dbe62c8099a2175c | fd5ea0f897ecb3659d6c269ef6f3d833e865ead7 | 2024-06-10T18:32:10-04:00 | Jared Van Bortel | | cmake : fix CMake requirement for CUDA (#7821) |
| 2016 | 1f0dabda8d5c131f9d4632aa41de74317cdd61fb | af4ae502ddaeb03cd5861273ca2e9a5ae4551db7 | 2024-06-10T11:45:13+02:00 | Johannes Gäßler | | CUDA: use tensor cores for MMQ (#7676) |
| 2017 | 57bf62ce7cb75cca589943e2050d29bff4026e76 | 3e2ee443159724e2d3a0741f6b167e599ec088aa | 2024-06-09T11:24:29-04:00 | Nicolás Pérez | | docs: Added initial PR template with directions for doc only changes and squash merges [no ci] (#7700) |
| 2018 | 2decf57bc6e4a6b45176c3727d964a01161beecc | 5795b941827fdec6c1662986de962badff456718 | 2024-06-09T06:39:25Z | sasha0552 | | convert-hf : set the model name based on cli arg, if present (#7693) |
| 2019 | 5795b941827fdec6c1662986de962badff456718 | ed9f2521185706481501a5e6d5315397b11802ff | 2024-06-08T22:47:25-04:00 | compilade | | convert-hf : match model part name prefix and suffix (#7687) |
| 2020 | ed9f2521185706481501a5e6d5315397b11802ff | fe1e3917cfa0f9397a765cfd0aef880674d938d5 | 2024-06-08T22:34:29-04:00 | compilade | | gguf-py : decouple adding metadata from writing in GGUFWriter (#7827) |
| 2021 | 7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f | da799b41891e34aac86ce4e173f9c4c0afd4fab3 | 2024-06-08T07:50:31Z | sasha0552 | | server : smart slot selection using Longest Common Prefix (#7728) |
| 2022 | da799b41891e34aac86ce4e173f9c4c0afd4fab3 | c00fad71e507ff386d42bd74846fe06d19dd63a4 | 2024-06-07T19:47:49+02:00 | slaren | | vulkan : reuse parent extra for views (#7806) |
| 2023 | c00fad71e507ff386d42bd74846fe06d19dd63a4 | 27615f5ab21060d96953c9c1e223051ab2188f57 | 2024-06-07T08:56:01-04:00 | Christian Zhou-Zheng | | gguf-split : change binary multi-byte units to decimal (#7803) |
| 2024 | 27615f5ab21060d96953c9c1e223051ab2188f57 | 7027b27d765db95d4ac6b569d976e387a8715881 | 2024-06-07T05:15:07-07:00 | intelmatt | | cmake : fix BUILD_SHARED_LIBS=ON build (#7784) |
| 2025 | d5c938cd7716b9a2ace49a43a469dfbffcff4d28 | c9ee7118d5644dd3df70ea6878b36a9761616aab | 2024-06-07T14:28:26+08:00 | pengxin99 | | [SYCL] fix softmax r2r result wrong issue (#7811) |
| 2026 | ee459f40f65810a810151b24eba5b8bd174ceffe | f83351f9a62a6262f1fc3d08f320033089cddfb5 | 2024-06-06T19:19:59+03:00 | Georgi Gerganov | | server : fix --threads-http arg (#7801) |
| 2027 | f83351f9a62a6262f1fc3d08f320033089cddfb5 | ad675e1c67a05b16e4e12abe30dbecfc808e7b7e | 2024-06-06T16:30:58+03:00 | Georgi Gerganov | | imatrix : migrate to gpt_params (#7771) |
| 2028 | a143c04375828b1f72eb1a326115791b63e79345 | 55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 | 2024-06-06T09:17:54-03:00 | Mattheus Chediak | | README minor fixes (#7798) [no ci] |
| 2029 | 55b2d0849d3ec9e45e4a4d9e480f5fa7977872a6 | f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f | 2024-06-06T10:07:06+01:00 | Olivier Chafik | | grammars: x{min,max} repetition operator (#6640) |
| 2030 | f5d7b268ec4bf8628aa6ccc9f6631d0230dde76f | 2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f | 2024-06-06T09:22:41+02:00 | Joan Fontanals | | llama : add jina v2 base code (#7596) |
| 2031 | 7672adeec7a79ea271058c63106c142ba84f951a | 7d1a378b8fb266782d9248538a661405aad80768 | 2024-06-05T19:07:24+02:00 | Galunid | | Fix encoding in python scripts (#7733) |
| 2032 | 7d1a378b8fb266782d9248538a661405aad80768 | 2b3389677a833cee0880226533a1768b1a9508d2 | 2024-06-05T16:53:00+02:00 | Johannes Gäßler | | CUDA: refactor mmq, dmmv, mmvq (#7716) |
| 2033 | 2b3389677a833cee0880226533a1768b1a9508d2 | 9973e81c5ccf4f31b3980f5aa73f5cfea8699860 | 2024-06-05T11:29:20+03:00 | Georgi Gerganov | | ggml : refactor rope norm/neox (#7634) |
| 2034 | c90dbe026b456a233f8f0fbe752212e6a0503ca2 | b90dc566c1c615289b05b50d61680f23744a21e7 | 2024-06-05T01:26:14+02:00 | jaime-m-p | | Fix per token atrributes bits (#7749) |
| 2035 | b90dc566c1c615289b05b50d61680f23744a21e7 | 1442677f92e45a475be7b4d056e3633d1d6f813b | 2024-06-04T21:06:49+01:00 | agray3 | | Allow number of nodes in CUDA graph to change (#7738) |
| 2036 | 1442677f92e45a475be7b4d056e3633d1d6f813b | 554c247caffed64465f372661f2826640cb10430 | 2024-06-04T21:23:39+03:00 | Georgi Gerganov | | common : refactor cli arg parsing (#7675) |
| 2037 | 987d743d6bc4cee4bde6820733ea33a2abc0afac | b226c1227bcf6412076ecf787421135fd2c42ef0 | 2024-06-04T12:09:15Z | Daniele | | Improve hipBLAS support in CMake (#7696) |
| 2038 | 6d1616944d9efd342ed2a4fd318722adfc9febcd | bde7cd3cd949c1a85d3a199498ac98e78039d46f | 2024-06-04T10:01:09+03:00 | Georgi Gerganov | | ggml : prevent builds with -ffinite-math-only (#7726) |
| 2039 | bde7cd3cd949c1a85d3a199498ac98e78039d46f | a5735e4426b19a3ebd0c653ad8ac01420458ee95 | 2024-06-03T20:03:26+03:00 | Radoslav Gerganov | | llama : offload to RPC in addition to other backends (#7640) |
| 2040 | a5735e4426b19a3ebd0c653ad8ac01420458ee95 | 0b832d53ba0ffcc759c8d62ede3772dd62321f8e | 2024-06-04T00:14:15+09:00 | Masaya, Kato | | ggml : use OpenMP as a thread pool (#7606) |
| 2041 | 0b832d53ba0ffcc759c8d62ede3772dd62321f8e | 3d7ebf63123b8652fb7bbecef7ba731202309901 | 2024-06-03T16:28:58+02:00 | Johannes Gäßler | | make: fix debug options not being applied to NVCC (#7714) |
| 2042 | 3d7ebf63123b8652fb7bbecef7ba731202309901 | a10cda58d3199cd85305e0f03a8c6056714ae2e8 | 2024-06-03T10:59:14+02:00 | 0cc4m | | Vulkan Mixture of Experts (MoE) support (#7628) |
| 2043 | 6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 | 549279d8049d78620a2b081e26edb654f83c3bbd | 2024-06-03T15:49:30+08:00 | zhangkaihuo | | llama : MiniCPM support tied embeddings (#7664) |
| 2044 | 3413ae2193d0693f14bead02e5018f442cbf579b | 1669810d7c2446af8425aa54ff6611bf6f14646c | 2024-06-03T07:59:54+10:00 | Dave Airlie | | fix bug introduced in using calloc (#7701) |
| 2045 | e141ce624af57bdffbaf57014a044eb1d9689230 | 2e666832e6ac78194edf030bd1c295e21bdb022c | 2024-06-01T23:26:10+02:00 | Johannes Gäßler | | Fix FlashAttention debug test, FP32 assert (#7684) |
| 2046 | 2e666832e6ac78194edf030bd1c295e21bdb022c | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 2024-06-01T21:31:48+02:00 | Yazan Agha-Schrader | | server : new UI (#7633) |
| 2047 | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 750f60c03e4d3f53fa51910551ce87a3d508d2d7 | 2024-06-01T21:50:18+05:30 | HanishKVC | | SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) |
| 2048 | 750f60c03e4d3f53fa51910551ce87a3d508d2d7 | 9b596417af11c9ac44fcae0fcfbc6f3665089083 | 2024-06-01T15:47:04+02:00 | Johannes Gäßler | | CUDA: fix Pascal FA, deq. KV to FP16 for batch > 8 (#7681) |
| 2049 | 9b596417af11c9ac44fcae0fcfbc6f3665089083 | a323ec60af14a33d560df98f2cc41b4112cb4f80 | 2024-06-01T08:44:14+02:00 | Johannes Gäßler | | CUDA: quantized KV support for FA vec (#7527) |
| 2050 | 0515ad93f48df63bbff204eddb0cac75e8585c65 | c8047d538f3addab40e3112be60bb92e70ce1a50 | 2024-05-31T17:42:33+02:00 | Galunid | | convert-hf : Handle NotImplementedError in convert-hf-to-gguf (#7660) |
| 2051 | 0c27e6f62eea80140daf152d7b6c154466614e5c | 2e32f874e675f7bc5307cb7b4470ddbe090bab8f | 2024-05-31T14:17:10+03:00 | Georgi Gerganov | | ggml : fix loongson compile warnings (#7537) |
| 2052 | 9022c33646fbf78da35f40c3f98576cc08c40ddf | 5921b8f089d3b7bda86aac5a66825df6a6c10603 | 2024-05-30T21:32:38+01:00 | JohnnyB | | Fixed painfully slow single process builds. (#7326) |
| 2053 | 5dcdf946764fae49a8e2a90bf2f0960bde1c44e8 | 2e2340de1740b07f2418c04792607387d4dc1442 | 2024-05-30T17:07:39+02:00 | Martin Delille | | Fix conan badge display [no ci] (#7645) |
| 2054 | e6157f94c8f835f7f774b98409078867472a34fe | 9c4c9cc83f7297a10bb3b2af54a22ac154fd5b20 | 2024-05-30T21:55:36+10:00 | Brian | | github: add contact links to issues and convert question into research [no ci] (#7612) |
| 2055 | 9c4c9cc83f7297a10bb3b2af54a22ac154fd5b20 | 59b0d077662fab430446b3119fa142f3291c45b2 | 2024-05-30T13:40:00+02:00 | Galunid | | Move convert.py to examples/convert-legacy-llama.py (#7430) |
| 2056 | d5c05821f3c3d6cabe8ac45776fe0ecb0da13eca | 972b555ab935705f3437abd5909a5c46852811f6 | 2024-05-30T17:30:10+08:00 | junchao-loongson | | ggml : fix loongarch build (O2 issue) (#7636) |
| 2057 | 3854c9d07f67de7f8cd6d86117bfaef47549b05a | eb57fee51f7b4d78039f003249873c2eb46f12f6 | 2024-05-30T14:19:08+08:00 | Meng, Hengyu | | [SYCL] fix intel docker (#7630) |
| 2058 | 55d62262a99cd8bc28a1492975791fe433c8cc0f | 975ec63ff26cdf96156d1126d86f75a395fdc43a | 2024-05-29T22:20:40+03:00 | Georgi Gerganov | | metal : remove invalid asserts (#7617) |
| 2059 | fb76ec31a9914b7761c1727303ab30380fd4f05c | cce3dcffc5695bd24835f04e6080070a2a119873 | 2024-05-29T20:17:31+03:00 | Georgi Gerganov | | ggml : fix YARN + add tests + add asserts (#7617) |
| 2060 | 504f0c340f6b5e04de682f6ddefdd3b81208df5d | b864b50ce5e2beefc8c2fd31733e4e1a978b7754 | 2024-05-29T10:09:31+08:00 | zhouwg | | ggml : fix typo in ggml.c (#7603) |
| 2061 | 02c1ecad07f0e2d2febe8196271bcc64bdc9c006 | 6bd12ce409f949012935b7d1b15a21ffa473a565 | 2024-05-28T21:46:34+02:00 | jaime-m-p | | Tokenizer WPM fixes (#7500) |
| 2062 | 6bd12ce409f949012935b7d1b15a21ffa473a565 | 5442939fcc5e6ae41abf40612a95fd71377e487e | 2024-05-28T22:22:50+03:00 | Georgi Gerganov | | sycl : fix assert (#7563) |
| 2063 | 5442939fcc5e6ae41abf40612a95fd71377e487e | 56411a950f255b523a9edd684fd1632752474399 | 2024-05-28T20:49:49+02:00 | Giuseppe Scrivano | | llama : support small Granite models (#7481) |
| 2064 | edc29433fa08b4e5aeb67649a29fc7713af13d04 | 8b99e2aa66ba39e4e1114effea6ef7430881eca4 | 2024-05-28T15:04:09+03:00 | Georgi Gerganov | | tests : fix test-tokenizer-0.sh |
| 2065 | 271ff3fc44a6ecfcea3ebc192e67567d578b7772 | e2b065071c5fc8ac5697d12ca343551faee465cc | 2024-05-28T20:27:27+10:00 | Brian | | github: add refactor to issue template (#7561) |
| 2066 | e2b065071c5fc8ac5697d12ca343551faee465cc | 0548a4187f2e53b8fc6d9ff0f4c71988f708ff42 | 2024-05-28T17:53:37+08:00 | Neo Zhang | | [SYCL]fix ggml_sycl_mul_mat_id() to match the change of api (#7436) |
| 2067 | 0548a4187f2e53b8fc6d9ff0f4c71988f708ff42 | 9335b969e86a222e247adacedf814d8abfff8847 | 2024-05-28T11:04:19+03:00 | Georgi Gerganov | | ggml : generalize GGML_OP_CONCAT (#7563) |
| 2068 | c41767154eb82aa3fe7568fc816c3402b78eae94 | 74b239b3d5f067470d7ef5e26e2e059720572e32 | 2024-05-28T00:41:14-04:00 | Nathan Epstein | | Markdownish code block fix (#7571) |
| 2069 | 10b1e4587670feba2c7730a645accf8234873113 | 197c00681b80f9dea17d11a4436b6b8ef1be0ce8 | 2024-05-27T19:34:40+02:00 | Johannes Gäßler | | make: add --device-debug to NVCC debug flags (#7542) |
| 2070 | 197c00681b80f9dea17d11a4436b6b8ef1be0ce8 | 95f84d5ce8b449a9b16009434aca800df504a02e | 2024-05-27T18:33:42+01:00 | agray3 | | Allow multiple copy function pointers for CUDA graph kernel param updates (#7565) |
| 2071 | 95f84d5ce8b449a9b16009434aca800df504a02e | 5487593bc7ee0b65b9d2e2985b4b61dc77043101 | 2024-05-27T17:34:51+01:00 | AidanBeltonS | | Fix q_xxs using mul_mat_q (#7459) |
| 2072 | d6ef0e77dd25f54fb5856af47e3926cf6f36c281 | dff451cfa1f297348751ce6b538670e1ae9a7d5b | 2024-05-27T10:54:30+10:00 | Brian | | github: add self sorted issue ticket forms (#7543) |
| 2073 | d298382ad977ec89c8de7b57459b9d7965d2c272 | 32a28217f475119926c603341e8273b26932b56a | 2024-05-27T00:10:17+10:00 | Brian | | main: replace --no-special with --special (#7534) |
| 2074 | 32a28217f475119926c603341e8273b26932b56a | c429b33beb35f13934a4dfbe0c138d30b45e5d54 | 2024-05-26T16:02:34+02:00 | Galunid | | Fix aya-23 conversion scripts (#7539) |
| 2075 | b9adcbbf92fc7096bee23fe61496d25652ebf765 | 9588f196b1d7b21bdff013fcf958c249576b2619 | 2024-05-26T06:26:34+05:30 | HanishKVC | | SimpleChat Completion Mode flexibility and cleanup, Settings gMe, Optional sliding window (#7480) |
| 2076 | 9588f196b1d7b21bdff013fcf958c249576b2619 | 3cbd23ed88c03a27e1eb6090ac4a8186ca9ac29a | 2024-05-25T15:21:30+03:00 | Georgi Gerganov | | train : change default FA argument (#7528) |
| 2077 | 00c63907931bb08a0ed2b7e38cf44dd290143cb9 | faa0e6979a11dcb731e9d778ad42ceaa0302015e | 2024-05-25T05:04:03-04:00 | Justine Tunney | | main : don't print special tokens with --grammar (#6923) |
| 2078 | 902184dd3a9d6685e752b19027a48423742531db | 57684331fc2d685f7d1f5775af0b9e47d1829833 | 2024-05-25T05:30:59+02:00 | Xuan Son Nguyen | | fix missing slash in `fs_get_cache_directory()` (#7503) |
| 2079 | 57684331fc2d685f7d1f5775af0b9e47d1829833 | b83bab15a5d2a1e7807d09613a9b34309d86cfaa | 2024-05-24T18:14:42-07:00 | Mikko Juola | | Make tokenize CLI tool have nicer command line arguments. (#6188) |
| 2080 | b83bab15a5d2a1e7807d09613a9b34309d86cfaa | d041d2ceaaf50e058622d92921b3e680ffa4e9e7 | 2024-05-24T21:11:48-04:00 | compilade | | gguf-py : fix and simplify quantized shape round-trip (#7483) |
| 2081 | 1debe72737ea131cb52975da3d53ed3a835df3a6 | 007489e895bad02e4e54758bf0bdf2d6a4cdb7c1 | 2024-05-23T17:17:43+03:00 | Georgi Gerganov | | ggml : silence UB sanitizer error during iq2_xxs quantization (#0) |
| 2082 | 007489e895bad02e4e54758bf0bdf2d6a4cdb7c1 | 8b94e799dfa482adf63419df4905dc79b37e179f | 2024-05-23T16:15:15+02:00 | Tristan Druyen | | Fix phi3 chat template confusion with zephyr (#7449) |
| 2083 | 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 | dacfcebd6022175848e978f82811a244f1033038 | 2024-05-23T15:28:14+03:00 | Georgi Gerganov | | ci : use Pythia models instead of OpenLlama (#7470) |
| 2084 | cd93a28cb1446319af5e2f4b416174c3a8e43546 | 1e374365d170b7f692fd7753c145e21bc14486c8 | 2024-05-23T00:31:20+02:00 | Johannes Gäßler | | CUDA: fix FA out-of-bounds reads (#7479) |
| 2085 | 1e374365d170b7f692fd7753c145e21bc14486c8 | 197ff91462dd05bb9a3be03578114abf0c355536 | 2024-05-22T23:23:21+05:30 | HanishKVC | | SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) |
| 2086 | 6ff13987ad1a9519bee13dd98b6a21cd98979aab | 38c03478a37e460ecd3a21155b338a83bfed7f90 | 2024-05-22T20:04:20+03:00 | Georgi Gerganov | | common : normalize naming style (#7462) |
| 2087 | 38c03478a37e460ecd3a21155b338a83bfed7f90 | b18532a4efeca8796fea8e36195c81cbfd596a4a | 2024-05-22T17:58:25+02:00 | Johannes Gäßler | | CUDA: fix FA out-of-bounds writes (#7465) |
| 2088 | b18532a4efeca8796fea8e36195c81cbfd596a4a | fcda1128bc5f8eb7e1811708fe9d9867b9aec815 | 2024-05-22T16:10:46+02:00 | slaren | | phi3 : duplicate rope factors in each layer (#7447) |
| 2089 | fcda1128bc5f8eb7e1811708fe9d9867b9aec815 | 03d8900ebe062355e26a562379daee5f17ea099f | 2024-05-22T20:53:21+08:00 | k.h.lai | | vulkan: add workaround for iterator boundary check to fix clang-cl debug build (#7426) |
| 2090 | 9b3d83318931aa98c487baaa977626931d059e6a | 95fb0aefab568348da159efdd370e064d1b35f97 | 2024-05-22T12:36:37+03:00 | Georgi Gerganov | | cuda : fix compile warning (#7454) |
| 2091 | 3e5faa85032ec3106a2ad831bf412be9ff139f47 | 201cc11afa0a1950e1f632390b2ac6c937a0d8f0 | 2024-05-22T11:01:35+03:00 | Georgi Gerganov | | cuda : fix rope + add tests (#7452) |
| 2092 | 201cc11afa0a1950e1f632390b2ac6c937a0d8f0 | 6369bf04336ab60e5c892dd77a3246df91015147 | 2024-05-22T04:28:32+08:00 | liuwei-git | | llama : add phi3 128K model support (#7225) |
| 2093 | 6369bf04336ab60e5c892dd77a3246df91015147 | e402de364b643cb89ea9f43057733b5d36298670 | 2024-05-21T23:03:42+03:00 | Georgi Gerganov | | metal : handle F16 inf values, fix FA partial offload (#7434) |
| 2094 | e402de364b643cb89ea9f43057733b5d36298670 | fcf6538ba6702c55eaec70da9a75c81d04900a72 | 2024-05-21T20:40:00+01:00 | Olivier Chafik | | `grammars`: fix resampling logic regression (#7424) |
| 2095 | fcf6538ba6702c55eaec70da9a75c81d04900a72 | c3f8d583560b4f261fa21c976793e538c60cd66c | 2024-05-21T19:27:12+02:00 | Johannes Gäßler | | CUDA: fix unused warning in mmq.cu (#7442) |
| 2096 | d7e852c1bc8e85bf62a6f1aede08cd2de723404a | 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 | 2024-05-21T14:39:48+02:00 | jaime-m-p | | Tokenizer SPM fixes for phi-3 and llama-spm (bugfix) (#7425) |
| 2097 | 917dc8cfa67a72fb7c8bf7392270da3bf4833af4 | fabf30b4c4fca32e116009527180c252919ca922 | 2024-05-20T20:15:57+02:00 | jaime-m-p | | Tokenizer SPM fixes for phi-3 and llama-spm (#7375) |
| 2098 | 3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 | 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb | 2024-05-20T15:10:03+03:00 | Georgi Gerganov | | server : fix temperature + disable some tests (#7409) |
| 2099 | 65c58207ece92ad213f4bfd0f91dcb2dfb664f5b | 1cc0155d04918cb3017afa472acea51b77483c4a | 2024-05-20T15:19:21+08:00 | junchao-loongson | | ggml : add loongarch lsx and lasx support (#6454) |
| 2100 | 1cc0155d04918cb3017afa472acea51b77483c4a | e932094d58f513d5996c3efc9f6fed8238894c57 | 2024-05-20T10:16:41+03:00 | Georgi Gerganov | | server : tuning tests (#7388) |
| 2101 | e932094d58f513d5996c3efc9f6fed8238894c57 | 2789baf480ba7dc9281b65f601f0918e58920f54 | 2024-05-20T08:56:05+03:00 | Georgi Gerganov | | server : return error on too large embedding input (#7389) |
| 2102 | 2789baf480ba7dc9281b65f601f0918e58920f54 | 33c8d50accd6dca73c9c4af00a05e24209c160fe | 2024-05-20T08:55:09+03:00 | Georgi Gerganov | | tests : fix --keep_split -> --keep-split (#7374) |
| 2103 | 1ea2a0036e88172d6c8bf7e1a1989a03894dc955 | f030ec1f7a72aa825b2104823946551b9ec5dfc1 | 2024-05-19T11:37:04-05:00 | Fred Douglas | | quantize : fix --keep-split check (#7374) |
| 2104 | f030ec1f7a72aa825b2104823946551b9ec5dfc1 | e4e6f67be6a8a697f5f89a28c98934e53c99c359 | 2024-05-19T17:19:53+02:00 | 0cc4m | | Vulkan Embedding Fix (#7360) |
| 2105 | e4e6f67be6a8a697f5f89a28c98934e53c99c359 | 5ca49cbecda27ce0a7266658fc3b640bff3ed386 | 2024-05-19T17:08:46+02:00 | slaren | | ggml : fix another case of quants nans (#7387) |
| 2106 | 41858392e17abead21735309bf17cb55183d8c31 | 6aade19ee74b896c59929676629340b36be3e22c | 2024-05-19T16:06:33+02:00 | Johannes Gäßler | | server: fix seed being reported back (#7382) |
| 2107 | 6aade19ee74b896c59929676629340b36be3e22c | ab33f7a338593f6cf1ae98b10b6f8684f63bd72c | 2024-05-19T14:46:46+02:00 | Anas Ahouzi | | Add StableLM2 pre-tokenizer (#7349) |
| 2108 | ab33f7a338593f6cf1ae98b10b6f8684f63bd72c | e23b974f4cf9270d05062d446f406e3ff55d9451 | 2024-05-19T14:19:37+02:00 | slaren | | cuda : clear error after buffer allocation failure (#7376) |
| 2109 | f5bf761747988ee1832766f7d1433739aff810da | 059031b8c40e1f4ba60586842c5b1ed3ddf61842 | 2024-05-19T01:44:42+03:00 | fraxy-v | | Capture CUDA logging output (#7298) |
| 2110 | 059031b8c40e1f4ba60586842c5b1ed3ddf61842 | 511182eabb36f6ec9776e2b3c4d7e16d93d0ac0d | 2024-05-18T18:55:54+03:00 | Georgi Gerganov | | ci : re-enable sanitizer runs (#7358) |
| 2111 | 0f98acfac6cc561dc57586bfff778405e42b576b | ca57e0f35e33f714b9a6c2c4482b87bfe059c819 | 2024-05-18T10:04:55+02:00 | Steffen Röcker | | llama : add support for larger Granite Code Models (20B, 34B) (#7324) |
| 2112 | ca57e0f35e33f714b9a6c2c4482b87bfe059c819 | c1b295eea5c49887a066559527a74e8b94fe9db0 | 2024-05-18T00:57:08-07:00 | strawberrymelonpanda | | perplexity : ndot progress and show stats with < 100 tasks (#7348) |
| 2113 | c1b295eea5c49887a066559527a74e8b94fe9db0 | de731963441ff128248259e1b99573d75264d210 | 2024-05-18T08:10:58+02:00 | 0cc4m | | Update and fix Vulkan soft_max and argsort implementations (#7237) |
| 2114 | b49a13dd2fa9c94c2c19a8c248bb7fa45499f9a8 | 05834841dcb4f922983ea976539c70472272df9a | 2024-05-18T08:46:20+03:00 | Georgi Gerganov | | convert : fix set_vocab_sentencepiece (#6866) |
| 2115 | 05834841dcb4f922983ea976539c70472272df9a | ef277de2add255a08b2b909ebfbf70364d1f4dc4 | 2024-05-18T02:39:54+02:00 | slaren | | ggml : fix quants nans when all the group weights are very close to zero (#7313) |
| 2116 | ef277de2add255a08b2b909ebfbf70364d1f4dc4 | b43272afa29a64dcb8bcf26a96a05bac40792b92 | 2024-05-17T18:39:25-06:00 | Engininja2 | | cmake : fix typo in AMDGPU_TARGETS (#7356) |
| 2117 | b43272afa29a64dcb8bcf26a96a05bac40792b92 | 0fc1e820a9900a3dd08ddd3c6abe6604c53b689b | 2024-05-18T01:09:13+02:00 | jaime-m-p | | Unicode codepoint flags for custom regexs (#7245) |
| 2118 | 82ca83db3c8d45df559c03a4225b6eb34808a2db | f4bd8b3d260bb09491ba63c77ab7012b744362ef | 2024-05-17T11:03:03-04:00 | Gavin Zhao | | ROCm: use native CMake HIP support (#5966) |
| 2119 | 51e9d02599336e62948d29f1d6c05addeb921ac2 | d273c1402b25086fd91aef2467ac13f2e49fa0ea | 2024-05-17T22:40:14+10:00 | Brian | | Added a single test function script and fix debug-test.sh to be more robust (#7279) |
| 2120 | d273c1402b25086fd91aef2467ac13f2e49fa0ea | 27b040691cbe45314147c2745e891a38e9c048d4 | 2024-05-17T15:11:45+03:00 | Aarni Koskela | | py : convert-hf-to-gguf-update improvements (#7340) |
| 2121 | e18bc6aaf3b547890609ed254ee5248e720e5840 | ee94172d33399d2e814ca05c8a3ff8c523ebb093 | 2024-05-17T12:31:58+05:30 | amd-lalithnc | | convert : fix Qwen/Qwen-7b conversion (#7308) |
| 2122 | 934266c0e0b2aa9781fdba2deb112c161ff038a9 | 9c4fdcbec8c7fcc428e723b0d8a1cf1f351ba642 | 2024-05-17T02:58:52-04:00 | Justine Tunney | | ggml : rewrite silu and softmax for cpu (#7154) |
| 2123 | ad52d5c259344888b06fd5acd3344c663dd0621d | 172b78210aae0e54d3668c5de14200efab9fac23 | 2024-05-16T07:38:43+02:00 | Vaibhav Srivastav | | doc: add references to hugging face GGUF-my-repo quantisation web tool. (#7288) |
| 2124 | 172b78210aae0e54d3668c5de14200efab9fac23 | 13ad16af1231ab2d245d35df3295bcfa23de1305 | 2024-05-15T22:36:43-07:00 | Max Krasnyansky | | ci: fix bin/Release path for windows-arm64 builds (#7317) |
| 2125 | 13ad16af1231ab2d245d35df3295bcfa23de1305 | 8f7080bf48828b538bc9387c3d150bbd4fb4cf2d | 2024-05-15T19:47:36-07:00 | Max Krasnyansky | | Add support for properly optimized Windows ARM64 builds with LLVM and MSVC (#7191) |
| 2126 | e1b40ac3b94824d761b5e26ea1bc5692706029d9 | dc020985b8755dd6aa93a2f002f43c3ede808cce | 2024-05-15T12:59:12-05:00 | kunnis | | ggml : use dynamic thread scheduling for matrix multiplication (#6915) |
| 2127 | dc020985b8755dd6aa93a2f002f43c3ede808cce | 344f9126cc0d15891fde9472fe40b8572628ad7d | 2024-05-15T14:44:49+01:00 | agray3 | | Avoid unnecessarily disabling CUDA graphs (#7302) |
| 2128 | 48aa8fd1f213a69b41569f809cc954f24dbc4366 | 583fd6b000ec9ad1b465b5c98524f4a0ae388077 | 2024-05-15T03:52:33-05:00 | John Balis | | ggml : add `ggml_upscale_ext` (ggml/814) |
| 2129 | 583fd6b000ec9ad1b465b5c98524f4a0ae388077 | 9f773486ab78d65f5cca3f7e31c862b7043bf721 | 2024-05-15T08:44:16+02:00 | Johannes Gäßler | | server bench: fix bench not waiting for model load (#7284) |
| 2130 | c3c88f296a72432edb697ac8026dbf2ec18f2b21 | 182adefcf36fc5f4263082ff032c0796fda65578 | 2024-05-12T20:36:31+03:00 | Georgi Gerganov | | ggml : try fix ppc64 (whisper/0) |
| 2131 | 0d26d8ccd8caebab75af697c0275f599075fdacf | 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 | 2024-05-12T17:17:18+08:00 | Hong Bo PENG | | ggml : optimize for ppc64le using VSX intrinsics (ggml/784) |
| 2132 | 4f0263633b40e94e8b69fd6e7e4395cfedfd5c12 | 1265c670fd8e41e1947352c96c5179adda97fb2c | 2024-05-14T10:11:24-04:00 | Steve Grubb | | server: free sampling contexts on exit (#7264) |
| 2133 | 5e31828d3e35c76ecfee665bc23771a4bec1d130 | 541600201e6480f54ae09e58d16b154d4b4b331d | 2024-05-14T14:27:19+03:00 | Radoslav Gerganov | | ggml : add RPC backend (#6829) |
| 2134 | 27f65d6267cf22a44c5ccefa7765d53a05bd1259 | ee52225067622babc277371511b8124884e1c797 | 2024-05-14T14:20:47+09:00 | Ryuei | | docs: Fix typo and update description for --embeddings flag (#7026) |
| 2135 | 30e70334f71b3bd115024affcf98cac3d79aaa95 | 1c570d8beeebad95872dc738ea542a4a0022f78a | 2024-05-13T22:02:36+08:00 | k.h.lai | | llava-cli: fix base64 prompt (#7248) |
| 2136 | b1f8af1886e8187db6bb2a9b87cfc1c0f175f629 | e586ee42595500c53938e937b6b6ad5353ad76dc | 2024-05-13T12:56:47+10:00 | Brian | | convert.py: Outfile default name change and additional metadata support (#4858) |
| 2137 | e586ee42595500c53938e937b6b6ad5353ad76dc | cbf75894d256f1861f6409565db599365de3d4b8 | 2024-05-12T19:40:08-07:00 | Benjamin Findley | | change default temperature of OAI compat API from 0 to 1 (#7226) |
| 2138 | cbf75894d256f1861f6409565db599365de3d4b8 | 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 | 2024-05-13T08:04:29+08:00 | Neo Zhang | | [SYCL] Add oneapi runtime dll files to win release package (#7241) |
| 2139 | 0d5cef78aeafae4d4e6d56e2d4bcda771af58cc9 | dc685be46622a8fabfd57cfa804237c8f15679b8 | 2024-05-13T08:02:55+08:00 | Neo Zhang | | [SYCL] update CI with oneapi 2024.1 (#7235) |
| 2140 | dc685be46622a8fabfd57cfa804237c8f15679b8 | 6f1b63606fc68a09d62d1d74dbd156c35219026d | 2024-05-12T19:40:45+02:00 | Johannes Gäßler | | CUDA: add FP32 FlashAttention vector kernel (#7188) |
| 2141 | 6f1b63606fc68a09d62d1d74dbd156c35219026d | b228aba91ac2cd9eb90e9d423ba1d0d20e0117e2 | 2024-05-12T18:30:23+03:00 | Georgi Gerganov | | cmake : fix version cmp (#7227) |
| 2142 | 7bd4ffb78062587e4012a1c24186223f09b1bc70 | 1622ac023f42e5e01c163321cd98c6596aa9402d | 2024-05-11T21:36:20+03:00 | Georgi Gerganov | | metal : fix warnings (skipme) (#0) |
| 2143 | 6aeff24f8b91e145e92d17ec7ce3adc4ef60b8e9 | 325756d28df7d018a7bac424e1b3bc8acb4ecf07 | 2024-05-11T16:57:53+03:00 | Georgi Gerganov | | metal : fix indent (ggml/0) |
| 2144 | fed0108491a3a3cbec6c6480dc8667ffff9d7659 | 72c177c1f6c16693eee319d4ebd4eaab5e630dd2 | 2024-05-11T12:26:35-05:00 | Josh Ramer | | Scripting & documenting debugging one test without anything else in the loop. (#7096) |
| 2145 | 72c177c1f6c16693eee319d4ebd4eaab5e630dd2 | 5a419926b0c4efab0531401aea91522aaea9fd07 | 2024-05-11T17:28:10+02:00 | Xuan Son Nguyen | | fix system prompt handling (#7153) |
| 2146 | 5a419926b0c4efab0531401aea91522aaea9fd07 | fae9d234b6606693704eca62fe4aefbb6c6abb45 | 2024-05-11T11:06:26-04:00 | compilade | | convert-hf : support bfloat16 conversion (#7158) |
| 2147 | ef0d5e3ec9f99003af3ff326384816c02850ea3f | 3292733f95d4632a956890a438af5192e7031c12 | 2024-04-25T17:24:07+03:00 | Borislav Stanimirov | | build: fix and ignore msvc warnings (ggml/805) |
| 2148 | f99e1e456eaf69cc38c1982a2693ce41c0f897ef | 5ae3426b0b64672991563d4c28b2018b9f961467 | 2024-05-11T16:12:06+08:00 | Haoxiang Fei | | llama : lookup word in vocab before doing BPE merges (#7193) |
| 2149 | 5ae3426b0b64672991563d4c28b2018b9f961467 | b83cc3f5b303ff30c52874b2d5864dc6385ebf9f | 2024-05-11T10:11:28+02:00 | Johannes Gäßler | | server: fix reported top tokens for temperature 0 (#7203) |
| 2150 | b83cc3f5b303ff30c52874b2d5864dc6385ebf9f | 9cb317f77e53067f7a138cc89ef7657148eae8e6 | 2024-05-11T09:46:09+02:00 | Joan Fontanals | | llama : add Jina Embeddings architecture (#6826) |
| 2151 | 9cb317f77e53067f7a138cc89ef7657148eae8e6 | e849648888a11de13aaaa4cb2eda3f5a9c7b444d | 2024-05-11T10:32:41+03:00 | Georgi Gerganov | | ggml : full ALiBi support (#7192) |
| 2152 | 18e437665ce626dddbd79119aa7498493e7cb13b | 8c660242d708d3913a2adc2b6e4a9ee9cf5e4ce7 | 2024-05-10T18:20:10+03:00 | Georgi Gerganov | | metal : fix flash attention kernel requirements (#7169) |
| 2153 | 4e3880978f8b1bf546dd4e6f3b524d6b8739c49c | f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 | 2024-05-10T07:01:08-04:00 | Justine Tunney | | Fix memory bug in grammar parser (#7194) |
| 2154 | d11afd665241c1b3910ab5f040d0216403019d87 | 8c570c9496212073079476651c7517c02581101f | 2024-05-10T02:41:10-04:00 | Andrei | | llava : fix moondream support (#7163) |
| 2155 | eaf4bd8b399a6ed4b834f91d22409d2a05c4d266 | befddd0f15de6efb15d7e7f5b527dfb671f4196f | 2024-05-10T01:04:12+02:00 | slaren | | eval-callback : fix conversion to float (#7184) |
| 2156 | befddd0f15de6efb15d7e7f5b527dfb671f4196f | d46dbc76f8770caec0175f1e57777173c70556a0 | 2024-05-09T20:39:54+02:00 | 0cc4m | | Vulkan Bugfixes and Improvements (#7084) |
| 2157 | 43248e559472556f368988575d9fba906b3eb139 | a743d76a01f23038b2c85af1e9048ee836767b44 | 2024-05-09T15:30:44+02:00 | jaime-m-p | | llama3 custom regex split (#6965) |
| 2158 | a743d76a01f23038b2c85af1e9048ee836767b44 | f31ec120bc36c6270e4948e6a065a7c4cfa0c404 | 2024-05-09T14:32:02+02:00 | Johannes Gäßler | | CUDA: generalize FP16 fattn vec kernel (#7061) |
| 2159 | f31ec120bc36c6270e4948e6a065a7c4cfa0c404 | fd9f92b154850014146f61717cd292a59a5cee5a | 2024-05-09T14:13:05+02:00 | Galunid | | Add warning if token is invalid (#7173) |
| 2160 | fd9f92b154850014146f61717cd292a59a5cee5a | 22842164bcae3251b81ad9e497a16ef66833cb9e | 2024-05-09T13:03:29+02:00 | Daniel Bevenius | | llama : update llama_timings.n_p_eval setting (#7160) |
| 2161 | 22842164bcae3251b81ad9e497a16ef66833cb9e | 47345248827f426038098d016ed11975021b4919 | 2024-05-09T12:56:00+02:00 | Sigbjørn Skjæret | | gguf-py : add special token modification capability (#7166) |
| 2162 | 07cd41d0965829463eff73eda3348aedbfd3a444 | 4426e2987b566f09c7aa96ada9706cc778637620 | 2024-05-09T11:16:45+03:00 | Ahmet Zeer | | TypoFix (#7162) |
| 2163 | 4426e2987b566f09c7aa96ada9706cc778637620 | f98eb31c517c95960df1d0abc48002787f145f3b | 2024-05-08T19:55:32-04:00 | Jared Van Bortel | | cmake : fix typo (#7151) |
| 2164 | f98eb31c517c95960df1d0abc48002787f145f3b | bc4bba364fb96d908f2698e908648df5e6f55e02 | 2024-05-08T18:16:38-04:00 | compilade | | convert-hf : save memory with lazy evaluation (#7075) |
| 2165 | bc4bba364fb96d908f2698e908648df5e6f55e02 | c12452c7aec8a02264afc00196a13caa591a13ac | 2024-05-08T21:55:49+01:00 | agray3 | | Introduction of CUDA Graphs to LLama.cpp (#6766) |
| 2166 | bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 | 26458af1d63c85195cd96cd1673051e332d06d30 | 2024-05-08T20:12:06+01:00 | JohnnyB | | server : add themes + favicon (#6848) |
| 2167 | 26458af1d63c85195cd96cd1673051e332d06d30 | 83330d8cd6491e53e1aca4c5dfc47e039b3c04ff | 2024-05-08T22:08:10+03:00 | Gilad S | | metal : use `vm_allocate` instead of `posix_memalign` on macOS (#7078) |
| 2168 | 229ffff872f8ad0d21c997d18ee7a23692ae60a0 | 1fd9c1741d864d01cd7ec6d67227b92d7bfabf22 | 2024-05-08T20:06:43+08:00 | Ren Xuancheng | | llama : add BPE pre-tokenization for Qwen2 (#7114) |
| 2169 | acdce3cdef6fc2f0b7b5623231fd7762c0884d1c | 3855416027cb25d9a708ffa5581cf503a87856a6 | 2024-05-08T18:54:39+10:00 | Brian | | compare-llama-bench.py: add missing basicConfig (#7138) |
| 2170 | 3855416027cb25d9a708ffa5581cf503a87856a6 | c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 | 2024-05-08T02:30:09-04:00 | Justine Tunney | | ggml : introduce bfloat16 support (#6412) |
| 2171 | c0e6fbf8c380718102bd25fcb8d2e55f8f9480d1 | c780e75305dba1f67691a8dc0e8bc8425838a452 | 2024-05-08T09:14:50+03:00 | Georgi Gerganov | | metal : fix unused warning |
| 2172 | c780e75305dba1f67691a8dc0e8bc8425838a452 | 48b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e | 2024-05-07T21:26:43-03:00 | Jeximo | | Further tidy on Android instructions README.md (#7077) |
| 2173 | 48b2f9c1fc71ab7df5432be2ed9fa7cdf5e8405e | af0a5b616359809ce886ea433acedebb39b12969 | 2024-05-08T01:24:16+01:00 | jukofyork | | Fixed save_imatrix to match old behaviour for MoE (#7099) |
| 2174 | af0a5b616359809ce886ea433acedebb39b12969 | b6aa6702030320a3d5fbc2508307af0d7c947e40 | 2024-05-07T23:07:58+02:00 | Johannes Gäßler | | server: fix incorrectly reported token probabilities (#7125) |
| 2175 | b6aa6702030320a3d5fbc2508307af0d7c947e40 | 260b7c65296fba0568eeb1ff05244ea0be206b54 | 2024-05-07T19:39:43Z | nopperl | | Fix OLMo HF to GGUF conversion (#6910) |
| 2176 | 04976db7a819fcf8bfefbfc09a3344210b79dd27 | 947d3ad27d94f1addef76b5d64c314618f063933 | 2024-05-07T17:20:33+02:00 | omahs | | docs: fix typos (#7124) |
| 2177 | 858f6b73f6e57a62523d16a955d565254be889b4 | b3a995b416e13ae3123a117a743e11d0ede0ca4c | 2024-05-06T11:12:14-07:00 | William Tambellini | | Add an option to build without CUDA VMM (#7067) |
| 2178 | bcdee0daa7c5e8e086b719e5eb4073b00df70e01 | 628b299106d1e9476fdecb3cbe546bf5c60f1b89 | 2024-05-06T09:31:30+03:00 | Georgi Gerganov | | minor : fix trailing whitespace |
| 2179 | 8f8acc8683a00ce40fa5a81161a079d2167126e6 | ca3632602091e959ed2ad4c09c67a7c790b10d31 | 2024-05-05T13:38:55+02:00 | Sigbjørn Skjæret | | Disable benchmark on forked repo (#7034) |
| 2180 | cf768b7e71cbcc9886c753ae963c2b68893d02e4 | fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c | 2024-05-04T13:10:15-03:00 | Jeximo | | Tidy Android Instructions README.md (#7016) |
| 2181 | fcd84a0f5a584ab5271745d7ffef21c8a6bc7b0c | 03fb8a002df2e96104f9e06de9c78d2a8ed91e92 | 2024-05-04T15:26:53+02:00 | viric | | Fix Linux /sys cpu path to guess number of cores (#7064) |
| 2182 | 03fb8a002df2e96104f9e06de9c78d2a8ed91e92 | 92139b90af4841d7fd060b526bdd443b621770ff | 2024-05-04T12:06:40+03:00 | maor-ps | | If first token generated from the server is the stop word the server will crash (#7038) |
| 2183 | 92139b90af4841d7fd060b526bdd443b621770ff | a2ac89d6efb41b535778bfeaecaae8fe295b6ed3 | 2024-05-04T08:32:32+03:00 | Georgi Gerganov | | tests : add test-tokenizer-0.sh + fix some tokenizers (#7036) |
| 2184 | a2ac89d6efb41b535778bfeaecaae8fe295b6ed3 | 433def286e98751bf17db75dce53847d075c0be5 | 2024-05-04T05:36:41+10:00 | Brian | | convert.py : add python logging instead of print() (#6511) |
| 2185 | 6ecf3189e00a1e8e737a78b6d10e1d7006e050a2 | b0d943de179ad5dbd83d51f327fb566066f4ccda | 2024-05-02T23:56:41+08:00 | alwqx | | chore: fix typo in llama.cpp (#7032) |
| 2186 | b0d943de179ad5dbd83d51f327fb566066f4ccda | 8d608a81b7bd170f700648f8214e6f3279d4d715 | 2024-05-01T17:31:30-04:00 | Andrew Downing | | Update LOG_IMPL and LOG_TEE_IMPL (#7029) |
| 2187 | 8d608a81b7bd170f700648f8214e6f3279d4d715 | 3ea0d36000e2314baba7e9fc6a97f08670a6f7e4 | 2024-05-02T04:27:41+09:00 | l3utterfly | | main : fix off by one error for context shift (#6921) |
| 2188 | c4ec9c0d3d67e6b33638e6dad86419e6fd5ffe01 | a8f9b076316e16aadd0791015b3bfd446fe1e904 | 2024-05-01T07:13:59+02:00 | slaren | | ci : exempt confirmed bugs from being tagged as stale (#7014) |
| 2189 | 77e15bec6217a39be59b9cc83d6b9afb6b0d8167 | a68a1e7ed060ee5af2d638585d19e3510ddbf16c | 2024-04-30T15:52:21+03:00 | Georgi Gerganov | | metal : remove deprecated error code (#7008) |
| 2190 | a68a1e7ed060ee5af2d638585d19e3510ddbf16c | 9c67c2773d4b706cf71d70ecf4aa180b62501960 | 2024-04-30T02:34:50-07:00 | Kevin Gibbons | | metal : log more info on error (#6987) |
| 2191 | 9c67c2773d4b706cf71d70ecf4aa180b62501960 | 952d03dbead16e4dbdd1d3458486340673cc2465 | 2024-04-30T12:16:08+03:00 | Georgi Gerganov | | ggml : add Flash Attention (#5021) |
| 2192 | 8843a98c2ba97a25e93319a104f9ddfaf83ce4c4 | b8c1476e44cc1f3a1811613f65251cf779067636 | 2024-04-30T00:52:50+01:00 | Olivier Chafik | | Improve usability of --model-url & related flags (#6930) |
| 2193 | b8c1476e44cc1f3a1811613f65251cf779067636 | 5539e6fdd1b97e0c37c54d34df67f334fc344a26 | 2024-04-29T14:40:14-04:00 | Clint Herron | | Extending grammar integration tests (#6644) |
| 2194 | 5539e6fdd1b97e0c37c54d34df67f334fc344a26 | b8a7a5a90fd3187175d84227dad705ade395ba46 | 2024-04-29T19:56:59+02:00 | Daniel Bevenius | | main : fix typo in comment in main.cpp (#6985) |
| 2195 | b8a7a5a90fd3187175d84227dad705ade395ba46 | d2c898f746a527f09effb061829e68b2e1812a28 | 2024-04-29T17:02:45+01:00 | Olivier Chafik | | build(cmake): simplify instructions (`cmake -B build && cmake --build build ...`) (#6964) |
| 2196 | d2c898f746a527f09effb061829e68b2e1812a28 | 544f1f10adeec3d5ed91c4d3bd3f903904ecea63 | 2024-04-29T18:36:39+03:00 | Georgi Gerganov | | ci : tmp disable gguf-split (#6983) |
| 2197 | 544f1f10adeec3d5ed91c4d3bd3f903904ecea63 | ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a | 2024-04-29T17:55:02+03:00 | Georgi Gerganov | | ggml : fix __MSC_VER -> _MSC_VER (#6977) |
| 2198 | f4ab2a41476600a98067a9474ea8f9e6db41bcfa | 3f167476b11efa7ab08f6cacdeb8cab0935c1249 | 2024-04-29T16:58:41+03:00 | Georgi Gerganov | | llama : fix BPE pre-tokenization (#6920) |
| 2199 | 3f167476b11efa7ab08f6cacdeb8cab0935c1249 | 3055a4180557c6cbe29eacc8284c9e070ac10eab | 2024-04-29T09:35:45-04:00 | David Renshaw | | sampling : use std::random_device{}() for default random seed (#6962) |
| 2200 | 3055a4180557c6cbe29eacc8284c9e070ac10eab | 577277ffd203b190c3dc2ab3e737946dc432132c | 2024-04-29T09:34:41-04:00 | Christian Zhou-Zheng | | convert : fix conversion of some BERT embedding models (#6937) |
| 2201 | 577277ffd203b190c3dc2ab3e737946dc432132c | ca7f29f568803bee4c92d1b3e41c7d721b0dc570 | 2024-04-29T15:08:20+02:00 | Przemysław Pawełczyk | | make : change GNU make default CXX from g++ to c++ (#6966) |
| 2202 | c4f708a93f1df5e35167f9313e000d381298be7f | e00b4a8f816ebc45b98a46e5f5231359b9a017e0 | 2024-04-29T14:36:22+02:00 | Johannes Gäßler | | llama : fix typo LAMMAFILE -> LLAMAFILE (#6974) |
| 2203 | e00b4a8f816ebc45b98a46e5f5231359b9a017e0 | 7bb36ccf91b8a2e92b182dd75624f1fd7cb205ac | 2024-04-28T18:38:44-04:00 | DAN™ | | Fix more int overflow during quant (PPL/CUDA). (#6563) |
| 2204 | b7368332e24c5b2c8038bf8267f43632783fcc35 | 928e0b7013c862cf10701957b3d654aa70f11bd8 | 2024-04-27T17:50:48+02:00 | Pierrick Hymbert | | ci: server: tests python env on github container ubuntu latest / fix n_predict (#6935) |
| 2205 | 017e6999b5184234370b22a2f868e1be911e8d88 | e2764cd7ca1112d9303eba9e81c9935ee67352ff | 2024-04-26T18:39:58+02:00 | slaren | | add basic tensor data validation function (#6884) |
| 2206 | e2764cd7ca1112d9303eba9e81c9935ee67352ff | 4b1c3c98b442a4c84a788fff6323f6fa7e678a5b | 2024-04-26T17:07:42+02:00 | slaren | | gguf : fix mismatch between alloc and free functions (#6929) |
| 2207 | bbe3c6e76157a5d806fdc155451f0ca8936248ee | 7f5ff558eed0f732af8f25c2ab0645610bdec80c | 2024-04-26T12:27:25+02:00 | Pierrick Hymbert | | ci: server: fix python installation (#6925) |
| 2208 | 7f5ff558eed0f732af8f25c2ab0645610bdec80c | 9e4e077ec50fde6049b128662c72d37a3c28e34b | 2024-04-26T12:15:30+02:00 | Pierrick Hymbert | | server: stop generation at `n_ctx_train` if `n_predict` is not set (#6638) |
| 2209 | 9e4e077ec50fde6049b128662c72d37a3c28e34b | 83b72cb086ce46a33dececc86bfe4648b6120aa8 | 2024-04-26T11:11:51+02:00 | Pierrick Hymbert | | ci: server: fix python installation (#6922) |
| 2210 | 83b72cb086ce46a33dececc86bfe4648b6120aa8 | d4a9afc1009f0da88d04b2c5f672d81d5ae94675 | 2024-04-26T10:41:53+03:00 | Georgi Gerganov | | Merge pull request from GHSA-p5mv-gjc5-mwqv |
| 2211 | d4a9afc1009f0da88d04b2c5f672d81d5ae94675 | 7d641c26ac73956a54b204cabefe85c764823678 | 2024-04-26T09:27:49+02:00 | Pierrick Hymbert | | ci: server: fix python installation (#6918) |
| 2212 | 7d641c26ac73956a54b204cabefe85c764823678 | 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 | 2024-04-26T09:26:59+02:00 | Pierrick Hymbert | | ci: fix concurrency for pull_request_target (#6917) |
| 2213 | 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 | dba497e0c1eff27cf0e85d1d73c86fa08e1b5557 | 2024-04-25T12:38:31-07:00 | vik | | llava : add support for moondream vision language model (#6899) |
| 2214 | dba497e0c1eff27cf0e85d1d73c86fa08e1b5557 | fa0b4ad25208d5ec2df6b998ccb29b49b249e82c | 2024-04-25T21:31:17+03:00 | Georgi Gerganov | | cmake : restore LLAMA_LLAMAFILE_DEFAULT |
| 2215 | 853d06ffe26621176d60909a6e3f7c4cd067b305 | 3fe0596c1817a6114ffffb6dbfd6c36ca7815dc7 | 2024-04-25T17:06:27+03:00 | Georgi Gerganov | | ci : tmp disable slow tests |
| 2216 | 51543729ff5b1361ebfb164875c93dff0850d5fe | 4ab99d8d4762869506bb675b36501fd7c2af00b2 | 2024-04-25T15:48:25+03:00 | Georgi Gerganov | | ggml : fix redefinition of vaddvq_f32 for 32-bit ARM (#6906) |
| 2217 | 4ab99d8d4762869506bb675b36501fd7c2af00b2 | 54770413c484660d021dd51b5dbacab7880b8827 | 2024-04-25T14:38:14+02:00 | Daniel Bevenius | | clip : rename lerp function to avoid conflict (#6894) |
| 2218 | 54770413c484660d021dd51b5dbacab7880b8827 | aa750c1ede6232c91de890a14a7731d6daa2bc8e | 2024-04-25T15:12:28+03:00 | Georgi Gerganov | | ggml : fix MIN / MAX macros (#6904) |
| 2219 | aa750c1ede6232c91de890a14a7731d6daa2bc8e | 1966eb2615242f224bf9ca939db8905ab6a174a0 | 2024-04-25T14:27:20+03:00 | Georgi Gerganov | | tests : minor bash stuff (#6902) |
| 2220 | 1966eb2615242f224bf9ca939db8905ab6a174a0 | 784e11dea1f5ce9638851b2b0dddb107e2a609c8 | 2024-04-25T18:29:35+08:00 | jiez | | quantize : add '--keep-split' to quantize model into shards (#6688) |
| 2221 | b4e4b8a9351d918a56831c73cf9f25c1837b80d1 | 3fe847b5747676ee1bf90371c46ed0bc66b57240 | 2024-04-24T08:10:07-05:00 | Douglas Hanley | | llama : add llama_get_pooling_type function (#6862) |
| 2222 | 37246b1031b1680c0dcaf20aef736d6b446203fa | 28103f4832e301a9c84d44ff0df9d75d46ab6c76 | 2024-04-24T05:15:29-05:00 | Kyle Mistele | | common : revert showing control tokens by default for server (#6860) |
| 2223 | 28103f4832e301a9c84d44ff0df9d75d46ab6c76 | c0d1b3e03e27634ac2871761f5033cf9324d472d | 2024-04-24T11:08:36+02:00 | Johannes Gäßler | | Server: fix seed for multiple slots (#6835) |
| 2224 | abd3314064cd3c513f9eef34c3ba6c23a107442c | 3fec68be4e9577fc53158366d3b3af039c17bb1f | 2024-04-24T10:52:37+02:00 | Tristan Druyen | | llama : add phi 3 chat template (#6857) |
| 2225 | 3fec68be4e9577fc53158366d3b3af039c17bb1f | c8297c6af5693555652c40b95974b95d49d2674d | 2024-04-24T15:16:21+08:00 | Junyang Lin | | convert : add support of codeqwen due to tokenizer (#6707) |
| 2226 | c8297c6af5693555652c40b95974b95d49d2674d | 4e96a812b3ce7322a29a3008db2ed73d9087b176 | 2024-04-24T15:00:37+08:00 | liuwei-git | | llama : add phi3 support (#6852) |
| 2227 | 4e96a812b3ce7322a29a3008db2ed73d9087b176 | 192090bae47960f0d38d4967abe398a5d190057e | 2024-04-23T02:53:18+02:00 | Anas Ahouzi | | [SYCL] Windows default build instructions without -DLLAMA_SYCL_F16 flag activated (#6767) |
| 2228 | 192090bae47960f0d38d4967abe398a5d190057e | e931888d5024de814ce7119a18d6a959bfff3821 | 2024-04-22T15:00:36-04:00 | Justine Tunney | | llamafile : improve sgemm.cpp (#6796) |
| 2229 | e931888d5024de814ce7119a18d6a959bfff3821 | 8960fe86ae075c846c5df8848230d1904ba8877f | 2024-04-23T00:05:06+10:00 | Dave Airlie | | ggml : fix calloc argument ordering. (#6820) |
| 2230 | 8960fe86ae075c846c5df8848230d1904ba8877f | c0956b09ba845a7cd787d5580d7c8b96e80f40f5 | 2024-04-22T15:41:11+03:00 | Georgi Gerganov | | llama : fix typo in <|im_end|> token text (#6745) |
| 2231 | c0956b09ba845a7cd787d5580d7c8b96e80f40f5 | e9b4a1bf68c18beff4e33f23ea62c1245b296915 | 2024-04-22T13:22:54+02:00 | Pierrick Hymbert | | ci: fix job are cancelling each other (#6781) |
| 2232 | 40f74e4d739e9250431cf339ae7588b28d8d0663 | b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 | 2024-04-21T18:36:45+03:00 | Georgi Gerganov | | llama : add option to render special/control tokens (#6807) |
| 2233 | b9cc76d87e3d7ae5900f19d4fe8f8976d0a35888 | 7dbdba5690ca61b3ee8c92cfac8e7e251042e787 | 2024-04-21T16:47:57+03:00 | Georgi Gerganov | | ggml : fix ggml_backend_cpu_supports_op() for CPY (#0) |
| 2234 | 7dbdba5690ca61b3ee8c92cfac8e7e251042e787 | c1386c936e9fbc38eb2816c711ab28f13355708e | 2024-04-21T15:03:39+02:00 | Wouter | | llama : add llama-3 chat template (#6751) |
| 2235 | 89b0bf0d5dc123cc1053708f5f84b89e52cdc80b | b97bc3966e852adb626c90be64fd48282800f504 | 2024-04-21T08:19:04-04:00 | Justine Tunney | | llava : use logger in llava-cli (#6797) |
| 2236 | b97bc3966e852adb626c90be64fd48282800f504 | b8109bc0139f15a5b321909f47510b89dca47ffc | 2024-04-21T13:50:41+02:00 | Pedro Cuenca | | llama : support Llama 3 HF conversion (#6745) |
| 2237 | aed82f6837a3ea515f4d50201cfc77effc7d41b4 | 0e4802b2ecbaab04b4f829fde4a3096ca19c84b5 | 2024-04-20T13:27:12+03:00 | Georgi Gerganov | | common : try to fix Android CI (#6780) |
| 2238 | 0e4802b2ecbaab04b4f829fde4a3096ca19c84b5 | 637e9a86c220718d008b54842dfd294aa96d3b7a | 2024-04-19T13:03:35-04:00 | loonerin | | ci: add ubuntu latest release and fix missing build number (mac & ubuntu) (#6748) |
| 2239 | 9958c81b798a5872087b30b360e4674871f2479e | 8b1b1f4982d3e9b994308d05a1c8b9e45c23edb5 | 2024-04-19T09:35:54Z | nopperl | | Implement the OLMo architecture (#6741) |
| 2240 | bca40e98149c7b673558ddd7a3ebeffef789349d | 0d56246f4b9764158525d894b96606f6163c53a8 | 2024-04-19T09:16:31+08:00 | Neo Zhang | | fix wrong parameter in cmd in readme-sycl.md (#6755) |
| 2241 | 0d56246f4b9764158525d894b96606f6163c53a8 | 03c0946d73c63ea73e1d85015b7088298443d438 | 2024-04-18T15:18:48+02:00 | slaren | | ggml : group all experts in a single ggml_mul_mat_id (#6505) |
| 2242 | 03c0946d73c63ea73e1d85015b7088298443d438 | e11b2e6e1e18522ca7cf129600875a0f6fb9307d | 2024-04-18T13:49:01+02:00 | Sigbjørn Skjæret | | convert : support models with multiple chat templates (#6588) |
| 2243 | c71bfd736ee99a56e697697b39240f2ee06ed26d | 3b8f1ec4b18770531d0b1d792f3edf08254e4f0c | 2024-04-18T09:04:47+02:00 | slaren | | llama : fix compatibility with old 2 expert models (#6735) |
| 2244 | 3b8f1ec4b18770531d0b1d792f3edf08254e4f0c | 8dd1ec8b3ffbfa2d26e82e672cea89f5eeb2f141 | 2024-04-17T23:58:26+03:00 | Georgi Gerganov | | llamafile : tmp disable + build sgemm.o when needed (#6716) |
| 2245 | facb8b56f8fd3bb10a693bf0943ae9d69d0828ef | 532c1737a14bb4b99747e6f460874947df37e450 | 2024-04-17T04:51:07+08:00 | Zheng.Deng | | convert : fix autoawq gemma (#6704) |
| 2246 | 666867b799ddd9da7dfdc905ece291ecf286effa | 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 | 2024-04-16T23:50:22+03:00 | Georgi Gerganov | | ggml : fix llamafile sgemm wdata offsets (#6710) |
| 2247 | 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 | dbceec87c0221ec952e69448df6a71f1372a7487 | 2024-04-16T14:55:30-04:00 | Justine Tunney | | ggml : add llamafile sgemm (#6414) |
| 2248 | dbceec87c0221ec952e69448df6a71f1372a7487 | f4dea7da1841a92d2788b0535063abf2f0e28461 | 2024-04-16T08:48:35-07:00 | Ashish | | llama : add StableLM2 12B (#6635) |
| 2249 | f4dea7da1841a92d2788b0535063abf2f0e28461 | 8a56075b07a8b571bf95a912ffdce4c928c2b414 | 2024-04-16T23:40:48+08:00 | Shijie | | llama : add qwen2moe (#6074) |
| 2250 | 7593639ce335e8d7f89aa9a54d616951f273af60 | 132f55795e51094954f1b1f647f97648be724a3a | 2024-04-15T18:35:21+01:00 | Olivier Chafik | | `main`: add --json-schema / -j flag (#6659) |
| 2251 | 132f55795e51094954f1b1f647f97648be724a3a | 3272896d79465fd2befef3425dac8e83933b7ea4 | 2024-04-15T08:56:55-04:00 | compilade | | llama : fix restoring the number of outputs from state files (#6687) |
| 2252 | 17e98d4c96a583d420f12046bc92102381dbd28e | 1958f7e06ca2d2e3ab5698cc67513ba359144d8e | 2024-04-15T17:12:26+08:00 | Neo Zhang Jianyu | | fix mul_mat_id() for new input, make the ut pass (#6682) |
| 2253 | 04fbc5f23e9708136ff03ebe194c7a7e965a7ca4 | f184dd920852d6d372b754f871ee06cfe6f977ad | 2024-04-15T00:16:34+08:00 | Chao Jiang | | Add Command R chat template (#6650) |
| 2254 | 8800226d65d5c98cd34eede6a6c05c78405c52da | e689fc4e912feb19085be6894f475a873759cbfe | 2024-04-14T13:12:59+02:00 | Sigbjørn Skjæret | | Fix --split-max-size (#6655) |
| 2255 | e689fc4e912feb19085be6894f475a873759cbfe | a4ec34e1cd68560e7ff16e21ddc6962b6abd3d1d | 2024-04-14T20:12:36+09:00 | Jaemin Son | | [bug fix] convert github repository_owner to lowercase (#6673) |
| 2256 | de17e3f7455dc7fd298cc61d86798533b9ca7a29 | b5e7285baffb0da8a6619567b52d8e67de41291d | 2024-04-14T10:42:29+08:00 | Neo Zhang Jianyu | | fix memcpy() crash, add missed cmd in guide, fix softmax (#6622) |
| 2257 | b5e7285baffb0da8a6619567b52d8e67de41291d | 4bd0f93e4ab4fe6682e7d0241c1bdec1397e954a | 2024-04-14T00:21:55+02:00 | Johannes Gäßler | | CUDA: fix matrix multiplication logic for tests (#6667) |
| 2258 | ab9a3240a9da941fdef5cd4a25f2b97c2f5a67aa | fbbc030ba93561fac842af994c5c6c4c1147f13b | 2024-04-12T19:43:38+01:00 | Olivier Chafik | | JSON schema conversion: ⚡️ faster repetitions, min/maxLength for strings, cap number length (#6555) |
| 2259 | 5c4d767ac028c0f9c31cba3fceaf765c6097abfc | ef21ce4ccb41164cb52997bd2210d92bc6a6c5d1 | 2024-04-12T10:52:36+02:00 | Rene Leonhardt | | chore: Fix markdown warnings (#6625) |
| 2260 | ef21ce4ccb41164cb52997bd2210d92bc6a6c5d1 | dee7f8d6928cc680cc969f7d93f98c3e24dcad41 | 2024-04-12T11:49:58+03:00 | Georgi Gerganov | | imatrix : remove invalid assert (#6632) |
| 2261 | f7001ccc5aa359fcf41bba19d1c99c3d25c9bcc7 | a474f50ebb3e10be3371562f75f3f573f1a86b5f | 2024-04-11T17:44:48-04:00 | Clint Herron | | As suggested by @slaren, disabling Metal for test to fix CI build on OSX from #6576 (#6619) |
| 2262 | a474f50ebb3e10be3371562f75f3f573f1a86b5f | cbaadc92942c50aab599a9e4c163afc1f44f7c26 | 2024-04-11T21:56:29+02:00 | Nikolas | | Refactor Error Handling for CUDA (#6575) |
| 2263 | cbaadc92942c50aab599a9e4c163afc1f44f7c26 | 1bbdaf6ecda6f0a360dfb307b256fcb6838c560b | 2024-04-11T19:47:34+01:00 | Olivier Chafik | | grammars: 1.5x faster inference w/ complex grammars (vector reserves / reuses) (#6609) |
| 2264 | 1bbdaf6ecda6f0a360dfb307b256fcb6838c560b | f4183afe6a22f356ee222a710686ae7f83dbd949 | 2024-04-11T19:52:21+02:00 | Hugo Roussel | | ci: download artifacts to release directory (#6612) |
| 2265 | f4183afe6a22f356ee222a710686ae7f83dbd949 | b804b1ef77351d2a11be945462c6c251710476cb | 2024-04-11T15:22:47+02:00 | Daniel Bevenius | | scripts : add --outdir option to hf.sh (#6600) |
| 2266 | b804b1ef77351d2a11be945462c6c251710476cb | 8228b66dbc16290c5cbd70e80ab47c068e2569d8 | 2024-04-11T14:51:07+02:00 | Pierrick Hymbert | | eval-callback: Example how to use eval callback for debugging (#6576) |
| 2267 | 67fac4b95fcccfda8ab965e9ba4992a9ddf3a25f | 29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e | 2024-04-10T08:58:48+02:00 | Pierrick Hymbert | | docs : how to add a model (#6565) |
| 2268 | 29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e | b231b37b095f172b26b1300ca442a147ea048b64 | 2024-04-10T00:49:12-06:00 | Artem Zinnatullin | | readme : fix ROCm link (#6579) |
| 2269 | ba5e134e073ec6837078c874aba44a702944a676 | 1b67731e184e27a465b8c5476061294a4af668ea | 2024-04-10T00:23:02+02:00 | Jiří Sejkora | | readme: fix typo in amdgpu target name (#6573) |
| 2270 | 1b67731e184e27a465b8c5476061294a4af668ea | c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3 | 2024-04-09T13:44:08-04:00 | Jared Van Bortel | | BERT tokenizer fixes (#6498) |
| 2271 | 5dc9dd7152dedc6046b646855585bd070c91e8c8 | e11a8999b5690f810c2c99c14347f0834e68c524 | 2024-04-09T09:16:13+01:00 | Carolinabanana | | llama : add Command R Plus support (#6491) |
| 2272 | cc4a95426d17417d3c83f12bdb514fbe8abe2a88 | cecd8d3c98b48f51aaa1d4c729e55bd319f6799c | 2024-04-08T22:25:49+03:00 | Georgi Gerganov | | llama : fix attention layer count sanity check (#6550) |
| 2273 | b73e564b16086845a8b4fffd26e22685d3e0c3db | e3c337d87ca650972105a51c6ce302dd236c07ad | 2024-04-08T16:23:01+03:00 | Georgi Gerganov | | quantize : fix precedence of cli args (#6541) |
| 2274 | e3c337d87ca650972105a51c6ce302dd236c07ad | beea6e1b16e783a0886e78dec01002a8c00db24d | 2024-04-08T06:02:30-07:00 | Rick G | | llama : support negative ith in llama_get_ API (#6519) |
| 2275 | beea6e1b16e783a0886e78dec01002a8c00db24d | 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 | 2024-04-08T20:43:30+08:00 | Jan Boon | | llama : save and restore kv cache for single seq id (#6341) |
| 2276 | 855f54402e866ed19d8d675b56a81c844c64b325 | b909236c0bf0b6e872af95df9490492ecec310ac | 2024-04-07T19:52:19+01:00 | Mark Fairbairn | | Change Windows AMD example to release build to make inference much faster. (#6525) |
| 2277 | f77261a7c525fa1fa47b18a3d78cd308ae41cafc | 43e8995e754b8e04642e92822055d193a3272b37 | 2024-04-04T14:49:24+02:00 | Slava Primenko | | ggml: bypass code incompatible with CUDA < 11.1 (whisper/2020) |
| 2278 | d4f220a5ccdc6308173c1a31fad21d7c3fbc96c1 | 54ea0698fbf87e36a5d68a98c95f6bdd0fb91557 | 2024-04-07T10:55:59+08:00 | Neo Zhang Jianyu | | support/fix OPs GGML_TYPE_IQ4_NL, GGML_TYPE_IQ4_XS, GGML_TYPE_IQ3_XXS, GGML_TYPE_IQ3_S, GGML_TYPE_IQ2_XXS, GGML_TYPE_IQ2_XS, GGML_TYPE_IQ2_S, GGML_TYPE_IQ1_S, GGML_TYPE_IQ1_M (#6521) |
| 2279 | b66aec675c1571a06b3570b858ae711246f96f84 | 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d | 2024-04-03T22:57:20+02:00 | Daniel Bevenius | | backend : fix typo in scheduler documentation (ggml/781) |
| 2280 | 57dd02c44b2a0eb79e28f6c5eb8242a5d2d3174d | 75cd4c77292034ecec587ecb401366f57338f7c0 | 2024-04-06T10:31:33-04:00 | Clint Herron | | Tests: Added integration tests for GBNF parser (#6472) |
| 2281 | 75cd4c77292034ecec587ecb401366f57338f7c0 | a8bd14d55717754a1f48313a846a2b16fa998ad2 | 2024-04-06T05:40:47+02:00 | Pierrick Hymbert | | ci: bench: support sse and fix prompt processing time / server: add tokens usage in stream OAI response (#6495) |
| 2282 | 1b496a745c315022df2d919374052e6004ced8d3 | a307375c02cac45cff53cf2520330b43fecc7718 | 2024-04-05T14:35:06+01:00 | Ouadie EL FAROUKI | | [SYCL] Fixed minor bug when enabling FP16 for non intel targets (#6464) |
| 2283 | b660a5729e1e7508671d3d0515fd7efaeaeb85b9 | 0a1d889e27d6aaa3293dd2c692b849a9bcf4b474 | 2024-04-05T01:16:37+08:00 | Jun Jie | | readme : fix typo (#6481) |
| 2284 | 0a1d889e27d6aaa3293dd2c692b849a9bcf4b474 | 7dda1b727ef1730783a6077136d28b83e70dd397 | 2024-04-04T17:31:22+01:00 | Ed Lepedus | | server: add cURL support to server Dockerfiles (#6474) |
| 2285 | 8120efee1d9931b514aeb5a047209d576f23286c | a74401f0e5ebb15fa4d8b6619d1baa6ea9179123 | 2024-04-04T16:59:04+02:00 | Pierrick Hymbert | | ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478) |
| 2286 | 7a2c92637ae265654a68f62e6a7610b358255d3f | 4bcd6b959ca3991084ad1d8464caf2a734e29b1d | 2024-04-04T11:57:58+02:00 | Pierrick Hymbert | | ci: bench: add more ftype, fix triggers and bot comment (#6466) |
| 2287 | 4bcd6b959ca3991084ad1d8464caf2a734e29b1d | 9b84ae1806cded4d6683c7b810925da5ead40607 | 2024-04-04T09:49:21+02:00 | Daniel Bevenius | | common: remove duplicate check for curl (#6471) |
| 2288 | 9b84ae1806cded4d6683c7b810925da5ead40607 | 4399f13fb9462cd06f3f154d0aee738425000fea | 2024-04-04T03:44:28-04:00 | Clint Herron | | examples : add GBNF validator program (#5948) |
| 2289 | 72d73af65132792a52433952ca4729b01c36cde2 | 5fb1574c8112c757fc202fdae279da883f34e610 | 2024-04-04T02:32:53-04:00 | Clint Herron | | convert : fix for lint error complaining of bare except (#6470) |
| 2290 | 5fb1574c8112c757fc202fdae279da883f34e610 | 60cdf40cc32f0ad4cb11e0ca8fd38f3b93d8d640 | 2024-04-03T13:22:57-07:00 | Fattire | | A few small fixes to server's README docs (#6428) |
| 2291 | bb43cf7e9d86d69ffd9c7f008f75db890a35b45a | 9f62c0173d964972849251c8ad12fc356f5b7896 | 2024-04-04T02:05:10+08:00 | bryanSwk | | llama : add SEA-LION support (#6448) |
| 2292 | e69945d953b651674d6e6978022edf00c3a34d03 | db214fa578e00b01e0884fc2725c9349608bdab5 | 2024-04-03T14:48:07-03:00 | Joyce | | security : create policy (#6354) |
| 2293 | db214fa578e00b01e0884fc2725c9349608bdab5 | 1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a | 2024-04-03T21:12:52+05:30 | Abhishek Gopinath K | | Missing tokenizer.model error during gguf conversion (#6443) |
| 2294 | 1ff4d9f3d683f02ef8a12e04bfac84300c44bd3a | 076b08649ecc3b0e1c0709c2a086a63eddd1bf32 | 2024-04-03T23:24:31+08:00 | kaizau | | Add OpenChat, Alpaca, Vicuna chat templates (#6397) |
| 2295 | 08a0c0206075556e82aca0feafad530dcc5f1426 | 52604860f93063ef98863921da697576af1c7665 | 2024-04-03T15:07:05+02:00 | slaren | | ggml : mul_mat_id use the same tensor for all the experts (#6387) |
| 2296 | 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 | 226e819371eec0f298d9075198394a07b23ecfa9 | 2024-04-01T13:30:43+02:00 | Johannes Gäßler | | compare-llama-bench.py: fix long hexsha args (#6424) |
| 2297 | 226e819371eec0f298d9075198394a07b23ecfa9 | c50a82ce0f71558cbb8e555146ba124251504b38 | 2024-04-01T12:36:40+02:00 | Pierrick Hymbert | | ci: server: verify deps are coherent with the commit (#6409) |
| 2298 | 37e7854c104301c5b5323ccc40e07699f3a62c3e | c342d070c64a1ffe35d22c1b16b672e684a30297 | 2024-03-30T11:36:07+01:00 | Pierrick Hymbert | | ci: bench: fix Resource not accessible by integration on PR event (#6393) |
| 2299 | c342d070c64a1ffe35d22c1b16b672e684a30297 | f7fc5f6c6f3700da311de7fe93977c81798f02d3 | 2024-03-30T01:29:56+03:30 | Mohammadreza Hendiani | | Fedora build update (#6388) |
| 2300 | f7fc5f6c6f3700da311de7fe93977c81798f02d3 | ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6c | 2024-03-29T22:34:44+01:00 | Xuan Son Nguyen | | split: allow --split-max-size option (#6343) |
| 2301 | ba0c7c70ab5b15f1f2be7fb0dfbe0366dda30d6c | d48ccf3ad4fea5b9ede209c7f40be65371987bfe | 2024-03-29T17:29:21+01:00 | 0cc4m | | Vulkan k-quant mmq and ggml-backend offload functionality (#6155) |
| 2302 | 069574775cea67d8a977904e4d534aff47a671f4 | cfde806eb95de06d84162bdee593dad33a1d2693 | 2024-03-29T21:37:03+08:00 | hxer7963 | | [Model] Add support for xverse (#6301) |
| 2303 | cfde806eb95de06d84162bdee593dad33a1d2693 | b910287954d4462fd3d48938336770e258459677 | 2024-03-29T14:34:28+02:00 | Georgi Gerganov | | ci : fix BGE wget (#6383) |
| 2304 | b75c38166cf0c66793a32d5c3d6cb69929dd083d | bfe7dafc9cf96b9a09ead347fed9a547930fc631 | 2024-03-29T08:15:00+01:00 | Pedro Cuenca | | convert : allow conversion of Mistral HF models (#6144) |
| 2305 | 66ba56025602270152f5ba5234f3a80be3dee1c9 | 0308f5e3d7bf9879f818b1a4ae589ff36b242af5 | 2024-03-28T22:33:10+08:00 | Ziang Wu | | llava : fix MobileVLM (#6364) |
| 2306 | 0308f5e3d7bf9879f818b1a4ae589ff36b242af5 | 28cb9a09c4d10a489be1238abe7a858dcd4d65f2 | 2024-03-28T08:05:54-04:00 | compilade | | llama : fix command-r inference when omitting outputs (#6367) |
| 2307 | 28cb9a09c4d10a489be1238abe7a858dcd4d65f2 | cfc4d75df6399b36153ef739f2c1abee4c114bb8 | 2024-03-28T11:27:56+01:00 | Pierrick Hymbert | | ci: bench: fix master not schedule, fix commit status failed on external repo (#6365) |
| 2308 | cfc4d75df6399b36153ef739f2c1abee4c114bb8 | 6902cb7f2e3479f364ee177118200fb7e4e9fc92 | 2024-03-28T16:51:06+08:00 | Ting Sun | | doc: fix outdated default value of batch size (#6336) |
| 2309 | f6a0f5c6422200764b7929064c39dcf4bb0e9cd6 | d0e2f6416bd43eddb70137f6b96c7bc3d0246102 | 2024-02-15T14:25:04+01:00 | hutli | | nix: .#widnows: init |
| 2310 | d0e2f6416bd43eddb70137f6b96c7bc3d0246102 | 25f4a613c4ed6451162a87cb90be10d610b49f0f | 2024-03-28T12:03:30+08:00 | Ziang Wu | | doc: fix typo in MobileVLM-README.md (#6181) |
| 2311 | 25f4a613c4ed6451162a87cb90be10d610b49f0f | a016026a3ac16d8c9b993a3573f19b9556d67de4 | 2024-03-28T08:55:24+08:00 | Neo Zhang Jianyu | | [SYCL] fix set main gpu crash (#6339) |
| 2312 | a016026a3ac16d8c9b993a3573f19b9556d67de4 | 53c7ec53d5eca26b2c0c648605543a5fa6c12817 | 2024-03-27T20:26:49+01:00 | Pierrick Hymbert | | server: continuous performance monitoring and PR comment (#6283) |
| 2313 | 53c7ec53d5eca26b2c0c648605543a5fa6c12817 | e5b89a441af23a74b861b0bf8db3239139041876 | 2024-03-27T16:17:46Z | Someone Serge | | nix: ci: dont test cuda and rocm (for now) |
| 2314 | e5b89a441af23a74b861b0bf8db3239139041876 | 3a0345970ed0353fa857df3c8a62a2b3318b1364 | 2024-03-27T15:07:50+01:00 | slaren | | ggml : fix bounds checking of zero size views (#6347) |
| 2315 | e82f9e2b833d88cd2b30123ef57346c2cb8abd99 | cbc83436197cde617cad696e665879c20df77daa | 2024-03-27T08:16:40Z | AidanBeltonS | | [SYCL] Fix batched impl for NVidia GPU (#6164) |
| 2316 | e562b9714b9b3e242361a7f74bbbeb00f6bd99ac | 2ab4f00d25c0682a74472412d66454df211e4b0e | 2024-03-27T08:23:10+01:00 | Sigbjørn Skjæret | | common : change --no-penalize-nl to --penalize-nl (#6334) |
| 2317 | 0642b22cd12af278d6e7e459b73411947c169381 | a4f569e8a316cbd33d2b4de94b694d111507475a | 2024-03-27T13:55:29+08:00 | Eric Zhang | | server: public: use relative routes for static files (#6325) |
| 2318 | a4f569e8a316cbd33d2b4de94b694d111507475a | 32c8486e1f0297393cb22ac0a0d26a6b17ad4d54 | 2024-03-27T09:47:06+08:00 | Neo Zhang Jianyu | | [SYCL] fix no file in win rel (#6314) |
| 2319 | 557410b8f06380560155ac7fcb8316d71ddc9837 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | 2024-03-26T10:46:41-04:00 | compilade | | llama : greatly reduce output buffer memory usage (#6122) |
| 2320 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | e097633f63fdd26d492844f7eff056e4083fd9eb | 2024-03-26T15:21:27+01:00 | Kawrakow | | IQ1_M: 1.75 bpw quantization (#6302) |
| 2321 | e097633f63fdd26d492844f7eff056e4083fd9eb | d25b1c31b07c3675443a55a828dd58cfef5a241c | 2024-03-26T13:32:19+01:00 | Pedro Cuenca | | convert-hf : fix exception in sentencepiece with added tokens (#6320) |
| 2322 | deb7240100da99555b9ab9dc635021e591fceaf5 | 3d032ece8e6973441273601ca2981130608e287d | 2024-03-26T18:11:46+09:00 | Minsoo Cheong | | embedding : adjust `n_ubatch` value (#6296) |
| 2323 | e190f1fca6f60d80944f9e8709d343a025c4d245 | 280345968dabc00d212d43e31145f5c9961a7604 | 2024-03-25T20:51:46-04:00 | Joseph Stahl | | nix: make `xcrun` visible in Nix sandbox for precompiling Metal shaders (#6118) |
| 2324 | b06c16ef9f81d84da520232c125d4d8a1d273736 | 1f2fd4e727a707f85d58e0b56075c3e6334d18d8 | 2024-03-25T18:52:45+01:00 | Christian Kögler | | nix: fix blas support (#6281) |
| 2325 | 2f34b865b62b1d2b5eb8a27885e4de220deeacbd | ae1f211ce2138448b47ebb148e25c58406845278 | 2024-03-25T15:43:22+01:00 | slaren | | cuda : fix LLAMA_CUDA_F16 build (#6298) |
| 2326 | ad3a0505e3b6cd777259ee35e61d428357ffc565 | 95ad616cddda50273e955bfe192328acd9aa4896 | 2024-03-25T09:42:17+01:00 | Xuan Son Nguyen | | Server: clean up OAI params parsing function (#6284) |
| 2327 | 95ad616cddda50273e955bfe192328acd9aa4896 | 64e7b47c6986221f2ff5c57c89dfc018bb0e9e6d | 2024-03-25T15:52:41+08:00 | Neo Zhang Jianyu | | [SYCL] fix SYCL backend build on windows is break by LOG() error (#6290) |
| 2328 | 7733f0c76081b2a69b5f8b192db2db7c43629d58 | a32b77c4b2c1808654d0b952f26c37d73d2e746b | 2024-03-25T01:39:56-04:00 | Justine Tunney | | ggml : support AVX512VNNI (#6280) |
| 2329 | a32b77c4b2c1808654d0b952f26c37d73d2e746b | a0e584defd8c16e7a51ab895f595df0448d710d0 | 2024-03-24T14:45:56-07:00 | Rick G | | Fix heap corruption from wmode out-of-bound writes on windows (#6272) |
| 2330 | a0e584defd8c16e7a51ab895f595df0448d710d0 | 7aed0ffe6855e9cadcf413f288753af4566bfeb8 | 2024-03-24T16:18:45+02:00 | Georgi Gerganov | | imatrix : fix wname for mul_mat_id ops (#6271) |
| 2331 | 7aed0ffe6855e9cadcf413f288753af4566bfeb8 | ea279d56091b90fbbe063b598f5229d95f58ef68 | 2024-03-24T14:21:17+01:00 | Johannes Gäßler | | Fixed lookup compilation issues on Windows (#6273) |
| 2332 | ea279d56091b90fbbe063b598f5229d95f58ef68 | 586e7bc561be88e929a9afca7e67d8ead00c53bd | 2024-03-24T09:57:06+01:00 | Pierrick Hymbert | | ci : close inactive issue, increase operations per run (#6270) |
| 2333 | 586e7bc561be88e929a9afca7e67d8ead00c53bd | ddf65685105a39a57b1e7f80c3aa502a6313af24 | 2024-03-24T17:54:07+09:00 | Minsoo Cheong | | sampling : deduplicated code for probability distribution access (#6240) |
| 2334 | d03224ac9840351023ff8abcf4aa0542258a53df | 94d1b3b4119209efcdd08df0dceaecbd1fe7f85c | 2024-03-24T09:44:01+08:00 | Neo Zhang Jianyu | | Support build win release for SYCL (#6241) |
| 2335 | 94d1b3b4119209efcdd08df0dceaecbd1fe7f85c | 95562175f83a49755ff6fd3bad09409417c8e6f9 | 2024-03-23T18:48:02-04:00 | Jared Van Bortel | | use _wfopen instead of fopen on Windows (#6248) |
| 2336 | f482bb2e4920e544651fb832f2e0bcb4d2ff69ab | 1997577d5e121568ae39f538021733ccd4278c23 | 2024-03-23T18:07:00+01:00 | Pierrick Hymbert | | common: llama_load_model_from_url split support (#6192) |
| 2337 | 476b0251b27fb64c575507024a671e639d675594 | 21cad01b6e6e1a96f99391f95e8ea8ae25c8288e | 2024-03-23T17:41:53+01:00 | Julius Arkenberg | | llama : add grok-1 support (#6204) |
| 2338 | 50ccaf5eacb50a2ca378a4ef0dc7aeb45fead652 | 56a00f0a2f48a85376f48b5ce77699df781631ae | 2024-03-23T01:24:36+01:00 | Johannes Gäßler | | lookup: complement data from context with general text statistics (#5479) |
| 2339 | 56a00f0a2f48a85376f48b5ce77699df781631ae | 92397d87a45a09b5449d845a64856f177cd7a920 | 2024-03-22T21:10:39+02:00 | Georgi Gerganov | | common : default --hf-file to --model (#6234) |
| 2340 | dba1af612926cbd4ebe2d876277af1e3305177e0 | ee804f6223777019cf921e0d99cc24669313ab98 | 2024-03-22T19:00:01+01:00 | Pierrick Hymbert | | llama_model_loader: support multiple split/shard GGUFs (#6187) |
| 2341 | 80bd33bc2c4be352697dc8473339f25e1085d117 | e80f06d2a194be62ab5b1cd7ef7c7a5b241dd4fb | 2024-03-22T15:33:38+02:00 | Georgi Gerganov | | common : add HF arg helpers (#6234) |
| 2342 | 72114edf068a9b2f54d3b09e9a198f611be397e8 | 2f0e81e053b41ca28e73a841e7bdbf9820baaa57 | 2024-03-22T13:07:44Z | Olivier Chafik | | json-schema-to-grammar : fix order of props + non-str const/enum (#6232) |
| 2343 | 6b8bb3a31d260a01020497c5f01025c34222fcb9 | 68e210b3543e0cc71268bee0920441747679ee13 | 2024-03-22T19:12:05+08:00 | Jan Boon | | server : fix n_keep always showing as 0 in response (#6211) |
| 2344 | 68e210b3543e0cc71268bee0920441747679ee13 | b3e94f26bab8e3b5338b5902e5af5bb01894cb4a | 2024-03-22T13:08:28+02:00 | Georgi Gerganov | | server : enable continuous batching by default (#6231) |
| 2345 | b3e94f26bab8e3b5338b5902e5af5bb01894cb4a | b2075fd6a578f5685060df4baa90ae9e48e98c70 | 2024-03-22T11:35:53+02:00 | Georgi Gerganov | | metal : proper assert for mat-mat memory alignment (#6225) |
| 2346 | fa046eafbc70bf97dcf39843af0323f19a8c9ac3 | be07a03217376c53b1d95e5f658adbbbb2831555 | 2024-03-21T21:32:42-04:00 | DAN™ | | Fix params underscore convert to dash. (#6203) |
| 2347 | d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f | f372c49ccdc561ab96fb3c7d2b7cbc0f89a4b359 | 2024-03-21T19:54:28+01:00 | slaren | | cuda : disable host register by default (#6206) |
| 2348 | 03a8f8fafec2e21009be9fe7297d92e5d4538964 | cfd3be76e37dab92c846d75a2421178f20db4a11 | 2024-03-21T13:59:53+01:00 | slaren | | cuda : fix LLAMA_CUDA_F16 build (#6197) |
| 2349 | cfd3be76e37dab92c846d75a2421178f20db4a11 | 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 | 2024-03-21T13:59:38+01:00 | Kawrakow | | ggml : same IQ4_NL quantization for CPU/CUDA/Metal (#6196) |
| 2350 | 5b7b0ac8dfdd800c0fd0dc69b69991e8cb19fb46 | 1943c0198125a0da1a200390e82cf461f9080d99 | 2024-03-21T11:50:43Z | Olivier Chafik | | json-schema-to-grammar improvements (+ added to server) (#5978) |
| 2351 | 1943c0198125a0da1a200390e82cf461f9080d99 | 5e43ba87429d85acbde97d16b2f48d9de992cc80 | 2024-03-21T10:30:40+01:00 | Vaibhav Srivastav | | ci : fix indentation error (#6195) |
| 2352 | 42e21c68826f2e56b9592dccd9f3c43895b6890d | 1c51f98adcbad40e3c41f0a6ffadeb723190b417 | 2024-03-21T01:47:46+01:00 | slaren | | cuda : fix conflict with std::swap (#6186) |
| 2353 | 1c51f98adcbad40e3c41f0a6ffadeb723190b417 | f9c7ba34476ffc4f13ae2cdb1aec493a16eb8d47 | 2024-03-20T21:03:26+01:00 | slaren | | cuda : print the returned error when CUDA initialization fails (#6185) |
| 2354 | 272935b281fee5c683e3d6d1eb580b84553cf503 | ccf58aa3ec4d20b10162ba40898dc038ad4c3fad | 2024-03-20T23:02:32+08:00 | Ziang Wu | | llava : add MobileVLM_V2 backup (#6175) |
| 2355 | 91f8ad167dcd24b54615b468d9dd764ebe1d37ad | 6b7e76d28cdf4361740054140708c71828453522 | 2024-03-20T13:30:36+01:00 | Xuan Son Nguyen | | Server: version bump for httplib and json (#6169) |
| 2356 | f8c4e745e1e728204ab26dbadf52853545e6789c | 47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 | 2024-03-20T19:20:37+08:00 | Ziang Wu | | llava : add a MobileVLM_V2-1.7B backup (#6152) |
| 2357 | bd60d82d0cc8b6852ec535495a5042dbdf05de24 | 6c0b287748327741b113d7d6018b68c63039b1c5 | 2024-03-20T01:33:49-04:00 | Jared Van Bortel | | server tests : more pythonic process management; fix bare `except:` (#6146) |
| 2358 | d0d5de42e5a65865b5fddb6f5c785083539b74c3 | b80cf3b2d1dee0ad325f7a794fecc66befce7336 | 2024-03-19T12:05:44+01:00 | Pierrick Hymbert | | gguf-split: split and merge gguf per batch of tensors (#6135) |
| 2359 | b80cf3b2d1dee0ad325f7a794fecc66befce7336 | 970a48060ab9a6cc67aa063870323781c2a7bd7d | 2024-03-19T10:21:54+02:00 | Georgi Gerganov | | common : disable repeat penalties by default (#6127) |
| 2360 | 104f5e0fc156d48476258295457cafeec2a2af10 | 5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c | 2024-03-18T16:40:22+01:00 | Felix | | clip : fix memory leak (#6138) |
| 2361 | ac9ee6a4ad740bc1ee484ede43e9f92b5af244c1 | 4f6d1337ca5a409dc74aca8c479b7c34408a69c0 | 2024-03-18T13:45:38+02:00 | Georgi Gerganov | | ci : disable stale issue messages (#6126) |
| 2362 | 2bf8d0f7c4cc1235755ad06961ca761e458c5e55 | 496bc79bc2b79bfd6124b8687a8dbd6a646e9b06 | 2024-03-18T11:03:04+01:00 | slaren | | backend : offload large batches to GPU (#6083) |
| 2363 | 3a6efdd03c46c5ba08e43880d34260c02dd9999b | d01b3c4c32357567f3531d4e6ceffc5d23e87583 | 2024-03-18T09:04:41+01:00 | Romain D | | convert : use f32 outtype for bf16 tensors (#6106) |
| 2364 | cd776c37c945bf58efc8fe44b370456680cb1b59 | dc0f6125487dcfbff913360f9d877bc0ccf6aa57 | 2024-03-17T19:51:57+02:00 | Georgi Gerganov | | ci : close all stale issues at once (#6115) |
| 2365 | dc0f6125487dcfbff913360f9d877bc0ccf6aa57 | c47cf414efafb8f60596edc7edb5a2d68065e992 | 2024-03-18T01:12:22+08:00 | GainLee | | ggml:fix finding transfer queue family index error (#6094) |
| 2366 | b5f4ae09c3244ae1644b67c03ed9f4227ab25ad2 | dfbfdd60f90207404039c6578d709231496831d9 | 2024-03-16T16:46:29+01:00 | Daniel Bevenius | | gritlm : add initial README.md (#6086) |
| 2367 | 15961ec04dbd59d21d8984d42e4c0f7e7e7d320a | a56d09a4407f29c21e149b44fd5308f83aa1cb09 | 2024-03-16T11:39:15-04:00 | DAN™ | | common : refactor nested if causing error C1061 on MSVC (#6101) |
| 2368 | a56d09a4407f29c21e149b44fd5308f83aa1cb09 | d84c48505f60bcd358b82a751d40418c4d235643 | 2024-03-16T13:20:53+01:00 | Pierrick Hymbert | | ci : close inactive issue with workflow (#6053) |
| 2369 | d84c48505f60bcd358b82a751d40418c4d235643 | 877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 | 2024-03-15T22:14:16+01:00 | slaren | | llama : fix Baichuan2 13B (#6092) |
| 2370 | 877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 | 12247f4c69a173b9482f68aaa174ec37fc909ccf | 2024-03-15T13:43:02-07:00 | Theia Vogel | | llama : add support for control vectors (#5970) |
| 2371 | 12247f4c69a173b9482f68aaa174ec37fc909ccf | 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc | 2024-03-15T16:41:22-04:00 | Andrew Canis | | llama : add Command-R support (#6033) |
| 2372 | 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc | 3020327f6cd6d2ce50528dd65f4b199d2ea8b1ae | 2024-03-15T22:31:05+08:00 | Ting Lou | | llava : change API to pure C style for Rust FFI bindgen (#6079) |
| 2373 | 46acb3676718b983157058aecf729a2064fc7d34 | 131b0584096ee9df4d07cb28759dfea6efe6475f | 2024-03-15T18:53:53+08:00 | Neo Zhang Jianyu | | fix set main gpu error (#6073) |
| 2374 | 753e36f650fa2a5869f89188d9ee745dc74cf14b | 7ce2c77f88e1ca66ec48417e56f91746bac018c2 | 2024-03-15T09:26:20Z | AidanBeltonS | | [SYCL] Fix non-intel device selection (#6042) |
| 2375 | 7ce2c77f88e1ca66ec48417e56f91746bac018c2 | aab606a11fc0a9740a7f297521c3eef851dfb351 | 2024-03-15T02:46:51-06:00 | Ondřej Čertík | | gguf : add support for I64 and F64 arrays (#6062) |
| 2376 | 4755afd1cbd40d93c017e5b98c39796f52345314 | 6e0438da3cc95b89cdbf55f45fa4e324d9076792 | 2024-03-14T22:58:41+02:00 | Georgi Gerganov | | llama : fix integer overflow during quantization (#6063) |
| 2377 | 6e0438da3cc95b89cdbf55f45fa4e324d9076792 | 727107707a73b3dc8a497cf9fc9405722c16dd2b | 2024-03-14T14:29:32-04:00 | Steve Grubb | | gguf : fix resource leaks (#6061) |
| 2378 | 69ff61397d2b7b550dcdda4a35b35128892408b0 | 044ec4b2a567f649459ccd20af2f387c784faa51 | 2024-03-14T17:21:56+01:00 | Michael Podvitskiy | | llama : support models without vocabulary (#5798) |
| 2379 | 77178eedc83d49f31bf757d8e12315d76460be78 | 15a333260ab637a040ed0864c206a2ceaf806bb8 | 2024-03-14T13:32:14+02:00 | Georgi Gerganov | | gguf-py : fix dtype check (#6045) |
| 2380 | 43241adf22e8231ffaf3827d2c9310cc0ffd5ac5 | a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 | 2024-03-14T12:15:39+01:00 | Pierrick Hymbert | | server: disable debug release type sanitizer, simplify trigger (#6047) |
| 2381 | a44bc969e4cd62ca9f4332e17fe3c51f2093e7c6 | 2c4fb69246834503db7b78bcbedcef506bbc60c4 | 2024-03-14T13:13:06+02:00 | Georgi Gerganov | | llama : fix typo |
| 2382 | 2c4fb69246834503db7b78bcbedcef506bbc60c4 | 3ca23481dd309bd51cc31c73a4cc34f922cc372f | 2024-03-14T11:56:48+01:00 | Michael Podvitskiy | | llama : optimize defrag moves + fix fragmentation calculation (#6037) |
| 2383 | 381da2d9f0940d7009e3e918bed36338c8ff2fbb | 0fd6c1f015f6cccf3b527f7dbd8386a434728126 | 2024-03-14T11:55:23+02:00 | Georgi Gerganov | | metal : build metallib + fix embed path (#6015) |
| 2384 | 76a936c8939c249a7c3e8e66dfefbab13eae194f | 463628372d5fe3a0c1e5864aa5fc57deb7387039 | 2024-03-13T20:33:56+02:00 | Georgi Gerganov | | readme : update API changes and hot topics |
| 2385 | f30ea47a87ed4446ad55adb265755dc9102956a2 | d8fd0ccf6ac8b07791ffd1575eed436930854ae3 | 2024-03-13T18:54:21+01:00 | slaren | | llama : add pipeline parallelism support (#6017) |
| 2386 | d8fd0ccf6ac8b07791ffd1575eed436930854ae3 | b3d978600f07f22e94f2e797f18a8b5f6df23c89 | 2024-03-13T14:58:30+01:00 | slaren | | test-backend-ops : skip CPU backend by default (#6028) |
| 2387 | 184215e783dfad76aded2c68244c327a5c507df5 | 48358b2e5b3983c41ba7e61a493e84d3901dc7b9 | 2024-03-12T13:49:55+02:00 | Georgi Gerganov | | ggml : fix UB in IQ2_S and IQ3_S (#6012) |
| 2388 | 48358b2e5b3983c41ba7e61a493e84d3901dc7b9 | 5cdb371731caa2c41fcca42d4d2d43f94f6883b4 | 2024-03-12T11:15:05+02:00 | Georgi Gerganov | | sycl : update IQ1_S kernels (WIP - not working!) (#5995) |
| 2389 | 5cdb371731caa2c41fcca42d4d2d43f94f6883b4 | 44ca159faf4fbe1a7ace13a962845ba7cdfd95ec | 2024-03-11T20:59:03+01:00 | gliptic | | grammar : fix unnecessarily retained pointer to rules (#6003) |
| 2390 | 44ca159faf4fbe1a7ace13a962845ba7cdfd95ec | 05b06210c954491cf0f12034b0a62bd4d69ce78b | 2024-03-11T16:53:15+01:00 | Kawrakow | | 1.5 bit: we can do even better (#5999) |
| 2391 | 05b06210c954491cf0f12034b0a62bd4d69ce78b | 83796e62bc9f6caae6228168e359890f51e60fee | 2024-03-11T17:49:47+02:00 | Georgi Gerganov | | llama : more consistent names of count variables (#5994) |
| 2392 | 83796e62bc9f6caae6228168e359890f51e60fee | 828defefb66fc8a25404f5de845897145bf34061 | 2024-03-11T17:47:47+02:00 | Georgi Gerganov | | llama : refactor unicode stuff (#5992) |
| 2393 | caa106d4e05a0ab94225c220b81f9e2cd522339b | 3202361c5b1ba15e695b31209567ef42c22c5c32 | 2024-03-11T10:56:41+01:00 | Xuan Son Nguyen | | Server: format error to json (#5961) |
| 2394 | 3202361c5b1ba15e695b31209567ef42c22c5c32 | 332bdfd7980718abf664bfa5460f2288a3314984 | 2024-03-11T10:28:51+01:00 | Michael Podvitskiy | | ggml, ci : Windows ARM runner and build fixes (#5979) |
| 2395 | ecab1c75de68de7c41c254e2ae170d3b07bee6d4 | ee35600b9061b1ea0c4ea87fce6844297632b2a8 | 2024-03-11T10:00:08+02:00 | Gilad S | | cmake : fix subdir for `LLAMA_METAL_EMBED_LIBRARY` (#5985) |
| 2396 | ee35600b9061b1ea0c4ea87fce6844297632b2a8 | be858f620508385ad12d0e5e862010e666ca729c | 2024-03-11T09:56:47+02:00 | Georgi Gerganov | | llama : fix F16/F32 downcast + improve names (#5980) |
| 2397 | be858f620508385ad12d0e5e862010e666ca729c | ef3ced26a3817d92890b97b83acaeb018ade02d0 | 2024-03-11T07:51:49+01:00 | Kawrakow | | Better 1.5 bit quantization (#5971) |
| 2398 | ef3ced26a3817d92890b97b83acaeb018ade02d0 | 3814a07392d2bdc22911652bc7c2f9bdb0ce042e | 2024-03-11T10:27:56+05:30 | Abhilash Majumder | | [SYCL] Add q3_s and q1_s (#5886) |
| 2399 | 3814a07392d2bdc22911652bc7c2f9bdb0ce042e | bb6d00bbf98476215596b9df3870b5504ef5a29a | 2024-03-11T01:13:57Z | AidanBeltonS | | [SYCL] Add support for SYCL Nvidia target (#5738) |
| 2400 | 7ab7b733bb48250b2df26c12b00256ef42c76932 | d9f65c97c3dc3aa6fa27470b8c6e69b437ec1a27 | 2024-03-11T04:03:17+08:00 | Dean | | android : fix utf8 decoding error (#5935) |
| 2401 | df4dc3e7cb43162862f339525638ba4febcb6158 | bf47a5eefc669fdba71af096942af999bc1167d4 | 2024-03-08T23:45:07+02:00 | Georgi Gerganov | | ggml : try fix 32-bit arm compat (whisper/1938) |
| 2402 | fa8a809a9119411bc9c3f00026550d0343f4d9b7 | bcebd7dbf62fd7b293d5ed089023e4e733269c71 | 2024-03-10T18:17:47+01:00 | Pierrick Hymbert | | server: ci: windows build and tests (#5968) |
| 2403 | bcebd7dbf62fd7b293d5ed089023e4e733269c71 | 2960eae847f8dbde23be6d170a61bcf44ebf32de | 2024-03-10T11:56:30-04:00 | DAN™ | | llama : add support for GritLM (#5959) |
| 2404 | 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 | 77d1ac7e00bf049b9f2bba1b5a310a78318c49c4 | 2024-03-09T23:41:49+01:00 | Pierrick Hymbert | | server: benchmark: chat/completions scenario and other llm servers comparison (#5941) |
| 2405 | 8380ecfb219c2e73cc706fcc83935b7c806cc7c3 | 58308a0ecce7cc261b802f4803c38d420063db21 | 2024-03-09T17:36:20+02:00 | Georgi Gerganov | | ggml : fix unnecessary f32 -> f16 -> f32 casts (mmla) (#5951) |
| 2406 | 58308a0ecce7cc261b802f4803c38d420063db21 | 5b09797321430f08caf0473143a962916ab2ea89 | 2024-03-09T17:34:15+02:00 | Georgi Gerganov | | server : fix metrics init (#5964) |
| 2407 | 5b09797321430f08caf0473143a962916ab2ea89 | 97c09585d65a95864773b4d25d66d0f708baf38d | 2024-03-09T15:53:59+02:00 | Georgi Gerganov | | ggml : remove old quantization functions (#5942) |
| 2408 | 97c09585d65a95864773b4d25d66d0f708baf38d | fb215c3832236fec7380c4fb618bd7154cb196ef | 2024-03-09T15:47:47+02:00 | Georgi Gerganov | | server : clarify some items in the readme (#5957) |
| 2409 | 0db32beaf09d90b8959d3d0cc493ed1e45685353 | 8a3012a4ad08112bb3dc3f1399afec4e93780c44 | 2024-03-09T11:16:53Z | Alexey Parfenov | | server : fix passing prompt as tokens (#5955) |
| 2410 | 8a3012a4ad08112bb3dc3f1399afec4e93780c44 | 9674aaf35cb81478eb38c3f3ebde713ec72fbb79 | 2024-03-09T12:47:57+02:00 | Georgi Gerganov | | ggml : add ggml-common.h to deduplicate shared code (#5940) |
| 2411 | 950ba1ab84db199f0bbdecdb2bb911f35261b321 | e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea | 2024-03-09T11:27:53+01:00 | Xuan Son Nguyen | | Server: reorganize some http logic (#5939) |
| 2412 | c2101a2e909ac7c08976d414e64e96c90ee5fa9e | 515f7d0d4fce41c752fc253acf30707c3be2531e | 2024-03-08T17:31:00-05:00 | compilade | | llama : support Mamba Selective State Space Models (#5328) |
| 2413 | 515f7d0d4fce41c752fc253acf30707c3be2531e | 76e868821a94072fbc87cb1fcca291694319eae8 | 2024-03-08T10:53:37-05:00 | compilade | | llama : fix quantization of shared token_embd (#5944) |
| 2414 | 76e868821a94072fbc87cb1fcca291694319eae8 | e457fb3540e0aaec47cfde0abf784c213f9216ee | 2024-03-08T12:25:04+01:00 | Pierrick Hymbert | | server: metrics: add llamacpp:prompt_seconds_total and llamacpp:tokens_predicted_seconds_total, reset bucket only on /metrics. Fix values cast to int. Add Process-Start-Time-Unix header. (#5937) |
| 2415 | af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd | 581ed5c4fe3a8909aaa8313633ac443f471ba755 | 2024-03-08T12:40:02+02:00 | Georgi Gerganov | | server : fix EOS token detection with disabled cache (#5938) |
| 2416 | 581ed5c4fe3a8909aaa8313633ac443f471ba755 | 6cdabe652695167263c8b447520987b11856f7ca | 2024-03-08T04:35:04-05:00 | UEXTM.com | | log : fix MSVC compile errors (#5643) |
| 2417 | 6cdabe652695167263c8b447520987b11856f7ca | 89fb735fcfd21781a8194b211cf32824beb3f71f | 2024-03-07T16:32:38+02:00 | Georgi Gerganov | | llama-bench : add embeddings option (#5924) |
| 2418 | 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 | ceca1aef0738b57951cd12c603c3477e75312dec | 2024-03-07T11:41:53+02:00 | Georgi Gerganov | | server : refactor (#5882) |
| 2419 | ceca1aef0738b57951cd12c603c3477e75312dec | e04e04f8fad549bb0b3ec1c91f0413aeb08baf29 | 2024-03-07T16:34:31+08:00 | Neo Zhang Jianyu | | [SYCL] fix error when set main gpu to non-zero (#5901) |
| 2420 | e04e04f8fad549bb0b3ec1c91f0413aeb08baf29 | e25fb4b18fcedb9bed6be4585cf842e9a669b28b | 2024-03-06T15:42:23-05:00 | Jared Van Bortel | | ggml : use SYS_get_cpu if SYS_getcpu is not defined (#5906) |
| 2421 | bd836944f826f07e19b7edcf994a78728da49c1c | 3de31677d36aa4f82d4d99898902d7bcf398e666 | 2024-03-05T11:56:37-05:00 | Jared Van Bortel | | quants : use MM256_SET_M128I consistently to fix gcc 7 build (#5889) |
| 2422 | 61d1c88e155515dd03940913a5707ea84a8b119b | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 2024-03-05T13:33:42+01:00 | 0cc4m | | Vulkan Improvements (#5835) |
| 2423 | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 6a87ac3a52668e117d97bcea07b529c93188b303 | 2024-03-05T16:08:35+08:00 | Neo Zhang Jianyu | | [SYCL] fix mul_mat fault in CI/unit-test (#5862) |
| 2424 | 6a87ac3a52668e117d97bcea07b529c93188b303 | 29eee404746e4696143a4f3a642660a4793a15d8 | 2024-03-05T15:12:23+09:00 | Minsoo Cheong | | fix editorconfig check break (#5879) |
| 2425 | 29eee404746e4696143a4f3a642660a4793a15d8 | 1d41d6f7c2a666eb9c18a686a4684c4b03289bf3 | 2024-03-04T19:23:06-08:00 | Jeffrey Quesnelle | | fix speculative decoding build on windows (#5874) |
| 2426 | 29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 | e0843afe1b37890b631bc7d3d2da2ed36c862b91 | 2024-03-04T22:31:20+02:00 | Georgi Gerganov | | llama : fix embeddings (#5796) |
| 2427 | e0843afe1b37890b631bc7d3d2da2ed36c862b91 | a1c6d96ed8f906aa1cda439f7386b1171a22bf9f | 2024-03-04T21:50:50+02:00 | Georgi Gerganov | | flake : fix |
| 2428 | a1c6d96ed8f906aa1cda439f7386b1171a22bf9f | efd8533ef8d0752cef7119eb5dbee412c4dba270 | 2024-03-04T20:53:27+02:00 | Georgi Gerganov | | ggml : fix unknown status (#0) |
| 2429 | 9fa262734733573fa629ffc97dfcb971fe3f4832 | fe52be11e35358d2fd249f19d7ef5b6f9c08b16b | 2024-03-04T10:05:42+01:00 | Michael Podvitskiy | | ggml : introduce ggml_status (ggml/750) |
| 2430 | 6d341ab6c53cd51f2921d986d0090cc8b049b39a | 4ffcdce2ff877ebb683cd217ea38faf20faa5ffe | 2024-03-05T03:24:00+09:00 | Minsoo Cheong | | speculative : implement stochastic speculative sampling (#5625) |
| 2431 | 7d43c585dc174bb586775c22c15e5db9242b5b4b | 82f3e668adafba647de703f835991e91a96b5ac4 | 2024-03-03T20:23:52+08:00 | leejet | | add some new ops, fix some operators and add batch operations to certain operators. (ggml/747) |
| 2432 | 82f3e668adafba647de703f835991e91a96b5ac4 | 5a51cc1bb4592f0d71f9af89cd08b11a066ba447 | 2024-03-04T03:08:19-05:00 | DAN™ | | common : use LLAMA_DEFAULT_SEED (#5855) |
| 2433 | 67be2ce1015d070b3b2cd488bcb041eefb61de72 | 231ae28f078c3148d097b301f2145f1e3e816cc1 | 2024-03-03T14:26:18+01:00 | slaren | | cuda : fix data race in soft max (#5853) |
| 2434 | 231ae28f078c3148d097b301f2145f1e3e816cc1 | 475df1d6cf817060028d3ff763cb8097d4ec40d6 | 2024-03-03T12:44:03+02:00 | Georgi Gerganov | | readme : add API changes section |
| 2435 | de9692a7d2db66e29e5cb373c6551acc49145ccd | e6029348e86c3810d4435faee54ba822cb43e2ef | 2024-03-03T03:41:55-05:00 | compilade | | llama : fix llama_copy_state_data with fragmented KV cache (#5840) |
| 2436 | 9731134296af3a6839cd682e51d9c2109a871de5 | 4a6e2d6142ab815c964924896891e9ab3e050632 | 2024-03-02T22:00:14+01:00 | Pierrick Hymbert | | server: tests: passkey challenge / self-extend with context shift demo (#5832) |
| 2437 | 4a6e2d6142ab815c964924896891e9ab3e050632 | 494c87032613e31c0be99b2735e732871f2c4e4d | 2024-03-02T20:52:25+01:00 | Michael Podvitskiy | | llama : add abort_callback to interrupt computation (#5409) |
| 2438 | 494c87032613e31c0be99b2735e732871f2c4e4d | 4d4d2366fc9c54d4a275065cfe9299c6cf7c5b78 | 2024-03-02T20:00:49+02:00 | Georgi Gerganov | | ggml : fix IQ3_S AVX implementation (#5834) |
| 2439 | bbde6eb2561153aabbdfac5001c690fe00cad639 | ef2cd694c4155fbf25bae61c5178c47eb3676dba | 2024-03-02T17:00:51+02:00 | Kawrakow | | ggml : IQ3_S improvements (#5829) |
| 2440 | 802da0091ba646ecf02e1a8fae2da0b8e76409bd | 715641391dda1ff9762dc5d99d9a30acce99f2c6 | 2024-03-02T08:42:56-05:00 | compilade | | llama : fix segfault from unknown model arch name (#5820) |
| 2441 | 715641391dda1ff9762dc5d99d9a30acce99f2c6 | 9bf297a02bfbd474e51912409a470dd797e2fe13 | 2024-03-02T19:49:30+08:00 | Neo Zhang Jianyu | | Support multiple GPUs (split mode) on SYCL backend (#5806) |
| 2442 | 9bf297a02bfbd474e51912409a470dd797e2fe13 | cb5e8f7fc4ee57d4bcccafbe04a82cededd35486 | 2024-03-02T00:11:06-05:00 | crasm | | workflows : remove nocleanup arg for check-requirements.sh (#5826) |
| 2443 | c29af7e2252d288f2ea58a7d437c1cb7c0abf160 | 38d16b142624bdd7c41d9955752b7f7b59c5e048 | 2024-03-02T01:00:46+05:30 | Sourab Mangrulkar | | llama : add StarCoder2 support (#5795) |
| 2444 | c2224f003bf9cf558b1a3c57033563e11a4de9a5 | e7433867288d2f142cffe596f3751bda5d7ee2c7 | 2024-03-01T18:00:00+01:00 | ddpasa | | ggml-vulkan: fix VULKAN_CHECK_RESULTS flag, which was previously broken (#5813) |
| 2445 | e7433867288d2f142cffe596f3751bda5d7ee2c7 | f49a5356865ced0eca1df9f9d84631dfef71b9dc | 2024-03-01T06:08:08-08:00 | kunal-vaishnavi | | gemma : fix bfloat16 -> float16 conversion issue (#5810) |
| 2446 | f49a5356865ced0eca1df9f9d84631dfef71b9dc | 3ab8b3a92ede46df88bc5a2dfca3777de4a2b2b6 | 2024-03-01T22:48:56+09:00 | Miwa / Ensan | | common : fix flag `--logits-all` to `--all-logits` (#5805) |
| 2447 | 9600d59e010c18f5872580a21734ea1bf1968d04 | 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f | 2024-03-01T03:15:36-06:00 | Douglas Hanley | | unicode : switch to multimap based nfd_map (#5799) |
| 2448 | f105471ef6aa4727afac8240da398590d7277f45 | 38d152160898b0173ffe4dc7df5daadcbd2eceb0 | 2024-03-01T09:59:43+02:00 | Georgi Gerganov | | server : fix newlines in help (#5785) |
| 2449 | 052051d8ae4639a1c3c61e7da3237bcc572469d4 | d5ab29757ebc59a30f03e408294ec20628a6374e | 2024-02-29T21:42:11+01:00 | Xuan Son Nguyen | | Server: normalize naming (#5779) |
| 2450 | 2774b0c97427ee3ad3e2ee121354d078794e89d9 | 5f706718566e3a5147916dc381f3b99de0ffad47 | 2024-02-25T20:41:35+01:00 | slaren | | add google magika inference example (ggml/748) |
| 2451 | 5f706718566e3a5147916dc381f3b99de0ffad47 | a693bea1e6762a17b78b6ddf4611e54136941ea2 | 2024-02-24T11:27:36-05:00 | UEXTM.com | | Introduce backend GUIDs (ggml/743) |
| 2452 | adcb12a9bad87bc96f2f158c95892b3d04aa7ffb | 177628bfd85565070916ad66a5ac4071ee0527d8 | 2024-02-28T03:52:56-05:00 | compilade | | llama : fix non-quantization of expert gating tensors (#5754) |
| 2453 | 7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af | cb49e0f8c906e5da49e9f6d64a57742a9a241c6a | 2024-02-28T10:37:02+02:00 | Kawrakow | | ggml : make i-quants work with super-blocks of 64 (CPU,Metal) (#5760) |
| 2454 | cb49e0f8c906e5da49e9f6d64a57742a9a241c6a | 0becb22ac05b6542bd9d5f2235691aa1d3d4d307 | 2024-02-27T19:16:49+02:00 | Kawrakow | | Attempt to fix android build (#5752) |
| 2455 | 0becb22ac05b6542bd9d5f2235691aa1d3d4d307 | c24a2a6e6005e5d424301525a42ba45a4a362d30 | 2024-02-27T16:34:24+02:00 | Kawrakow | | IQ4_XS: a 4.25 bpw quantization (#5747) |
| 2456 | 1f30b7a9f1b86baa455072d3182b9ebeee0cd845 | 9d533a77d0c3850ce09d736bc1baa67fd6ad27b3 | 2024-02-27T06:50:18-06:00 | Engininja2 | | ggml-quants : fix avx2 iq1_s vec_dot when compiled with gcc (#5742) |
| 2457 | 9d533a77d0c3850ce09d736bc1baa67fd6ad27b3 | cbbd1efa06f8c09f9dff58ff9d9af509cc4c152b | 2024-02-27T14:35:51+02:00 | Georgi Gerganov | | llama : fix defrag bugs + add parameter (#5735) |
| 2458 | cbbd1efa06f8c09f9dff58ff9d9af509cc4c152b | b11a93df41921846a10628a7c306d5c82a549939 | 2024-02-27T10:03:06+08:00 | le.chang | | Makefile: use variables for cublas (#5689) |
| 2459 | b11a93df41921846a10628a7c306d5c82a549939 | a33e6a0d2a66104ea9a906bdbf8a94d050189d91 | 2024-02-26T23:15:48+01:00 | Xuan Son Nguyen | | fix server hangs on empty prompt (#5733) |
| 2460 | 47bb7b48c7cec9d8f57d56812ce811ec130b89a3 | c4d7f8178608440506e5489bae0109e4ca12e44a | 2024-02-26T15:36:38+01:00 | Johannes Gäßler | | CUDA: fix DEBUG_CUDA_MALLOC (#5729) |
| 2461 | e849078c6e09e72fdd2c95ba61f5fba9a7b2d9ef | 67fd33132fab93e6c2087bd6fa656a8a57419efa | 2024-02-26T14:02:11Z | AidanBeltonS | | [SYCL] Add support for soft_max ALiBi (#5639) |
| 2462 | 4804215cb833841ffb15a710a16b77ca0a29eb4b | 8a533f0d9078396ebaee9ba213038a1322976dee | 2024-02-26T11:41:34+01:00 | Pierrick Hymbert | | server: CI fix trailing space (#5728) |
| 2463 | 269de86ba073b5dc9ce687c11a3bc4d7d873b962 | c39373398803c669056304090050fe3f44b41bf9 | 2024-02-26T08:30:17+02:00 | Georgi Gerganov | | llama : fix Gemma rope type (#5691) |
| 2464 | bf08e00643fd529f748f0a858fd79f3061e3fa18 | f7625019c51ca437a5840576d92362cfa710e4a2 | 2024-02-25T22:12:24+02:00 | Georgi Gerganov | | llama : refactor k-shift implementation + KV defragmentation (#5691) |
| 2465 | f7625019c51ca437a5840576d92362cfa710e4a2 | abbabc5e51d0d4656b438aec10b7fae9479ef37d | 2024-02-25T13:43:50-05:00 | compilade | | server : fix crash when system prompt is bigger than batch size (#5714) |
| 2466 | abbabc5e51d0d4656b438aec10b7fae9479ef37d | f1a98c52546d009f742bdec2154c2a314ea950a6 | 2024-02-25T19:43:00+01:00 | Radosław Gryta | | ggml-quants : provide ggml_vqtbl1q_u8 for 64bit compatibility (#5711) |
| 2467 | f1a98c52546d009f742bdec2154c2a314ea950a6 | 7d548a1827f6fc6aece6db74c9d112da42c40d68 | 2024-02-26T00:46:49+08:00 | kwin1412 | | make : fix nvcc version is empty (#5713) |
| 2468 | 930b1780269a69948d106e2d1b838ab7661f679a | d52d7819b8ced70c642a88a59da8c78208dc58ec | 2024-02-25T13:50:32+01:00 | Pierrick Hymbert | | server: logs - unified format and --log-format option (#5700) |
| 2469 | d52d7819b8ced70c642a88a59da8c78208dc58ec | 12894088170f62e4cad4f8d6a3043c185b414bab | 2024-02-25T13:49:43+01:00 | Pierrick Hymbert | | server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708) |
| 2470 | 12894088170f62e4cad4f8d6a3043c185b414bab | ab336a9d5e5352ecdcdf4c12d2d54cf4ef82ce31 | 2024-02-25T11:53:11+01:00 | Radosław Gryta | | cmake : fix compilation for Android armeabi-v7a (#5702) |
| 2471 | 69917dfa55674c608360638bb4d6a12a315e2810 | 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e | 2024-02-25T10:54:04+01:00 | Anas Ahouzi | | py : fix StableLM conversion after config.json changes (#5703) |
| 2472 | 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e | 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 | 2024-02-24T19:16:04+01:00 | Pierrick Hymbert | | server: continue to update other slots on embedding concurrent request (#5699) |
| 2473 | 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | 2024-02-24T16:23:52+02:00 | Kawrakow | | IQ3_S: a much better alternative to Q3_K (#5676) |
| 2474 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | fd43d66f46ee3b5345fb8a74a252d86ccd34a409 | 2024-02-24T12:28:55+01:00 | Pierrick Hymbert | | server: init functional tests (#5566) |
| 2475 | 54fbcd2ce6c48c9e22eca6fbf9e53fb68c3e72ea | 15499eb94227401bdc8875da6eb85c15d37068f7 | 2024-02-23T13:39:14-05:00 | Jared Van Bortel | | convert : fix missing ftype for gemma (#5690) |
| 2476 | 7e4f339c404dbe029d4a117c03b37a9bf646cf0e | 334f76fa385ed81095165e5ae068756214893901 | 2024-02-22T23:21:39+02:00 | Georgi Gerganov | | ggml : always define ggml_fp16_t as uint16_t (#5666) |
| 2477 | 5a9e2f60ba3d8362ba17c77ac3092906d49b813f | 373ee3fbbabc4c1508eed4f5c3795b23a20939a3 | 2024-02-22T20:13:25+02:00 | Georgi Gerganov | | py : minor fixes (#5668) |
| 2478 | 3a03541cedea474fa9d41214484cc3fbcf468a9e | 56d03d92be57f5880b9ed94542d87bb6effae31f | 2024-02-22T13:54:03+02:00 | Georgi Gerganov | | minor : fix trailing whitespace (#5638) |
| 2479 | a46f50747b2028f7f9c9883b26bfba12bf92556e | c5688c6250430d2b8e0259efcf26c16dfa4c1f46 | 2024-02-22T09:33:24+01:00 | Xuan Son Nguyen | | server : fallback to chatml, add AlphaMonarch chat template (#5628) |
| 2480 | 973053d8b0d04809836b3339a50f68d9c842de90 | 7c8bcc11dc61cf5930b70cd0168b84afcebe12a9 | 2024-02-22T00:42:09+01:00 | slaren | | llama : fix loading models with shared tok_embd and output (#5651) |
| 2481 | 7c8bcc11dc61cf5930b70cd0168b84afcebe12a9 | 7fe4678b0244ba7b03eae66ebeaa947e2770bb1a | 2024-02-22T00:31:00+01:00 | Xuan Son Nguyen | | Add docs for llama_chat_apply_template (#5645) |
| 2482 | 7fe4678b0244ba7b03eae66ebeaa947e2770bb1a | ba2135ccae7462470b3865c6e41d2e1d734eac05 | 2024-02-21T22:52:39+01:00 | slaren | | llama : fix session save/load with quantized KV (#5649) |
| 2483 | 1ecea255ebb70750b52688393f37a63606b90e3f | a00a35cef93e057eace8351a667d14d152a91ebc | 2024-02-21T15:47:48+01:00 | Pierrick Hymbert | | server: health: fix race condition on slots data using tasks queue (#5634) |
| 2484 | eccd7a26ddbff19e4b8805648f5f14c501957859 | c14f72db9c62d71d35eb1c141745c0bd0cb27b49 | 2024-02-21T16:17:10+02:00 | Georgi Gerganov | | sync : ggml (#5633) |
| 2485 | cc6cac08e38e32bf40bbe07e9e8f8f0130b5fd94 | 580111d42b3b6ad0a390bfb267d6e3077506eb31 | 2024-02-21T14:36:57+01:00 | Daniel Bevenius | | llava : add --skip-unknown to 1.6 convert.py (#5632) |
| 2486 | a14679cc30c785e75d38028bae6ec39c6209ddef | 6560bed3f066c876682464762cad90f1e28e3f1b | 2024-02-21T11:39:52+02:00 | Kawrakow | | IQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590) |
| 2487 | 6560bed3f066c876682464762cad90f1e28e3f1b | 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df | 2024-02-20T11:07:22-08:00 | CJ Pais | | server : support llava 1.6 (#5553) |
| 2488 | 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df | 4ed8e4fbef6a15afd993bfcd9ffa279841e18ef1 | 2024-02-20T20:06:17+01:00 | slaren | | make : fix debug build with CUDA (#5616) |
| 2489 | 9c405c9f9a7cfd23511fd6b2de05dc72481119b4 | 5207b3fbc500f89dfe528693e96540956dbaed96 | 2024-02-20T15:58:27+01:00 | Xuan Son Nguyen | | Server: use llama_chat_apply_template (#5593) |
| 2490 | c0a8c6db371cb3e4379900867b948879f5842201 | b9111bd209c7b11b0592450a6ed2e0ca545b2c84 | 2024-02-20T08:48:19+01:00 | Pierrick Hymbert | | server : health endpoint configurable failure on no slot (#5594) |
| 2491 | b9111bd209c7b11b0592450a6ed2e0ca545b2c84 | 633782b8d949f24b619e6c68ee37b5cc79167173 | 2024-02-20T07:01:25Z | AidanBeltonS | | Update ggml_sycl_op_mul_mat_vec_q (#5502) |
| 2492 | 42f664a3825dfde13a32c3577ab66d10c56f3aa6 | 5dde5408978eda22242b87e22e306d1c2d1a5834 | 2024-02-03T18:00:11Z | Mathijs de Bruin | | Resolve ErrorIncompatibleDriver with Vulkan on MacOS. |
| 2493 | 40c3a6c1e11040088b4a1ce0abc4651cb3011dd4 | f24ed14ee0ce28dfe98115c378b37da144912016 | 2024-02-19T23:40:26+01:00 | slaren | | cuda : ignore peer access already enabled errors (#5597) |
| 2494 | d0e3ce51f45bd6a646da1952d7e5d143a087db3e | 68a6b98b3c8af7e5baade3ee45fe1d2c7b9323a9 | 2024-02-19T14:45:41+02:00 | Georgi Gerganov | | ci : enable -Werror for CUDA builds (#5579) |
| 2495 | 68a6b98b3c8af7e5baade3ee45fe1d2c7b9323a9 | 70d45af0efce9ed360e1858b827989d971dd9caf | 2024-02-19T13:41:51+02:00 | Georgi Gerganov | | make : fix CUDA build (#5580) |
| 2496 | 70d45af0efce9ed360e1858b827989d971dd9caf | 13e2c771aa4212cd5405cf310203848d50f7f859 | 2024-02-19T02:37:10-08:00 | valiray | | readme : fix typo in README-sycl.md (#5353) |
| 2497 | 13e2c771aa4212cd5405cf310203848d50f7f859 | f53119cec4f073b6d214195ecbe1fad3abdf2b34 | 2024-02-19T14:45:18+05:30 | Abhilash Majumder | | cmake : remove obsolete sycl compile flags (#5581) |
| 2498 | f53119cec4f073b6d214195ecbe1fad3abdf2b34 | 70847553963c85e86051d06df848236829f5f951 | 2024-02-19T10:34:10+02:00 | Georgi Gerganov | | minor : fix trailing whitespace (#5538) |
| 2499 | 70847553963c85e86051d06df848236829f5f951 | 4480542b2271ba1438f0daff8e5f3a74b1dc8609 | 2024-02-19T09:31:59+01:00 | Daniel Bevenius | | llava : avoid changing the original BakLLaVA model (#5577) |
| 2500 | 4480542b2271ba1438f0daff8e5f3a74b1dc8609 | 11b12de39bd787c0494da0cd405958fdfedc29c4 | 2024-02-19T03:25:38-05:00 | NawafAlansari | | baby-llama : allocate graphs in ggml_context (#5573) |